Agent从入门到开发

这周的两件大事包括K3模型发布以及pi-agent逐渐走入视野。这无疑又给Agent应用的热度推上新的高峰

Agent发展

Loop Engineering

AddyOsmani.com - Loop Engineering

过去两年,AI 开发的重点正在不断变化:从研究如何写好提示词(Prompt),逐步发展到组织上下文(Context)、编排工具与流程(Harness),再到构建能够自主运行、持续交付结果的循环系统(Loop)

人不再逐轮手敲 Prompt,而是写一个外循环系统,由系统定时/事件触发 → 派发 Agent → 验证产出 → 记状态 → 决定继续或停止。

1
2
3
4
5
6
7
Prompt:怎么问 AI

Context:给 AI 什么信息

Harness:如何组织 AI 的能力

Loop:如何让 AI 持续创造结果

Loop Engineering 并非凭空而来,它是 AI 编程工具能力演进的自然结果。

阶段代表工具工作方式瓶颈
第一代:自动补全GitHub Copilot 早期版本补全当前行或函数,人类主导所有决策只能辅助,不能自主
第二代:对话式ChatGPT、Claude.ai问一句,答一句,人类手动推进每一步人类成为瓶颈,速度受限于打字速度
第三代:Agent 自主循环Claude Code、OpenAI Codex AgentAgent 自主规划、执行、验证,循环迭代直到完成如何设计让 Loop 可靠运行的系统

第三代工具的出现意味着,工程师的核心竞争力从会写提示词变成了会设计 Loop。

Loop Engineering 是设计、运营和持续改进反馈循环的工程实践,这些循环使 AI 编程 Agent 能够自主完成规划、执行代码修改、观察结果并在多轮迭代中完成任务。

内循环 vs 外循环

  • 内循环(Agent 自带):感知 → 推理 → 行动 → 观察
  • 外循环(你设计的):触发 → 发现任务 → 分派 → 验证 → 持久化 → 下一轮

完整 Loop 的六大组件

  1. Automations:触发器(cron、CI、Codex Automations UI、/loop 命令)——Loop 的心跳
  2. Worktrees:Git 工作树隔离,多 Agent 并行不撞文件
  3. SkillsSKILL.md 沉淀项目规范,避免每次冷启动重学
  4. Connectors / MCP:接 GitHub、Slack、CI 等真实工具链
  5. Sub-agents:Maker/Checker 分离,写代码的和验代码的分开
  6. Memory / State:跨轮持久化(STATE.md、issue、DB)

五阶段闭环:Discover → Plan → Act → Observe → Iterate;验证器(Verifier)最关键——不能让干活 Agent 自己宣布”完成”。

与 Prompt Engineering 的关系:不是替代,是上一层。Loop 由多条 Prompt 组成,Prompt 烂 → Loop 加速产垃圾。

成本与风险提醒:定时 Loop 每次触发烧 Token;并行瓶颈在人审 PR 的速度,不在能开几个 Worktree;自主程度分四级(只读→草稿→半自动→全自动)。

模型评比

Agent Arena | AI Agent Performance Leaderboard

image-20260725151630642

swebench.com

代码编写模型排名

🥇DeepSeek V4 / V4 Pro:在 Agent 模式下解决真实 GitHub Bug 的通过率在开源界处于领跑地位,结合工具链调用能力强。

🥈 Kimi K3 / K2 系列:依靠百万级超长上下文(1M Context Window),在多文件重构、代码库项目级解析上表现优异。

🥉 Qwen3-Coder / MiniMax-M3:Qwen 依然是开源界使用最广泛、协议最友好的代码基座,单次 Patch 质量与通用语法生成非常稳健。

梯队与模型代表型号协议许可最佳应用场景
第一梯队(顶级 Agent & 复杂工程)DeepSeek-V4 Pro / R1 Kimi K3 / K2.6MIT / 开放许可复杂 Bug 修复、跨文件系统重构、算法难题推导。几乎可以替代大部分常规开发中的 API 编码工作。
第二梯队(全能代码基座 & 商业友好)Qwen3-Coder-480B GLM 5.2 / 4.6 MiniMax-M3Apache-2.0 / MIT企业私有化部署、API 自动化调用、Web 开发全栈。其中 Qwen 对商业化最为宽松友好。
本地单机/边缘端推荐(显卡可跑)DeepSeek-R1-Distill-Qwen Qwen2.5-Coder-7B/14B/32B Gemma 3 27B各种开源许可本地 IDE 插件(如 Continue/Roo Code)实时补全与私有代码提示。单张消费级显卡(如 RTX 4090)即可流畅运行。

简单来说Kimi,DeepSeek,GLM,Qwen都是国产大模型的佼佼者也都有开源模型供搭建使用

智能体经典泛式构建

最具代表性的三种:

  • ReAct (Reasoning and Acting): 一种将“思考”和“行动”紧密结合的范式,让智能体边想边做,动态调整。
  • Plan-and-Solve: 一种“三思而后行”的范式,智能体首先生成一个完整的行动计划,然后严格执行。
  • Reflection: 一种赋予智能体“反思”能力的范式,通过自我批判和修正来优化结果。

参考资料

https://pi.dev/
https://hello-agents.datawhale.cc/#/

AddyOsmani.com - Loop Engineering

-------------本文结束感谢您的阅读-------------
感谢阅读.

欢迎关注我的其它发布渠道