这周的两件大事包括K3模型发布以及pi-agent逐渐走入视野。这无疑又给Agent应用的热度推上新的高峰
Agent发展
Loop Engineering
AddyOsmani.com - Loop Engineering
过去两年,AI 开发的重点正在不断变化:从研究如何写好提示词(Prompt),逐步发展到组织上下文(Context)、编排工具与流程(Harness),再到构建能够自主运行、持续交付结果的循环系统(Loop)
人不再逐轮手敲 Prompt,而是写一个外循环系统,由系统定时/事件触发 → 派发 Agent → 验证产出 → 记状态 → 决定继续或停止。1
2
3
4
5
6
7Prompt:怎么问 AI
↓
Context:给 AI 什么信息
↓
Harness:如何组织 AI 的能力
↓
Loop:如何让 AI 持续创造结果
Loop Engineering 并非凭空而来,它是 AI 编程工具能力演进的自然结果。
| 阶段 | 代表工具 | 工作方式 | 瓶颈 |
|---|---|---|---|
| 第一代:自动补全 | GitHub Copilot 早期版本 | 补全当前行或函数,人类主导所有决策 | 只能辅助,不能自主 |
| 第二代:对话式 | ChatGPT、Claude.ai | 问一句,答一句,人类手动推进每一步 | 人类成为瓶颈,速度受限于打字速度 |
| 第三代:Agent 自主循环 | Claude Code、OpenAI Codex Agent | Agent 自主规划、执行、验证,循环迭代直到完成 | 如何设计让 Loop 可靠运行的系统 |
第三代工具的出现意味着,工程师的核心竞争力从会写提示词变成了会设计 Loop。
Loop Engineering 是设计、运营和持续改进反馈循环的工程实践,这些循环使 AI 编程 Agent 能够自主完成规划、执行代码修改、观察结果并在多轮迭代中完成任务。
内循环 vs 外循环
- 内循环(Agent 自带):感知 → 推理 → 行动 → 观察
- 外循环(你设计的):触发 → 发现任务 → 分派 → 验证 → 持久化 → 下一轮
完整 Loop 的六大组件
- Automations:触发器(cron、CI、Codex Automations UI、
/loop命令)——Loop 的心跳 - Worktrees:Git 工作树隔离,多 Agent 并行不撞文件
- Skills:
SKILL.md沉淀项目规范,避免每次冷启动重学 - Connectors / MCP:接 GitHub、Slack、CI 等真实工具链
- Sub-agents:Maker/Checker 分离,写代码的和验代码的分开
- Memory / State:跨轮持久化(STATE.md、issue、DB)
五阶段闭环:Discover → Plan → Act → Observe → Iterate;验证器(Verifier)最关键——不能让干活 Agent 自己宣布”完成”。
与 Prompt Engineering 的关系:不是替代,是上一层。Loop 由多条 Prompt 组成,Prompt 烂 → Loop 加速产垃圾。
成本与风险提醒:定时 Loop 每次触发烧 Token;并行瓶颈在人审 PR 的速度,不在能开几个 Worktree;自主程度分四级(只读→草稿→半自动→全自动)。
模型评比
Agent Arena | AI Agent Performance Leaderboard

代码编写模型排名
🥇DeepSeek V4 / V4 Pro:在 Agent 模式下解决真实 GitHub Bug 的通过率在开源界处于领跑地位,结合工具链调用能力强。
🥈 Kimi K3 / K2 系列:依靠百万级超长上下文(1M Context Window),在多文件重构、代码库项目级解析上表现优异。
🥉 Qwen3-Coder / MiniMax-M3:Qwen 依然是开源界使用最广泛、协议最友好的代码基座,单次 Patch 质量与通用语法生成非常稳健。
| 梯队与模型 | 代表型号 | 协议许可 | 最佳应用场景 |
|---|---|---|---|
| 第一梯队(顶级 Agent & 复杂工程) | DeepSeek-V4 Pro / R1 Kimi K3 / K2.6 | MIT / 开放许可 | 复杂 Bug 修复、跨文件系统重构、算法难题推导。几乎可以替代大部分常规开发中的 API 编码工作。 |
| 第二梯队(全能代码基座 & 商业友好) | Qwen3-Coder-480B GLM 5.2 / 4.6 MiniMax-M3 | Apache-2.0 / MIT | 企业私有化部署、API 自动化调用、Web 开发全栈。其中 Qwen 对商业化最为宽松友好。 |
| 本地单机/边缘端推荐(显卡可跑) | DeepSeek-R1-Distill-Qwen Qwen2.5-Coder-7B/14B/32B Gemma 3 27B | 各种开源许可 | 本地 IDE 插件(如 Continue/Roo Code)实时补全与私有代码提示。单张消费级显卡(如 RTX 4090)即可流畅运行。 |
简单来说Kimi,DeepSeek,GLM,Qwen都是国产大模型的佼佼者也都有开源模型供搭建使用
智能体经典泛式构建
最具代表性的三种:
- ReAct (Reasoning and Acting): 一种将“思考”和“行动”紧密结合的范式,让智能体边想边做,动态调整。
- Plan-and-Solve: 一种“三思而后行”的范式,智能体首先生成一个完整的行动计划,然后严格执行。
- Reflection: 一种赋予智能体“反思”能力的范式,通过自我批判和修正来优化结果。
参考资料
https://pi.dev/
https://hello-agents.datawhale.cc/#/
AddyOsmani.com - Loop Engineering
