
字节笔记本
2026年10月6日 · 约 22 分钟读完
副驾驶到自动驾驶:2026年中AI Agent软件工程全景
副驾驶到自动驾驶:2026年中AI Agent软件工程全景
2026 年过了一半。回头看这半年 AI Agent 在软件工程领域发生了什么?
一句话总结:我们正在从"副驾驶"时代加速驶入"自动驾驶"时代。 但不是所有车都换成了自动驾驶:大多数团队还在副驾驶模式,少数先锋已经在跑 Agent 自主开发,而完全自主的多 Agent 协作还停留在实验阶段。
本文综合 Anthropic《Agentic Coding 趋势报告》、量子位 AISMM 白皮书等多份公开资料与社区实践,把 2026 年上半年的关键变化、重要产品、框架选型、落地困局和实操建议一并整理出来。
三个时代:我们现在在哪
业界对 AI 辅助开发的演进有几个不同的分级模型,这里挑最有代表性的三个。
Anthropic 的三级模型
Anthropic 在 2026 年初发布的《Agentic Coding 趋势报告》里定义了三个阶段:
| 阶段 | 角色 | AI 做什么 | 人做什么 |
|---|---|---|---|
| Copilot(副驾驶) | AI 是助手 | 代码补全、简单重构、写单元测试 | 架构设计、业务逻辑、代码审查 |
| Collaborator(协作者) | AI 是搭档 | 独立完成功能模块、多步骤任务 | spec 设计、diff review、架构决策 |
| Team(团队) | AI 是团队成员 | 多个 Agent 协作完成完整项目 | oversight、安全审查、质量把控 |
Anthropic 的数据:2025-2026 年 agentic coding 使用量增长 4 倍。但大部分增长发生在 Copilot 到 Collaborator 的转换,真正的 Team 模式还很少。
量子位 AISMM 成熟度模型
量子位联合 60+ 位技术专家发布的《AI 原生软件研发成熟度模型 AISMM 白皮书》,把组织成熟度分成 5 级:
| 级别 | 名称 | AI 的角色 |
|---|---|---|
| L0 | 纯人工 | 没有 AI 辅助 |
| L1 | AI 辅助 | Copilot 模式,代码补全 |
| L2 | AI 协作 | Agent 模式,AI 能独立完成子任务 |
| L3 | AI 主导 | 大部分开发工作由 Agent 完成,人做 oversight |
| L4 | AI 自主 | 完全自主的 AI 开发,人只做战略决策 |
60+ 位专家的共识:当前行业整体在 L1-L2 之间。 绝大多数公司还在 Copilot 阶段,少数头部公司在探索 L2 Agent 模式,几乎没有公司在做 L3/L4。
Karpathy 的定义
Karpathy 的分法更直白:vibe coding vs agentic engineering。
- Vibe coding:你对 AI 说"帮我写个 TODO App",AI 写出来,你差不多就用
- Agentic engineering:你在 AI 动手前写 spec、定义 eval、设定安全边界,AI 在框里写代码,你做 oversight
综合判断
三个模型放在一起看,2026 年中的现实图景是这样的:
L4 完全自主 [ ] 几乎没有
L3 AI 主导 [ ] 极少数实验
L2 Agent 协作 [####] 头部公司在探索
L1 Copilot 辅助 [##########] 大多数团队
L0 纯人工 [ ] 几乎消失副驾驶(Copilot)是主流,自动驾驶(Agent 自主)是方向,但中间的鸿沟比大多数人想象的要大。

2026 上半年关键事件时间线
把这半年发生的重要事件按时间捋一遍:
| 时间 | 事件 | 意义 |
|---|---|---|
| 2 月 | Matt Pocock 发布 skills-for-real-engineers,4 个月冲到 152K star | Skill 成为 Agent 工程化的核心抽象 |
| 2 月 | Anthropic 发布《Agentic Coding 趋势报告》 | 定义 Copilot、Collaborator、Team 三级模型 |
| 3 月 | Claude Code 突破 130K GitHub star | 最成熟的 Coding Agent CLI |
| 3 月 | Pi Coding Agent 发布(Mario Zechner) | 极简 Agent harness,模型无关 |
| 4 月 | 量子位发布 AISMM 白皮书(60+ 专家) | 行业首次系统性成熟度评估 |
| 4 月 | Herdr 发布 | Agent 多路复用器,"tmux for AI agents" |
| 4 月 | Google Cloud Next '26 发布 Agents CLI + ADK | Agentic engineering 有了配套工具链 |
| 5 月 | 国产 Trae 正式入场 | 字节跳动入局 Coding Agent |
| 5 月 | GPT-5-Codex 内部测试,连续自主工作 7 小时 | OpenAI 在 Agent 自主性上的突破 |
| 6 月 | Omnigent 等 Agent 框架爆发 | 多 Agent 协作进入实用阶段 |
| 6 月 | OpenCut 重写宣布(Rust 内核 + MCP Server) | 视频编辑也进入了可编程平台时代 |
| 6 月 | Vercel 宣布 Dockerfile 支持 + Fluid Compute | 部署基础设施适配 Agent 时代 |
工具格局:三大阵营
当前的 AI 编程工具,可以分成三个阵营来看。
阵营 1:IDE 内嵌型
| 工具 | 厂商 | 核心能力 | Agent 模式 |
|---|---|---|---|
| GitHub Copilot | Microsoft/GitHub | 代码补全 + Chat + Agent Mode | Copilot 到 Collaborator |
| Cursor | Cursor Inc | 代码补全 + Agent + Composer | Copilot 到 Collaborator |
| Windsurf | Codeium | 代码补全 + Cascade Agent | Copilot 到 Collaborator |
| Trae | 字节跳动 | 代码补全 + Builder Agent | Copilot 到 Collaborator |
特点:嵌入 IDE,体验流畅,门槛低。但 Agent 能力受限于 IDE 环境,无法执行完整的开发流程(部署、测试、CI/CD)。
适合:已经在用 VS Code 的开发者,日常编码效率提升。
阵营 2:独立 CLI
| 工具 | 厂商 | 核心能力 | Agent 模式 |
|---|---|---|---|
| Claude Code | Anthropic | 全流程 Agent,读/写/编辑/bash | Collaborator 到 Team |
| Codex CLI | OpenAI | 全流程 Agent | Collaborator |
| Gemini CLI | 全流程 Agent + Google 生态集成 | Collaborator | |
| Pi | Mario Zechner | 极简 harness,模型无关 | Collaborator |
特点:在终端里运行,能访问整个项目、执行任意命令、操作文件系统。Agent 能力远超 IDE 内嵌型。
适合:想用 Agent 做完整项目开发、不限于代码补全的工程师。
阵营 3:Agent 框架 / 多 Agent 编排
| 工具 | 厂商/社区 | 核心能力 |
|---|---|---|
| LangGraph | LangChain | 生产级 Agent 框架,状态管理、eval、human-in-the-loop |
| CrewAI | CrewAI | 多 Agent 角色协作 |
| Google ADK + Agents CLI | scaffold 到 eval 到 deploy 全流程 | |
| Omnigent | 开源社区 | 多 Agent 编排器 |
特点:不是帮你写代码的工具,是帮你搭建 Agent 系统的工具。你用它来创建自己的 AI Agent 产品。
适合:想做 AI Agent 产品/内部工具的团队。

框架选型:2026 年中怎么选
根据量子位 AISMM 白皮书和社区实践,这里整理了一份简单的选型指南:
| 你想做什么 | 推荐工具 | 为什么 |
|---|---|---|
| 日常编码效率提升 | Cursor / Claude Code | 体验最好,上手最快 |
| 用 Agent 做完整项目 | Claude Code + Skills | 最成熟的 CLI Agent + 可扩展的 Skill 体系 |
| 搭建自己的 AI Agent 产品 | LangGraph(生产)或 CrewAI(快速验证) | LangGraph 是 2026 生产标准 |
| 部署到 Google Cloud | Google ADK + Agents CLI | 全流程覆盖,eval 内置 |
| 模型无关 + 极简 | Pi Coding Agent | 不绑定任何厂商 |
| 多 Agent 并行管理 | Herdr | tmux for AI agents |
| 团队规范 + Skill 体系 | Matt Pocock 的 skills 体系 | 152K star,工程化最佳实践 |
2026 上半年的五个关键认知变化
1. Skill 成为 Agent 工程化的核心抽象
半年前,大多数人还在讨论"怎么写好 prompt"。现在讨论的是"怎么写好 Skill"。
这不是文字游戏。Skill 和 prompt 的区别是持久化 vs 临时、结构化 vs 自由格式、可组合 vs 不可组合。
Matt Pocock 的 skills-for-real-engineers(152K star)是这件事的标志性事件。Google Agents CLI 的 7 个 Skill 注入机制进一步验证了这个方向。
我的判断:Skill 将成为 Agent 工程化的标准抽象,就像 container 之于部署、schema 之于数据库。
2. Eval 从 Nice-to-have 变成 Must-have
半年前,eval 还是学术论文里的概念。现在,Google Agents CLI 内置 eval Skill,LangGraph 把 eval 做成了一等公民,Claude Code 的社区 Skill 里 eval 是最高频的类别之一。
原因很简单:当 Agent 能自主执行多步任务时,你需要自动化的方式验证它的输出质量。 人肉 review 每一行代码不现实。
Eval 的三个层次:
| 层次 | 做什么 | 工具 |
|---|---|---|
| Unit Eval | 测试单个工具调用/函数的输出 | pytest + eval dataset |
| Integration Eval | 测试 Agent 完成多步任务的整体结果 | Google Agents CLI eval |
| Regression Eval | 每次代码变更后跑全量 eval,确保没有回退 | CI/CD 集成 |
3. 多 Agent 协作从概念进入实用
2026 年初,多 Agent 还是概念验证。到了年中:
- Herdr 提供了终端里的多 Agent 管理(tmux for AI agents)
- LangGraph 支持 Agent 间通讯和编排
- CrewAI 提供角色化的多 Agent 协作
- Omnigent 等新框架专门做多 Agent 编排
但现实是:多 Agent 协作的复杂度远超单 Agent。协调、通讯、状态一致性、冲突解决,每个都是工程难题。大多数团队应该先做好单 Agent,再考虑多 Agent。
4. 安全和合规成为最大瓶颈
量子位的 60+ 位专家一致指出:安全、合规、审计是 AI Agent 落地的最大阻碍。
具体来说:
- Agent 有文件系统和网络的访问权限,但没有安全意识
- Agent 生成的代码可能有安全漏洞(SQL 注入、XSS、hardcoded secrets)
- 合规要求(GDPR、SOC2、等保)对 AI 生成代码的审计轨迹有严格要求
- 大多数公司没有 Agent 行为的日志和审计机制
Karpathy 的 agentic engineering 把 security oversight 列为核心技能,是有道理的。
5. 从"AI 写代码"到"AI 搭建系统"
这个认知变化最微妙但最重要。
半年前,大多数人对 AI 编程的理解还是"AI 帮我写代码"。现在头部实践者的用法是"AI 帮我搭建整个系统",包括基础设施、配置文件、CI/CD pipeline、部署脚本、监控告警。
Claude Code 的用户报告:他们最常用的场景不是"写一个函数",而是"把这个项目从 AWS 迁移到 GCP"、"给这个项目加 E2E 测试和 CI/CD"、"排查这个 production bug"。
Agent 的价值不在写代码,在执行任务。代码只是执行任务的副产品。
实话实说:当前的瓶颈
| 瓶颈 | 现状 | 预计突破时间 |
|---|---|---|
| Agent 可靠性 | 多步任务的成功率约 60-80%,复杂任务更低 | 2026 下半年到 2027 |
| 上下文窗口 | 长项目会超出上下文限制,Agent "遗忘"早期信息 | 2026 下半年(200K+ token 窗口普及) |
| 评估标准 | 没有统一的 eval benchmark,各工具各搞各的 | 2027 |
| 安全框架 | 缺少 Agent 行为的权限控制、审计、沙箱标准 | 2027 |
| 成本 | 全天候跑 Agent 的 API 费用 $50-200/月/人 | 模型降价中,2027 进一步下降 |
| 组织能力 | 大多数公司不知道怎么用 Agent,缺方法论 | 正在改善(AISMM、agentic engineering 框架) |
我的实操建议:2026 下半年怎么行动
基于这半年的观察,如果你想在下半年提升团队的 AI Agent 使用水平,建议分两条线走。
对于个人开发者
Level 1(如果你还没开始):装一个 Cursor 或 Claude Code,在日常编码中用起来。先从 Copilot 模式开始,感受 AI 辅助编码的效率提升。
Level 2(如果你已经在用 Copilot):开始用 Skill 体系。把你的编码规范、commit 规范、review checklist 写成 Skill,让 Agent 自动执行。
# 一个好的起点
npx skills add mattpocock/skills --skill writing-great-skills
npx skills add mattpocock/skills --skill tdd
npx skills add mattpocock/skills --skill grill-meLevel 3(如果你想进入 Agent 模式):用 Claude Code 做完整项目开发。写 spec、让 Agent 执行、review diff、写 eval、迭代。这就是 Karpathy 说的 agentic engineering。
对于团队/组织
Step 1:评估当前成熟度(L0-L4),不要跳级。L1 做好了再考虑 L2。
Step 2:建立 Skill 体系。把团队的编码规范、测试标准、部署流程写成 Skill,统一执行。
Step 3:搭建 eval 体系。为关键业务逻辑写 eval 数据集,每次 Agent 变更后自动跑。
Step 4:建立安全审查流程。Agent 的每个 PR 都要过安全审查。
Step 5:逐步从 Copilot 模式过渡到 Agent 模式。先在低风险项目上试点,成功后推广。
2026 下半年值得关注的信号
| 信号 | 如果发生,意味着什么 |
|---|---|
| GPT-5-Codex 正式发布 | OpenAI 在 Agent 自主性上取得突破 |
| Claude Code 200K+ star | Agent CLI 成为主流开发工具 |
| LangGraph 成为 Agent 框架的事实标准 | 框架选型尘埃落定 |
| Google Agent Runtime 推出免费层 | Agent 部署成本大幅降低 |
| 出现第一个完全由 Agent 开发并上线的生产级产品 | L4 级别的里程碑 |
| AI 编程工具出现统一 eval benchmark | 行业标准化开始 |
一句话总结
2026 年上半年的 AI Agent 在软件工程领域,是从概念验证走向工程实践的关键半年。副驾驶已经成了标配,自动驾驶还在前方,但路已经修出来了:Skill、Eval、Agentic Engineering,这三个关键词会定义下半年甚至明年的方向。
参考资源
- 2026年中AI编程生态盘点:从代码补全到自主Agent的爆发(uuaihub)
- Agent 正杀入软件研发一线:AISMM 白皮书(量子位)
- 2026 软件开发新纪元:Anthropic Agentic Coding 趋势报告(Tony Bai 译文)
- AI Agent 进化论:从副驾驶到自主工程师(知乎)
- 2026 年 AI Agent 技术全景:12 大主流框架深度解析(知乎)
- 2026 年 5 月份 AI Agent 系统设计与技术进展(DataLearner)
- 2026 年 AI Agent 框架选型盘点(博客园)
- 2026 年 Agent AI 行业深度盘点(腾讯云)
- 从"副驾驶"到"自动驾驶"(CSDN)



