ByteNoteByteNote
Anthropic 40万会话研究:AI编程门槛正在消失
字

字节笔记本

2026年10月6日 · 约 6 分钟读完

Anthropic 40万会话研究:AI编程门槛正在消失

API中转
¥120

2026 年 6 月 16 日,Anthropic 发布研究《How Claude Code is used in practice》(副标题:Agentic Coding and Persistent Returns to Expertise)。研究团队分析了约 40 万个真实 Claude Code 会话,来自约 23.5 万名用户,时间跨度为 2025 年 10 月至 2026 年 4 月,共 7 个月。这不是问卷调研,而是对真实行为的直接观测:用户实际输入了什么、AI 实际执行了什么,全部留有记录。原文见 anthropic.com/research/claude-code-expertise。本文整理这份研究的关键数据与结论。

一、人们在用 Claude Code 做什么

研究用会话分类器把全部会话归入九种工作模式,其中:

  • 修 bug 占 26%,写新代码占 25%,测试与编排占 5%,三项合计 56%,属于直接代码工作;
  • 运维软件占 17%;
  • 规划与探索占 14%;
  • 分析与写作占 13%。

九种工作模式的分布,数据来源:Anthropic 研究

也就是说,这个编程工具近一半的工作量发生在写代码之外:运维、规划、分析、写文档都在其中。编码之外任务占比之大,是理解后续所有结论的背景。

二、决策分工:人类定方向,AI 跑执行

研究用决策归属分类器把会话中的决策分成两类:规划决策(做什么)与执行决策(怎么做)。结果相当清晰:

  • 用户做出约 70% 的规划决策;
  • Claude 做出约 80% 的执行决策。

规划决策与执行决策的分工,数据来源:Anthropic 研究

典型会话大约 4 个回合;每条用户提示平均触发约 10 个动作,多的会超过 100 个;每个回合 Claude 平均输出 2400 词。用户的领域专业知识越多,每条指令能带动的完成量也越大。分工界面由此形成:人负责判断做什么,AI 负责把怎么做一路执行完。

三、不同职业的成功率:差距只有 5 个百分点

研究通过职业推断回答了一个外界关心的问题:非技术岗位的人用 AI 写代码,和工程师相比差多少?职业推断把用户映射到美国劳工统计局标准职业分类(SOC)的 23 个大类,70% 的会话可以识别出职业。

先看研究采用的两层成功标准:判断成功,指会话看起来达成了用户目标;验证成功,标准更严格,需要硬证据,例如代码提交、PR 合并或测试通过。以更严格的验证成功衡量:

  • 软件相关职业约 30%,其中代码会话约 34%;
  • 非软件职业约 26%,其中代码会话约 29%;
  • 两类人群的差距仅 5 个百分点,十大主要职业全部落在软件工程师平均水平 7 个百分点以内;
  • 管理职业的验证成功率在所有职业中最高,甚至略高于软件工程职业。

不同职业在编码任务上的成功率,数据来源:Anthropic 研究

几乎每个主要职业的编码成功率都与软件工程师的平均水平相当,职业背景带来的差异非常小。

四、专业知识的回报:大头在从新手到中级

研究把用户按领域专业知识分成五级(从新手到专家),会话结果随之分层:

  • 新手:验证成功 15%,至少部分成功 77%;
  • 中级及以上:验证成功 28% 到 33%,至少部分成功 91% 到 92%。

专业知识水平与会话结果,数据来源:Anthropic 研究

大部分增益发生在从新手到中级的阶段;中级再往专家走,边际收益明显递减。领域专业知识越多,成功率越高,这一回报持续存在,只是幅度收窄。

杠杆效应同样显著:新手每条提示平均触发约 5 个动作、产出约 600 词;专家每条提示触发 12 个动作、产出 3200 词,动作量约 2 倍,输出量约 5 倍。同样一句话,专家能让 AI 干出多得多的活。

还有一个数字值得单独记录:遇到麻烦时,新手有 19% 直接放弃会话,其余水平的用户只有 5% 到 7% 放弃。相当一部分差距不在技术能力,而在是否愿意再来一次。

五、七个月里的三个趋势

把 2025 年 10 月与 2026 年 4 月的数据对比,能看到三个变化:

  1. 调试占比从 33% 降到 19%,花在修错上的份额明显收缩;
  2. 使用向端到端智能体应用转移:部署运行代码、数据分析、写非代码文档的比例上升;
  3. 任务的经济价值上升:以自由职业市场的发布价为参照,典型任务的平均价值上升约 25% 到 27%。

用户画像也在变化:最大用户群体仍是计算机与数学职业,但增长最快的非软件职业是管理、销售和法律。用户平均每周使用 Claude Code 约 20 小时。

六、方法附注与几点启示

方法上,该研究采用隐私保护分析,使用会话分类器划分九种工作模式,用决策归属分类器区分规划与执行,用五级评分衡量专业知识,成功度量同时包含判断成功与验证成功两类,任务价值以自由职业市场报价估算。

对使用者的启示可以归纳为三点:

  1. 分工界面已经清晰:人负责规划与验收,AI 负责执行。想清楚要什么、把需求讲明白、判断结果对不对,是使用这类工具的核心能力。
  2. 职业门槛在拉平:各主要职业的成功率几乎相当,决定成败的不是多年的编程训练,而是需求表达与持续迭代。
  3. 收益的大头在早期:从新手到中级就能拿到大部分回报,遇到失败不轻易放弃,是最划算的投入。

本文数据与配图均来自 Anthropic 官方研究《How Claude Code is used in practice》。

相关文章

分享: