字节笔记本
2026年8月28日
Opus 4.8 对比 4.7:几个真实任务里差在哪
Todd Saunders 在 X 上问了一句很实际的话:你今天在用 Opus 4.8 的话,跟 4.7 比,最大的体感差是什么?榜单数字先放一边,要真实任务里的例子。帖子下面几百条回复,方向其实挺集中。下面按「你会碰到的活」拆,并给一套自己测的办法,别只看别人转述。
官方发布说明:https://www.anthropic.com/news/claude-opus-4-8
单次问答经常感觉差不多
改一个明确 bug、写一段函数、问一句 API 怎么用,4.8 和 4.7 的差距经常摸不出来。Anthropic 自己也把这次更新写成 modest but tangible:能摸到,但不是换代。
差主要出现在代理自己连着干很多步的时候。SWE-Bench Pro 从 64.3% 到 69.2%、带工具的综合推理从 54.7% 到 57.9%,说的都是这类长跑,不是一问一答。Terminal-Bench 2.1 从 66.1% 到 74.6%,终端里多步干活的提升更明显。价格没动:常规还是每百万 token 输入 5 美元、输出 25 美元。模型 ID 换成 claude-opus-4-8 就能试。
真实任务里通常差在这四处
1. 它会不会把自己写的坑说出来
官方评估里,4.8 让自己代码里的缺陷悄悄过关的概率,大约是 4.7 的四分之一。Early testers 的说法更口语:它更会问该问的问题,计划不靠谱时会顶回来,大改之前会先把多服务的情况摸清楚。
这对无人值守的 agent 循环最要紧。人会看每一份 diff 的时候,4.7 也能用;夜里让它自己改、自己测、自己交的时候,4.8 的价值就是少一次「看起来过了、其实埋了雷」。它不会替你省掉 review,只是把底抬高一点。
2. 该调的工具会不会被跳过
4.7 有个常见抱怨:任务明明需要读文件、跑测试或查库,它偶尔不调那个工具,直接往下编。4.8 这边,官方和 Cursor 的评测都提到工具调用更干净,同样智力水平用的步数更少,DeVin 那边也点名修了 4.7 的 comment 太啰嗦和漏调工具。
体感就是:五六步的编排里,中间那步数据库查询或测试命令更不容易被默默丢掉。工具步数下来,单次任务的时间和 token 往往也会少一点。
3. 长会话会不会跑丢
4.8 更能把上下文和文风带着走。以前为了防止 compaction 之后跑偏,你可能把大活拆成好几个短 session;现在可以先拿一个两小时级别的迁移或排虫试试看,看它还记不记得你定的约束。Messages API 这次还允许在 messages 数组里中途插一条 system,改权限、改预算、改环境,而不把 prompt cache 打掉。长跑中途改规则,不用整段重来。
4. 大仓库迁移是另一档能力,别和「模型变聪明」混在一起
跟 4.8 同一天进 Claude Code 的 Dynamic Workflows,可以在一次会话里拉上百个并行子代理,再用现有测试当验收。这是产品功能,不是 4.8 权重里多出来的那 5 个点。Pro 用户默认可能没开,Max / Team / Enterprise 才是研究预览范围。怎么开 /ultracode 我们另写过一篇,这里只提醒:测 4.8 模型本身时,先关掉 swarm,否则你分不清是模型好了还是编排变了。
自己测:10 到 20 个自家任务就够
别人的帖、Reddit、官方榜都不能替你的仓库说话。两边用同一套 prompt、同一份 CLAUDE.md / AGENTS.md、同一组工具,跑你最近真实做过的活:修 bug、加功能、重构、看 diff。每条记下:
- 做完了没有
- 调了几次工具
- 花了多少 token
- 测试过了没有
- merge 前要不要返工
- 有没有自己标「这段我没把握」
重点看两类信号。一类是 4.8 有没有把 4.7 会直接交的坑标出来。一类是长任务的步数和总 token 有没有下来。默认 effort 在 4.8 上仍是 high,官方说写代码时 token 消耗和 4.7 默认差不多,但结果更好。难活再把 Claude Code 里的 effort 提到 xhigh 或 max。别一上来就全开满,否则你测到的是「更贵的思考」,不是「换模型」。
Fast mode 大约 2.5 倍速,标价每百万输入 10、输出 50,比上一代 fast 便宜大约三倍。交互里等不及可以开;当评测基准时先关,避免把速度档和模型档搅在一起。
怎么切,以及什么时候先别切
API 里把模型 ID 换成 claude-opus-4-8。用环境变量钉住,回滚就是改回去重发一版:
# 原来
export ANTHROPIC_MODEL=claude-opus-4-7
# 换成
export ANTHROPIC_MODEL=claude-opus-4-8Claude Code 里直接选 Opus 4.8。opus 别名现在会指到 4.8。
可以先别切的情况也很清楚:你主要是单轮问答;prompt 是按 4.7 的脾气调出来的,这周没有回归测试的时间;合规环境必须走完整验证;正在发版,不想中途换模型。4.7 没坏。换之前至少用上面那组任务在非关键路径跑一遍。
如果你已经把 4.7 漏调工具的毛病写进了 prompt workaround,换完要重跑 eval。行为变好也会让「补偿用的那句指令」变得多余,偶尔还会把输出格式带偏。
小结
- 单次问答:差往往不明显
- 长代理、多工具、无人值守写码:4.8 更会标自己的坑,更少跳工具,长会话更稳
- 价格没变,模型 ID 一换就能试
- 用自家 10–20 个任务对比,别拿榜单当结论
- Dynamic Workflows 是同期功能,测模型时先关掉
官方说明:https://www.anthropic.com/news/claude-opus-4-8
安装 Claude Code:curl -fsSL https://claude.ai/install.sh | bash