ByteNoteByteNote
客服窗口换成小模型时,先看清十万 token 那道价
字

字节笔记本

2026年10月9日 · 约 4 分钟读完

客服窗口换成小模型时,先看清十万 token 那道价

API中转
¥120

客服队列里要把分类、摘要、浏览器点选从大模型挪到小模型,第一件事不是看排行榜,是看账单在十万 token 那里怎么折。Anthropic 在 2026-10-07 发布 Claude Haiku 5.5,模型号 claude-haiku-5-5。产品页写它是 5.5 家里最快、最省的一档,也是第一款带力度旋钮的 Haiku,力度从低到最大可调。发布稿原句写,这是他们发过最便宜、最快、也最能干的小模型。

十万 token 及以下,输入每百万 0.10 美元,输出 0.50,缓存读 0.01,缓存写 0.125。超过十万,四项分别变成 0.50、2.50、0.05、0.625。对照 Haiku 4.5 是输入 1.00、输出 5.00、缓存读 0.10、缓存写 1.25。发布稿写典型混合大约便宜 75%;十万以下大约便宜 90%,以上大约 50%,里面已经算上新分词器。缓存最多再砍九成,批处理五折。独立笔记写,这个价在十万以内和 GPT-6 Luna 对齐,过线后涨五倍。同日 Sonnet 5.5 的缓存读从 0.20 降到 0.10,发布稿写典型智能体用量大约再便宜两成。

价目按十万 token 切开

小模型能干什么,以及它仍让位给谁

官方并排表把 Haiku 5.5、Haiku 4.5、GPT-6 Luna、Sonnet 5.5 放在一起。OSWorld 2.1 离线是 72.4%、15.7%、48.9%、83.9%。Terminal-Bench 4.0 是 39.2%、0.0%、16.4%、70.6%。HLE 无工具是 45.9%、10.2%、未给、56.9%,有工具是 57.4%、18.7%、未给、64.5%。FrontierCode 1.1 主集是 46.4%、未给、42.4%、52.1。GDPval-AA v2.1 是 1620、735、1437、1840。AA-Briefcase v1.1 是 1578、614、1336、1824。Chartography 无工具是 46.4%、6.4%、29.1%、61.6%。难的智能体编码仍是大模型领先。数字以发布稿为准,不是本轮复现。

客户侧口径:四百问 0.84 对 4.5 的 0.76;比 4.5 高十一分,延迟大约一半;延迟降逾 30%,单轮推理最高约 2.5 倍;HubSpot 套件三跑平均 92.8%;一家编码智能体公司的 Fusion 栈把 FrontierCode 写成 66.2。产品页还写 4.5 在 SWE-bench Verified 上是 73.3%,当时对齐的是 Sonnet 4 那一档的编码、计算机使用和智能体。5.5 被写成在编码、工具、计算机使用和智能体上相对 4.5 明显上台阶。

官方并排分数

新分词器和 Sonnet 5.5、Opus 5.5 同族。独立笔记写,同一段长提示大约多出 1.25 倍 token,而且关不掉推理,默认中等力度。低力度画一只鹈鹕写成 0.0936 美分、七秒;最大力度五分九秒,仍只有 3.3826 美分。已经可以在 Claude 网站的免费、专业、最高、团队和企业档,以及接口平台和三家云上选。网页和手机都有。软件开发工具包加了计算机使用和浏览器使用的测试接口。Claude Code 在产品列表里,不是这次单独的发布项。最高档和团队档还带每月平台接口额度,个人一百或两百美元,团队最多五百美元池化。

安全口径写对齐强于 4.5,网络规则比 4.5 紧、比更大的 5.5 松,生物安全与 Sonnet 5、5.5 和 Opus 5 同档。官方建议复杂规划留给更大的模型,Haiku 当子智能体。它适合高频分类、压缩、查询、客服和浏览器点选。工作负载如果常年卡在十万 token 以上,新分词器会先把账单往上推一截,再谈“更便宜”。

相关文章

分享: