ByteNoteByteNote
16.9 MB 就能听写,还直接变成工具调用
字

字节笔记本

2026年10月9日 · 约 3 分钟读完

16.9 MB 就能听写,还直接变成工具调用

API中转
¥120

端侧模型常常被拆成两套:一套聊天,一套听写。Cactus Compute 把它们塞进同一个运行时。Needle 是给手机、手表、机器人、智能家居和单片机用的自动化基座模型,体积 8 到 29 MB,带工具调用和结构化抽取;Whistle 是同一容器里的语音识别,16.9 MB。仓库 cactus-compute/needle 用 Apache-2.0 开源,GitHub 显示约 1.36 万星、920 个 fork,主页 cactuscompute.com。

HN 首页这轮把它顶到了约 739 分、146 条评论。热度来自一个很具体的数字:16.9 MB 就能听写,而且不必再开一条云端 ASR。

Needle 端侧自动化基座模型

一个二进制里装什么

README 把 Needle 写成面向移动设备、可穿戴、机器人、车机和微控制器的 foundation model,一份 8 到 29 MB 的二进制就能用。121M 参数的版本,官方称表现接近一个 50M 模型;层数从 2 到 20 可裁。架构写的是 Laddered Simple Attention Network:Monarch Hadamard MLP、GQA、因果卷积、engram n-gram 记忆,以及按 schema 生成的字节级语法,用来限制工具调用能吐出的 token。回复带校准过的置信度。

Whistle 负责听写,16 kHz 单声道,最长 30 秒,覆盖英语、德语、法语、西班牙语、意大利语、荷兰语和波兰语。它和 Needle 共用容器与引擎:音频进来,可以直接变成工具调用,而不是先转成一段纯文本再另开一轮对话。

Whistle:16.9 MB 的端侧听写

工具调用怎么走

安装是一行:

bash
pip install cactus-needle

权重放在 Hugging Face。应用把函数装饰进去,模型从用户的话里选函数、填齐参数。一次输入里有多个请求,就按顺序出调用;对不上的输入返回空列表。这和云端 function calling 长得像,差别是整段推理可以停在设备上。

博客里的对比数字(相对列出的竞品)是:体积大约小 8.6 倍,首 token 大约快 6.6 倍,首 token 延迟 11.1 ms,解码约 1319 tokens/s。这些是厂商自己的对照,不是第三方复现。微调官方写的是大约再涨 18 到 36 分。部署路径覆盖从手机到微控制器,仓库也提供微调与构建说明。

Whistle 与对照模型的体积和速度

适合谁

适合要在离线或弱网环境里做听写加动作的人:智能家居指令、车机短命令、机器人上的工具调用。不适合拿它当通用大模型替代品。语言目前是七种欧洲语言,中文不在 README 列表里。30 秒封顶也决定了它不是会议整场转写器。

和云端 ASR 比,它赢在体积和本地闭环;和桌面级 Whisper 比,它赢在能直接出工具调用。如果你已经在端侧塞小模型,却还要把语音送到另一家 API,Needle 加 Whistle 值得看一眼:同一份运行时,听完就能调函数。

相关文章

分享: