ByteNoteByteNote
别等视频先转成字再做边缘判定
字

字节笔记本

2026年10月9日 · 约 6 分钟读完

别等视频先转成字再做边缘判定

API中转
¥120

边缘判定一旦碰到录像或通话录音,常见做法是先转写成字,再丢给文本模型打分。同步会丢,延迟会叠,转写错一个词,后面的分数就跟着偏。Cloudflare 在 2026-10-09 的博文 Introducing Clef-omni 里补上第三款开源权重判定模型:一次前向同时吃音频、视频、图片和文本,不吐自由文本,只给每个选项一个概率。权重在 Cloudflare/clef-omni,许可证是 Apache-2.0。托管入口是 Workers AI 的 @cf/cloudflare/clef-omni。

上一轮已经写过 Clef 本体和 Clef-flash。那两款吃图文和视频,不吃原生音频。这次新开的是全模态管线,并且把 flash 的托管价从每百万输入 0.09 美元降到 0.038,Clef 仍是 0.24,omni 开价 0.15。媒体按输入 token 计费,没有输出 token 费。

Clef 三款托管价与上下文

一次前向,不解析生成词

模型卡写明,Clef-omni 是 30B-A3B 的混合专家,从 Qwen/Qwen3-Omni-30B-A3B-Instruct 后训练而来,大约 35B 参数,bfloat16 分片。骨架是 thinker 加视觉和音频编码器。仓库里也有 talker 和 code2wav,但 load_release_model 不会加载它们。判定头叫 joint schema head,对着最后一层隐状态给每个选项打一个 logit,再按问题做 softmax。接口和 Jev、SystemOne 对齐,问题类型只有 noul、choice、score 三种。

托管上下文默认 64k。单请求最多 4 张图、4 段音频、2 段视频。图单张不超过 4 MiB 和 1600 万像素,解码合计不超过 8 MiB。音频不超过 8 MiB 或 300 秒。视频不超过 16 MiB 或 60 秒,采样约 2 帧每秒。音频加视频解码合计不超过 16 MiB。远端 URL 直接拒。文档写,媒体和问题先占 64k 窗口,这两项本身超了整单失败。若只是文本 state 过长,会截到能放下为止。图片按 32 乘 32 的块加 3 个标记计 token,单张封顶 1024。音频大约每分钟 780 个 token。视频大约每分钟最多 15400,480p 大约 8600,有声再加约 780。

博文给的中位延迟是文本约 130 毫秒、图片约 150 毫秒、音频几百毫秒、21 秒视频约 1.5 秒。同一篇文章还写,Clef 本体经 SGLang 0.5.22(拉取请求 42721)之后,大约 800 个 token 的中位延迟 152 毫秒、p95 是 351 毫秒,大约快 1.7 到 2 倍。自托管 flash 权重仍支持 256k,托管 flash 是 24k。

Clef-omni 中位延迟

分数表和调用口

官方 Decision Index 0.2.1 把 omni、Clef、flash、Jev 并排。BFCL 案例精确率是 98.2、98.47、98.76、95.75。BANKING77 宏 F1 是 94.8、94.20、90.93、79.74。CLINC150 加 OOS 是 97.7、97.43、66.77、89.27。家电案例精确率 omni 只有 69.3,flash 反而到 97.73,Clef 是 82.95,Jev 是 52.27。When2Call 上 Jev 是 80.97,omni 只有 63.3。PhishNChips 准确率是 73.2、79.60、75.05、62.55。工作流那张表里,发票精确动作是 60.2、64.7、57.1、61.8,客服精确动作是 71.6、76.3、77.0、76.0,安全事件精确动作四家几乎贴在 61.7 附近。数字以博文表格为准,不是本轮复现。

调用走 Workers 绑定或账户接口:

bash
curl https://api.cloudflare.com/client/v4/accounts/$ACCOUNT_ID/ai/run/@cf/cloudflare/clef-omni \
  -H "Authorization: Bearer $API_TOKEN" \
  -H "Content-Type: application/json" \
  --data '{"model":"clef-omni","state":"结账失败已经一小时","questions":{"is_incident":{"type":"noul"}}}'

Workers 里是 env.AI.run("@cf/cloudflare/clef-omni", { model: "clef-omni", state, questions })。问题编号最多 100 个字符,允许字母、数字、下划线、点和短横。单请求 1 到 64 道题。noul 是是否,choice 的标准是对象,score 的标准是有序数组。返回值按同一编号给出概率、选中项或加权分。模型卡写,本机推理在一张 H200 上、bfloat16 大约 64 GB 显存测过,依赖 torch 2.11 和 transformers 5.10.2。图片要 pillow,音视频要 av。视频大约 2 帧每秒,片段都带音轨时才会用声道。文本和多模态可以混在同一批。SGLang 服务端对 omni 还写着即将支持。集合页此刻只挂着 Clef 和 Clef-flash,omni 是单独模型卡。内部用途博文写了垃圾工单自动关、插件钓鱼检查、个人数据扫描和恶意域名识别。别把判定模型当成守门员就完事,同周还有一篇针对类型化判定模型的选项通道攻击预印本,那是另一条线。

相关文章

分享: