
字节笔记本
2026年10月2日 · 约 5 分钟读完
JEV-27B-VL:看着 Mario 打关的决策模型,重点其实不是 Mario
AutoTrust 刚开源的 JEV-27B-VL 在 X 上刷了一波屏:一个 27B 多模态模型,看着 Mario 的画面直接输出动作概率,150 毫秒一步,跑得比不少人手动操作还流畅。但评论区最快戳到的质疑也值得认真看:"calibrated against what, and on whose eval?"
它到底做了什么不同的事
普通视觉模型看到 Mario 的画面,可能会回答:Mario 前面有障碍物,应该跳过去。
JEV-27B-VL 更接近直接返回:
run 0.08
jump 0.17
run+jump 0.75然后程序执行概率最高的动作。它把这条链路:图片 → 生成文字 → Agent 理解文字 → 决定调用动作,缩成了图片 → 动作概率 → 执行。
底座是 Qwen3.8-27B,多模态能力没改。AutoTrust 在上面加了 System 1 adapter 和 decision head:System 2 像普通 Qwen 一样生成文字推理,System 1 专门负责快速决策。权重 Apache 2.0 开源。

Calibrated 是重点,也是争议点
所谓 calibrated probability,理想状态是:如果模型给某类决策长期报 80% 置信度,那这些预测里应该真有约 80% 是对的。这样 Agent 就能自己设阈值:高于 0.95 自动执行,0.70 到 0.95 再看一次,低于 0.70 请求人工确认。
AutoTrust 确实公布了评测数据:文本决策测试里 JEV-27B 的 Expected Calibration Error 为 0.0009,独立 800 条 human-gold 数据集上 16 候选项准确率 0.740(TypeSafe Jev 为 0.769)。
但关键的限定是:这些 calibration 数据主要是文本 System 1。模型卡 Limitations 明确承认,图像决策属于 zero-shot,视觉任务的 calibration 还没有系统验证。所以 Mario 跳跃概率显示 87% 并不等于长期真有 87% 正确,这两个概念差得很大。
至于"开头跳 1-UP 说明它提前知道后面有什么"的质疑也不无道理:JEV 每步只看当前画面再从候选动作集合里选,它可能利用了 Qwen 训练数据中已有的 Mario 游戏先验。会玩 Mario 不等于学会了完整的 Mario world model。

最实用的发现:Agent Judge
JEV-27B-VL 最值得关注的结果其实不是 Mario,而是拿它做 Agent Judge:给它 agent 的目标、操作轨迹和最终截图,判断任务是否完成。在 AgentRewardBench 上直接输出 P(task completed),官方报告 AUROC 0.91,1302 条轨迹单 GPU 约 4 分钟完成。
这意味着 agent 架构可能变成:System 1 快速看图做动作 → System 1 判断是否成功 → 低置信度才唤醒 System 2 深度推理。不需要每次点击都让 27B/70B 模型生成几百 token 的思维链。
适合谁用
做 Computer Use Agent 的团队:当前架构通常是截图 → VLM 看图 → CoT 推理 → 输出 click(x,y) → 执行 → 再截图。JEV 的思路可以变成候选动作加概率分布直接选择,延迟和 token 成本都明显下降。
做机器人和游戏 Agent 的团队:从视觉输入到动作选择的低延迟闭环,正是这类场景最需要的原语。
关注可解释性的研究者:calibrated action probability 比自然语言解释更容易做工程化的阈值控制,但视觉侧的 calibration 验证还缺着,这是一个明确的开放问题。
一句总结:JEV-27B-VL 试图把多模态模型从"看懂屏幕"推进到"低延迟地决定下一步"。Mario 是最好看的 Demo,但真正有用的是 Agent Judge 和校准概率的工程化路径。至于"near-SOTA"和"视觉 calibrated"这两个词,目前最好分开看。



