字
字节笔记本
2026年9月10日
Reverify:专治 AI 幻觉的验证层,模型提议、工具裁决
API中转
¥120
本文介绍 2akouwu 开源的 Reverify(1.1 千 stars,MIT)——一个专治 AI 幻觉的验证层:模型只许"提议",确定性工具负责裁决,每一条结论都必须对着真实产物(字节、代码、二进制)核验过才算数,输出带证据的 VERIFIED / REFUTED。模型自己说了不算。
项目简介
Reverify 今年 8 月底开源,创始场景选得很有说服力:二进制逆向。这是幻觉重灾区——让模型从二进制里还原一个结构体,它会自信地编造偏移量、字段大小和行为。官方在 71 个真实 Windows 系统文件上实测:模型的教科书式答案错率 97%,而 Reverify 全部拦截,0 次放行错误结论(同一验证门禁在 CI 中跨 Linux/macOS/aarch64 复跑结果一致)。
核心哲学一句话:模型提出假设,纯 Python 的确定性逆向工具箱当法官——反汇编、模式匹配、模拟器执行,核验过真实字节才允许上报。
两个核心能力
- 让 AI 诚实(
reverify verify):每条结构性/行为性断言都对照 ground truth 核验,只有活下来的才成为事实;也以 MCP 服务器形态接入你现有的 agent - 让上下文不腐烂(
reverify rollover):长任务不用/clear,把会话交接给文件后开新会话,避免有损自动摘要导致的漂移;支持 Claude Code、Codex、Gemini CLI、OpenCode
快速开始
按 README 安装后两种用法:命令行直接 verify,或把 MCP 服务器挂到你的 agent 里,让"提议-验证"成为 agent 工作流的固定环节。
适用场景
- 二进制逆向/安全研究:幻觉最重、验证价值最大的领域(官方基准即来自这里)
- agent 输出可信度要求高的流水线:合规、金融、基础设施代码
- 长周期 agent 任务:配合 rollover 机制防上下文劣化
注意事项
- 项目很新(8 月底开源),目前覆盖的核验工具以逆向场景为主,其他领域的 ground truth 工具需要自己接
- 验证会增加推理往返次数,实时性要求高的场景权衡使用
- 基准为作者自测,结论方向可信但具体数字以自己场景复测为准
项目链接
- GitHub 仓库:https://github.com/2akouwu/reverify
- 基准与方法:仓库 EXAMPLE.md 与 BENCHMARK.md
分享: