ByteNoteByteNote
认字和找框能不能一次做完?LightOnOCR-3 把两步并了
字

字节笔记本

2026年10月9日 · 约 3 分钟读完

认字和找框能不能一次做完?LightOnOCR-3 把两步并了

API中转
¥120

文档 OCR 常被拆成两步:先认字,再另开一个模型找框、补图注、抽表。LightOn 把这两步并进同一个视觉语言模型。LightOnOCR-3 在 2026 年 10 月 8 日发了博文,权重公开,协议 Apache-2.0,三个规格是 0.8B、1B 和 4B。代码在 lightonai/LightOnOCR,权重在 Hugging Face 的 lightonai/LightOnOCR-3-0.8B 及同系列。

GitHub 代码仓还很新,大约 15 星;真正能复现的是权重和博客里的基准,而不是星数。空提示走整页转写,接地提示再补框、图注和表。

LightOnOCR-3 博文封面

一个模型,两种用法

模型卡写得很具体。默认空提示输出整页 Markdown,覆盖表格、表单、收据、多栏和公式。加上接地提示后,输出带归一化到 0 到 1000 的标签框,还能给图写说明、把图表收成 HTML 表。架构基于 Qwen3.5,方便接进现有推理栈。建议把 PDF 渲到 400 DPI,长边 2048 像素。

命令行最短路径是:

bash
lightonocr paper.pdf --mode grounding

仓库安装写的是 uv sync --extra vllm。也有 Hugging Face Space 演示。接地模式会多吐大约 25% 的 token,4B 平均大约从 1158 涨到 1433,用框换结构。

查看器里的转写和框

基准数字怎么读

博文给出的对照(越高越好):4B 在 olmOCR-Bench 总分 86.3,ParseBench 五类 75.1,法文 fr-bench-pdf2md 74.1。0.8B 在多套评测上离 4B 不远,参数少一截。单卡 H100 上,紧凑输出格式比同结构基线大约多 14% 到 21% 的页吞吐。训练写了数据配比调整、多模型迭代接地、带图像增强的 SFT(Muon),以及在核过的框和合成检查上再做 GRPO。评测默认关掉 thinking。

这些是官方数字,不是第三方复现。用法上更该看:转写和接地能不能共用同一套权重,而不是再接一个检测头。

适合谁

适合要在本地或自建推理里把 PDF 变成带坐标 Markdown 的人,尤其是表格和多栏多的扫描件。0.8B 适合先打通流水线,4B 适合把分数顶上去。它不是通用视觉问答,也不该被写成「替代整套文档智能平台」。代码仓星数低,接口和脚本还可能改;跟的是权重和基准,不是那个 GitHub 数字。

和传统 OCR 引擎比,它一次给出结构和框。和更大的文档 VLM 比,它把规格压到 0.8B 这一档,部署账好算一些。如果你已经在用空提示转写、又缺框去对齐版面,这条接地模式值得试一页自家 PDF。

相关文章

分享: