ByteNoteByteNote
产线上的 PLC,命令行里的功劳簿
字

字节笔记本

2026年10月5日 · 约 2 分钟读完

产线上的 PLC,命令行里的功劳簿

API中转
¥120

agent 写代码这件事,在网页与脚本场景已经卷得差不多了,真正的硬骨头在更贴近物理世界的地方。arXiv 周一批次里有两篇分别把考场搬到了工厂产线与终端命令行,都很扎实。

两篇论文封面图

PLCWorld:闭环产线里考 PLC 编程

可编程逻辑控制器是工厂自动化的心脏,程序出错轻则停线重则事故。Yunji Kim 等人的 PLCWorld(arXiv:2610.02982)给 LLM 生成的 PLC 程序搭了一个闭环执行环境:结构化文本程序在仿真产线里跑,产线状态与传感器反馈实时回传,程序对不对、安不安全,跑一遍就知道。

考卷共 100 个合成任务、473 组任务条件对,覆盖运动控制与物料搬运两类场景。判分设计值得称道:任务成功与安全违规分开统计,跑成了但越了安全线照样挂科。验证也下功夫:从业者复核、参照程序与替代实现、542 个定向反例、与独立结构化文本运行时交叉比对。

成绩单揭示了真实差距:GPT-5.5 在简单任务上拿到 82.7% 的成功率,难题直接掉到 25.1%;六个模型加四种生成验证工作流的横向对比还显示了完成度、安全与成本的取舍。代码、仿真环境、基准与基线全部开源。

DepGPO:把功劳记到具体的命令上

考卷判分与信用分配图解

另一篇 Credit Where It Matters(arXiv:2610.03634,Yu Li 等八位作者)解决训练侧的老问题:终端 agent 的多步任务里,到底是哪条命令促成了最终结果?现有按轨迹或按步的信用分配方法都说不清楚,因为它们不追踪命令通过读写依赖影响结局的路径。

DepGPO 的做法是从执行轨迹构建命令依赖图,再从任务校验器检查过的资源出发反向回溯,把信用分给相关的写入操作及其支撑的读取操作,轨迹层面的优势由此按步重新分配。实验与消融显示,复杂终端任务上的成绩与训练稳定性同步提升。页面未见代码链接。

放在一起读

一篇定义了工业场景的验收标准,一篇改进了终端 agent 的训练算法,恰好是 agent 走向物理与系统深处要过的两道门。加上此前写过的 Mimir 物理接地灌溉,agent 在真实世界里讲究证据与安全的这条线,正在从论文走向可复用的工程方法。

相关文章

分享: