
字节笔记本
2026年10月7日 · 约 2 分钟读完
机器人学会自我补偿,跟人类视频学动作
今日 Hugging Face 论文榜的机器人双作,一篇让机械臂在部署现场自己修偏差,一篇让策略从人类第一人称视频里偷师。

自补偿 VLA:残差就是老师
Sohyun Lee 等人的论文(arXiv:2609.37334,今日榜 19 赞第 7 位)盯的是一个仿真里不存在、真机躲不掉的问题:机械磨损、载荷变化让实际动作偏离指令。方案叫自补偿:部署时在线更新策略,监督信号就用指令动作与执行动作之间的残差,不需要任务奖励也不需要人工标签。
配套的 RoboStress 基准把关节级物理模型(摩擦、背隙、柔性、重力补偿误差)编进七种部署场景做压测。成绩:胜过基础策略与鲁棒性训练基线;更有说服力的是两台使用历史不同的物理机械臂,平均任务成功率各提升超过 30 个百分点,且增益泛化到未见过的物体。与站内写过的 RobotUse 剧本线正好互补:一个从执行反馈学经验,一个从执行偏差修模型。
WING:低频语义跨形态共享

Zhiming Liu 等十人的 WING(arXiv:2610.03607,13 赞第 9 位)处理交互知识迁移:把第一人称人类视频里的操作经验搬到机器人策略。两个老障碍:帧重建得到的潜在动作被相机自运动这类干扰因素主导;人与机器人的时间动力学又不同步。
WING 的解法三步走:先分离观察者引入的运动与手物交互本身;把交互部分蒸馏成交互中心的潜在动作;再识别人类潜在动作与机器人行为之间共享的低频谱成分,慢变时序里装的正是跨形态的任务语义,用它指导动作生成。数字:LIBERO 平均 99.2 个百分点,RoboTwin 2.0 达 93.8,RoboCasa-GR1 拿 57.7,四个真机操作任务在多种泛化设置下表现稳健。项目页已开放,代码入口以项目页为准。
放在一起读
一篇在执行端闭环纠偏,一篇在数据端扩充来源。机器人 agent 这条线本周已经五连发,从世界模型到 harness 到自补偿,真机落地的拼图在快速补齐。



