ByteNoteByteNote
video-use:2.6 万星开源让 Claude Code 剪视频,LLM 不看画面只读字幕

字节笔记本

2026年9月23日 · 约 4 分钟读完

video-use:2.6 万星开源让 Claude Code 剪视频,LLM 不看画面只读字幕

API中转
¥120

给 agent 一个装着原始素材的文件夹,说一句"把这些剪成发布视频",然后等它交出 final.mp4——这就是 browser-use 组织(就是做浏览器 agent 库 browser-use 那家)新开源的 video-use 在做的事。项目目前 2.6 万 stars(MIT 协议),今天再次冲上 GitHub Trending。

项目简介

video-use 的定位是"让编码 agent 剪视频":Claude Code、Codex、Hermes、Openclaw——任何有 shell 权限的 coding agent 都能驱动它。它最有意思的地方是一条反直觉的设计原则:LLM 自始至终不看原始视频画面

作者的类比很精准:就像 browser-use 给 LLM 提供结构化 DOM 而不是屏幕截图,video-use 给 LLM 提供的是两层结构化信息:

  • 转写层:用 ElevenLabs Scribe 对每条素材做逐词时间戳转写,带说话人分离和音频事件标注,所有素材打包成一份约 12KB 的 takes_packed.md,LLM 直接"读"完所有镜头;
  • 时间线层:一个 timeline_view 工具,在关键决策点才调用,生成胶片条 + 波形 + 词级标注的 PNG 快照给模型确认节奏。

它是怎么剪的

整条流水线是:Transcribe(转写)→ Pack(打包)→ LLM 推理 → EDL(输出剪辑决策表)→ Render(FFmpeg 渲染)→ Self-Eval(自评),自评不过就带着修改意见重渲,最多循环 3 轮。

具体能干的活包括:剪掉口水词和死时间、按自定义 FFmpeg 链自动调色、每个剪切点加 30ms 音频淡入淡出防爆音、烧录可定制字幕,还能生成动画叠加层(HyperFrames、Remotion、Manim 或 PIL,由并行子 agent 分头做)。所有剪辑上下文持久化在 project.md 里,跨会话可续。

快速上手

它以 Skill 形式接入,官方推荐装法:

bash
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use
# Codex 用户:ln -sfn ~/Developer/video-use ~/.codex/skills/video-use
cd ~/Developer/video-use
uv sync
brew install ffmpeg
cp .env.example .env   # 填入 ELEVENLABS_API_KEY

使用方式非常"agent 原生":cd 到素材目录,启动 claude(或 codex 等),说一句 "edit these into a launch video"。agent 会先盘点素材、给出剪辑策略、等你确认,然后在素材旁边产出 edit/final.mp4。懒得手动装的话,官方还提供一段可以整段粘给 agent 的 setup prompt,让它自己读 install.md 完成安装。

适合谁用

  • 用 Claude Code/Codex 的开发者:发布演示、教程、播客切片这类"内容为主、节奏为辅"的视频,批量出片效率极高;
  • 想给 agent 加视频能力的工具链作者:转写打包 + 决策点快照这两层抽象非常值得抄;
  • 注意两个前置:转写依赖 ElevenLabs API key(按量付费),渲染依赖本机 FFmpeg。

反过来说,需要精细创意控制的电影级剪辑,达芬奇/PR 仍然不可替代——video-use 的甜区是"把粗剪这件脏活交给 agent"。

仓库地址:github.com/browser-use/video-use(MIT)。

相关文章

分享: