
字节笔记本
2026年10月5日 · 约 13 分钟读完
VoxFlow:把语音、截图、剪贴板缝成一个 AI 工作台
如果你每天在 ChatGPT、Claude、Codex、Cursor 之间反复切换,一边打字描述需求,一边截图贴报错,一边复制粘贴上下文,那么这篇文章介绍的开源工具,可能正是你缺的那块拼图。
它叫 VoxFlow,一个原生 macOS 应用,把语音输入、OCR、剪贴板管理和 AI 编码助手控制台这四件事,缝成了一个统一的工作台。
它到底解决了什么痛点
先看一个真实场景。你在写代码时遇到一个 bug,正常流程是这样的:切到 AI 编码助手,用键盘打字描述问题;截图报错弹窗,粘贴进去;再复制相关代码片段贴进去;等回复,切回来改。整个过程里,你的手在键盘、鼠标、截图工具和剪贴板之间反复跳。每一步都不难,但串起来极其割裂。
VoxFlow 想做的,就是把这些割裂的步骤缝起来。它的核心理念一句话就能讲清:把语音、截图、剪贴板和 Agent 指令,沉淀为可检索、可预览、可复用的本地资产,再送回你正在工作的地方。
这里有三个关键词值得注意:本地资产,意思是数据留在你机器上;可复用,不是用完即弃;送回当前工作处,不抢焦点、不自动发送。所以它不是又一个语音助手,而是一个贴在当前应用上的资产工作台加快速启动台。
核心能力一览

VoxFlow 的功能不少,整理成一张表更容易看懂:
| 你想做什么 | 怎么触发 | 结果去哪 |
|---|---|---|
| 语音输入 | 按住快捷键说话,松开 | 插入到当前光标位置,不抢焦点 |
| 剪贴板图片 OCR | 复制图片后按 Cmd+Shift+V | 识别文字插入光标 |
| 框选截图处理 | 按 Cmd+Shift+A 框选屏幕 | 进入 OCR 面板,可继续翻译、总结、朗读 |
| 划词动作 | 选中文本后按 Cmd+Shift+F/J/K/L/P | 动作卡、翻译、总结、发任务助手、发问 AI |
| 启动台问 AI | Option+Space 打开启动台 | 聊天面板,流式回复 |
| 快速搜索 | 启动台输入关键词选 Quicklink | 跳默认浏览器,内置 Google、GitHub、B站、淘宝等源 |
| 任务助手 | 读取窗口上下文加口述意图 | 生成可复制的提示词,只复制不发送 |
| AI 编码控制台 | 说出任务名和任务内容 | 投递到本地 Codex、Claude、CodeBuddy 终端 |
表里几个设计特别值得展开。
按住说话,松开输入。 VoxFlow 的语音输入不是常驻监听,而是对讲机模式:按住快捷键说话,松开就把文字插到当前光标。你在 Cursor 里写代码,按住快捷键说一句“这里加个空值检查”,松开,文字就进了 Cursor 的输入框,不需要切窗口,也不需要点输入框。它真的只是把语音变成键盘输入。
截图后的动作链。 框选截图 OCR 出文字不是结束,而是开始:识别结果可以继续翻译、总结、朗读。一条链路把截图、识别、处理串起来,不用在三个工具之间倒腾。
划词即处理。 选中文本后,不同快捷键触发不同动作。原来“选中、复制、切到翻译工具、粘贴、翻译、复制、切回来、粘贴”的一长串,被压缩成“选中、按一个键”。
语音识别:10 个本地模型,云端可选
这是 VoxFlow 最硬核的部分。它不绑定某一个语音模型,而是把主流的本地和云端 ASR 都接进来,按场景挑选。
本地模型方面:系统自带方案开箱即用,不用下载模型;Qwen3-ASR 0.6B 与 1.7B 是默认推荐,体积和速度均衡,1.7B 准确率更高但更吃内存;FunASR Nano 是中文本地备选,不依赖 CoreML;Whisper Turbo 与 Large V3 提供多语言高质量转写;SenseVoice 和 Paraformer 侧重中文短句与转写;NVIDIA Nemotron 0.6B 支持原生流式多语言;Parakeet Streaming 主打英文低延迟流式;还有覆盖超多语言的 Omnilingual ASR。项目特别强调,本地模型的音频不上传任何第三方云服务,推理全部在本机完成,这对处理内部代码、客户数据这类敏感内容非常重要。
云端模型包括:Groq,免费,OpenAI 兼容接口,默认 whisper-large-v3-turbo,松开后快速返回;腾讯云,实时流式 WebSocket,面向中文普通话;阿里云 DashScope,实时流式,支持中文与多语言;火山云、AssemblyAI、ElevenLabs 在规划中。所有云端凭据存在本地,显式配置才会启用。
这个设计的妙处在于它不替你做隐私权衡:想要速度和准确率就选云端,处理敏感数据就选本地,开关始终在你手里。
易错词纠错:让 AI 听懂技术名词
用语音输入写代码的人都有体会:技术名词的识别率往往惨不忍睹,Kubernetes 被识别成“库伯耐特斯”,macOS 被识别成“麦克 OS”,React 被识别成“瑞克特”。VoxFlow 用两层方案解决这个问题。
第一层是本地确定性规则,默认开启。你维护一张易错词表,比如把 Kubernetes 替换成 K8s,识别完成的文字先过一遍这张表做确定性替换。规则在本地运行,不耗 token,也不上传数据。
第二层是可选的 LLM 纠错,默认关闭。开启后只把识别出的文本(不是音频)发给你配置的 API 做后处理。
还有一个聪明的补充叫上下文热词:它会用 Vision OCR 读取你当前屏幕上的文字,提取临时热词加进这次识别。你正看着一篇关于 PostgreSQL 的文档,那这次语音输入里的 PostgreSQL 就更不容易被识别错。
用语音指挥多个编码 Agent
这是 VoxFlow 最有想象力的功能。假设你同时开着 Codex、Claude Code、CodeBuddy 三个终端 Agent,这在多 Agent 工作流里很常见,正常情况下你要切到对应终端、打字下指令。VoxFlow 的做法是:按住语音快捷键,直接说“Claude,帮我重构这个函数”,它会解析出目标 Agent,展示确认状态,然后把指令投递到对应的终端会话。一句话就把任务派给了指定的 Agent,不用切窗口,也不用打字。

边界要说清楚:它只投递已注册的会话,不自动提交。指令到了 Agent 的输入框,要不要执行仍由你决定。这是 VoxFlow 一贯的克制:增强你的输入效率,但不替你做决策。
底层则是一个用 Rust 写的 agent-cli helper,通过 JSON IPC 和 MCP 协议自报身份,把语音指令路由到正确的 Agent。
资产工作台:输入沉淀成可检索的资产
语音、截图、剪贴板,用完就过去了吗?在 VoxFlow 里没有,它们都被沉淀成本地资产,放进一个完整的工作台。
首页汇总历史资产、今日新增与来源分布,支持搜索、复制、删除;易错词页管理纠错规则与候选学习;风格页为不同应用设置输出风格,比如原文、正式、邮件、编程说明;文件转写页可以导入音视频排队转写,导出 txt、md、srt;笔记页直接录音记录,支持编辑、搜索、回看;截图页浏览历史截图,查看原图与 OCR 文本,可收藏可搜索;AI 编码助手页查看已注册 Agent 的别名、工作目录、分支与调度记录;设置页管理输入设备、快捷键、模型、权限与隐私。
这意味着你昨天语音输入的一段代码说明、前天截图的一个报错、刚才复制的一段日志,全部可检索、可回看、可复用。它不是用完即弃的一次性输入工具,而是一个持续积累的个人知识库。
隐私:能留在本机的,就留在本机
VoxFlow 的隐私设计值得单独一节,项目把隐私说明放在了很显眼的位置。
历史记录、易错词、笔记、任务本地保存;截图原图与 OCR 文本本地保存,不上传;剪贴板资产本地保存,并带噪音过滤,避免无意义内容长期占用;LLM API Key 存进 macOS Keychain,享受系统级加密;云端 ASR 凭据存本地 SQLite,可在设置页临时显示或隐藏;本地模型下载后在本机运行,音频不出机器;LLM 纠错默认关闭,开启后只发识别文本、不发音频;只有你主动选择云端 ASR 时,录音才会发给对应服务商。
一句话总结这套设计:默认本地,云端显式。它不是默认把你的数据送上云,而是反过来,只有你主动配置了云端服务,对应数据才会上传,而且只上传必要的部分。VoxFlow 自己不会主动上传笔记、历史资产或剪贴板内容。
技术栈:原生 macOS,不是 Electron 壳
这点在当下尤其难得。VoxFlow 用 Swift 6、SwiftUI、AppKit 和 SwiftPM 构建,是真正的原生应用。相比 Electron 套壳,它更轻量,不用动辄占几百 MB 内存;响应更快,系统集成度更高;也更省电,没有 Chromium 后台进程持续耗电。
系统层用了 AVFoundation、Speech、Vision、Accessibility、Pasteboard;截图采集用 ScreenCaptureKit 加 CoreGraphics;本地 ASR 整合了 speech-swift、WhisperKit、FluidAudio、Sherpa-ONNX;云端接 OpenAI 兼容 HTTP、Groq、腾讯云、阿里云;易错词纠错是自研的 VoxFlowVoiceCorrectionKit;AI 编码助手路由则是 Rust 写的 agent-cli 加 JSON IPC 与 MCP。
在 Swift 应用里嵌一个 Rust 组件处理 Agent 路由,是个务实的工程选择:Swift 管 UI,Rust 管性能敏感的 IPC。
它适合谁
高度匹配的场景:经常和 ChatGPT、Claude、Codex、Cursor 沟通,需要快速描述需求、上下文和修改意见;同时开多个终端 Agent,想用语音派任务;写代码时常要解释 bug、补注释、写提交信息、记录排查过程;经常从截图、网页、报错弹窗里提取文字,再做翻译或总结;中英文混说多,希望技术词、产品名、专有名词识别更准。
可能不适合:不用 Mac 的用户,这是原生 macOS 应用;习惯纯键盘流、不需要语音输入的人;以及对“又一个工具”有抵触、喜欢极简工作流的人。
几条一以贯之的设计哲学
增强输入,不替你决策。 语音转的文字到了光标,发不发出你决定;任务助手的提示词生成了,用不用你决定;指令投给 Agent 了,执不执行你决定。在 AI 工具普遍越俎代庖的当下,它守住了“工具是工具,人是人”的边界。
本地优先,云端可选。 音频、截图、笔记、历史,能不上云就不上云,云端能力全部显式配置才启用,而且只传必要数据。放在 2026 年的开发者工具里看,本地优先和数据主权正在成为一条越来越清晰的主线:用户的代码、对话和屏幕内容,默认应该留在用户自己的机器上。
把割裂的步骤缝起来。 语音、截图、剪贴板、Agent 控制以前是四个工具,VoxFlow 把它们缝成一个工作台,而且缝得自然:截图完能翻译,翻译完能总结,总结完能发给 Agent。不是简单的功能堆砌,而是工作流的连贯。
沉淀成资产,而非用完即弃。 大多数输入工具都是一次性的,用完就过去了。VoxFlow 把每一次输入都沉淀成可检索的资产,时间一长,它就成了你的个人工作知识库。
怎么获取
项目地址:github.com/xingbofeng/VoxFlow;官网:xingbofeng.github.io/VoxFlow。项目用原生 Swift 实现,README 提供中、英、日、韩多语言版本;许可证标记为 NOASSERTION,商用或二次分发前建议先到仓库确认具体条款;系统要求见仓库 README。
写在最后
VoxFlow 不是那种颠覆性的产品,它是把已有能力组合得更顺手的工具。语音识别不新鲜,OCR 不新鲜,剪贴板管理不新鲜,Agent 控制也不新鲜,但把它们缝进一个原生 macOS 应用、守住本地优先与不替你决策的边界、再把每次输入沉淀成可复用的资产,这个组合就很有价值。
如果你是 Mac 上的重度 AI 编码用户,每天在多个 Agent 之间切换、频繁描述需求、截图贴报错,值得花一个下午试试。它可能不会立刻改变你的工作流,但一旦用顺了,那些切窗口、打字、截图、粘贴的割裂感,会悄悄消失。
注:项目信息基于 2026 年 6 月的 VoxFlow 仓库 README,功能、模型支持与技术栈可能随版本更新调整,以仓库实时状态为准。



