ByteNoteByteNote
FluidVoice:用嘴写代码的 Mac 语音输入工具
字

字节笔记本

2026年10月6日 · 约 19 分钟读完

FluidVoice:用嘴写代码的 Mac 语音输入工具

API中转
¥120

这个开源免费的 Mac 语音输入工具,本地运行、不需要联网、还带 AI 润色,一个 brew install 就能装上。我用了一周,有些话不得不说。


先交代背景

我是一个打字很快的人。全拼输入法,每分钟大概能打 80-100 个汉字。

但我一直有一个痛点:想写东西的时候,脑子里是完整的句子,手指却跟不上。 特别是在写文章、写代码注释、回微信消息的时候,脑子里想到的和手上敲出来的之间总有一个延迟。这个延迟有时候会导致你想好的措辞忘了。

语音输入我试过不少,但都不满意:

  • 搜狗语音输入:要联网,识别结果要传到云端,隐私是个问题
  • 苹果自带的听写:准确率还行,但每次识别完就是一堆光秃秃的文字,没有标点、没有分段、语气词全留着
  • Wispr Flow:好用,但要 $15/月,而且是云端处理
  • Superwhisper:本地优先,但要 $249 终身买断

直到我看到一条热门推文,推荐了一个叫 FluidVoice 的开源工具。

推荐语说:本地运行、不需要联网、支持 AI 润色、可以搭配 deepseek-v4-flash 使用。

我花了一分钟安装,然后用了一周。

下面是我这一周的使用体验和详细测评。


一分钟安装

不夸张,真的只要一分钟。

打开终端,输入:

bash
brew install --cask fluidvoice

完事了。

当然,前提是你装了 Homebrew。如果你连 Homebrew 都没装,那需要先花三分钟装一下:

bash
/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"

装好 FluidVoice 之后打开它,第一次运行会引导你做几件事:

  1. 选择语言:中文、英文、日文……25+ 种语言可选
  2. 选择语音引擎:这个后面详细说,有好几个选项
  3. 授予权限:麦克风权限 + 辅助功能权限(这个必须给,不然它没法在别的应用里输入文字)
  4. 设置快捷键:默认是按住某个键说话,松开就出文字

权限授权在 系统设置 → 隐私与安全性 → 麦克风 和 系统设置 → 隐私与安全性 → 辅助功能 里操作。


FluidVoice 到底是什么?

FluidVoice 是一个 macOS 原生的开源语音转文字听写应用。

用大白话说就是:你对着电脑说话,它帮你把声音变成文字,然后直接输入到你当前正在使用的任何应用里。

你在微信里,它就往微信的输入框里打字。你在 VS Code 里,它就往代码编辑器里打字。你在浏览器里,它就往搜索框里打字。

不需要你切换到任何特定的应用,也不需要你复制粘贴。

GitHub 地址:github.com/altic-dev/FluidVoice 开发者:altic-dev(Swift 原生开发) Stars:3,300+ 版本:1.6.1 系统要求:macOS 15.0(Sequoia)或更高 支持芯片:Apple Silicon(M1/M2/M3/M4)和 Intel Mac 都行 价格:完全免费,开源


它为什么特别:三层架构拆解

FluidVoice 的技术架构分三层,一张图看明白:

FluidVoice 三层架构:语音识别、AI 润色、应用注入

声音进来,先由语音识别引擎变成原始文字,再交给 AI 润色引擎整理成可读文本,最后通过应用注入写进你正在用的软件。每一层都有多种选择,可以自由组合。

第一层:语音识别引擎(6 个选项)

FluidVoice 支持 6 种语音识别引擎,从"零下载"到"高精度"都有:

引擎类型需要下载?特点
Apple Speech系统内置不需要macOS 26+ 内置,零配置,WWDC 2025 的 SpeechAnalyzer API
Parakeet Flash本地模型需要最快,仅英文,Beta 版本,延迟极低
Parakeet v3本地模型需要多语言,实时转录
Parakeet v2本地模型需要多语言,英文 WER 6.05%(词错误率)
Nemotron Speech 3.5本地模型需要NVIDIA 出品,通过 CoreML 在设备端运行
Whisper本地模型需要OpenAI 出品,支持 25+ 种语言,精度最高但算力要求也高

我的选择策略:

  • 如果你是 macOS 26(Tahoe):直接用 Apple Speech,零下载、零配置、够用
  • 如果你要写中文文章:用 Whisper Large V3,中文识别率最高
  • 如果你要追求极致速度(只说英文):用 Parakeet Flash
  • 折中方案:Parakeet v3,多语言 + 速度和精度的平衡

所有模型都是通过 CoreML 在 Apple Silicon 上运行的,也就是说它们都是在你的 Mac 的芯片上本地推理,不需要联网。

第二层:AI 润色引擎(本地 + 云端双选项)

这是 FluidVoice 和其他语音输入工具最大的区别。

原始的语音识别结果通常是这样的:

今天我想跟大家聊聊关于 fluid voice 这个工具它是一个 mac 上的开源语音输入应用然后我用了大概一周的时间觉得还不错想给大家分享一下我的使用体验

你看,没有标点、没有分段、语气词全留着、"然后""关于"这些口头禅也都在。

FluidVoice 的 AI 润色引擎会把这个原始文本处理成:

今天我想跟大家聊聊 FluidVoice 这个工具。它是一个 Mac 上的开源语音输入应用,我用了一周左右的时间,觉得还不错,想和大家分享一下我的使用体验。

标点加了、分段有了、语气词去了、口头禅也处理了。

本地润色选项:Fluid-1 模型

FluidVoice 自带了一个叫 Fluid-1 的本地 AI 模型,专门用于文本润色。它完全在你的 Mac 上运行,不需要联网。

能力包括:

  • 智能标点添加
  • 语法修正
  • 大小写规范化
  • 语气词/口头禅删除
  • 语气调整

云端润色选项:DeepSeek、Kimi、GLM 等

除了本地的 Fluid-1,你还可以配置云端 AI 模型来做润色,常见的搭配是 deepseek-v4-flash 这类模型。

配置方式是通过 NVIDIA NIM 或 OpenRouter 的 API Key:

  1. 去 OpenRouter 注册账号
  2. 获取 API Key
  3. 在 FluidVoice 的设置里填入 API Key
  4. 选择你想要的模型(DeepSeek、Kimi、GLM 等)

云端模型比本地 Fluid-1 更强的地方在于: 它不仅能润色,还能改写、调整语气、甚至帮你把口语化的表达变成书面语。对于写文章这种场景特别有用。

我的配置:日常用 Fluid-1(零延迟、完全本地),写长文章的时候切换到 deepseek-v4-flash(效果更好)。

第三层:应用注入

FluidVoice 通过 macOS 的辅助功能 API(Accessibility API)把识别结果直接输入到当前活跃的应用中。

这意味着:

  • 不需要复制粘贴
  • 不需要切换应用
  • 你在哪个应用里,文字就出现在哪里

还支持一个特别实用的功能:Rewrite(改写)

你选中任何应用里的任何文字,然后对 FluidVoice 说"改写",它就会用 AI 帮你重新组织那段文字。


四种使用模式

FluidVoice 提供了四种交互模式,我按使用频率排序:

模式一:Press & Hold(按住说话),我最常用的模式

按住快捷键开始识别,松开就出文字。就像微信语音消息反过来:你是说话的那个人,但出来的不是语音,而是文字。

适用场景:写文章、写代码注释、写邮件

模式二:Toggle(切换模式)

按一下快捷键开始识别,再说一下停止。

适用场景:你需要两只手操作的时候(比如翻资料的同时口述)

模式三:Tap(点击模式)

单次点击开始,再次点击停止。

适用场景:和 Toggle 类似,但操作更轻量

模式四:Command Mode(命令模式)

这个是 FluidVoice 1.5 之后加的新功能,我一开始以为是个噱头,用了之后发现是真的香。

你可以直接用语音执行 macOS 命令:

  • "截屏" → 自动截屏
  • "打开设置" → 打开系统设置
  • "新建文件夹" → 在 Finder 里创建新文件夹
  • "按下 Command+S" → 模拟键盘快捷键

还支持执行终端命令。虽然我还没怎么用这个功能,但能感觉到它在向"语音操控电脑"的方向走。


我这一周的使用记录

Day 1:安装和配置

花了一分钟安装,花了大概 10 分钟配置。

选择了 Whisper Large V3 作为语音引擎(中文识别率高),Fluid-1 作为润色引擎。

第一天主要是试各种设置,看看哪种组合效果最好。

第一个感受:识别速度真的很快。 说话的同时,文字就出来了,几乎是实时的。

第二个感受:润色效果不错。 语气词基本都去掉了,标点也加得合理。

Day 2:写了一篇长文

当天有一篇稿子要写。我尝试了全程语音输入。

实际操作中我发现,完全不用键盘不太现实。我的习惯变成了:

  • 大段内容:语音输入(效率最高)
  • 修改细节:键盘修改
  • 代码块:键盘输入(语音输入代码目前还不靠谱)

大概 60% 的内容是语音输入的,40% 是键盘补充的。整体写作速度比纯键盘快了大概 30-40%。

Day 3:日常办公

这一天主要用来测试日常办公场景:

  • 微信回复:效果不错,口语化的消息润色后反而更得体
  • 邮件回复:正式邮件的语气调整特别好,Fluid-1 能把口语化的表达改成更正式的措辞
  • Slack 消息:英文消息的识别率比中文更高
  • 代码注释:中文注释语音输入效果不错,英文注释也可以

Day 4-7:深度使用

这几天我基本养成了一个习惯:凡是超过一句话的内容,都用语音输入。

发现了一个特别有用的场景:早上写日报/工作总结。

以前我每天早上要花 15-20 分钟写日报。用 FluidVoice 之后,对着电脑说一遍我昨天做了什么、今天打算做什么,大概 3-5 分钟就能生成一份结构清晰的日报。然后再花 2-3 分钟修改一下就能发了。

整体效率提升了大概 3-4 倍。


不同场景的最佳配置方案

根据我这一周的测试,我总结了几套不同场景的最佳配置,先上一张速查表:

FluidVoice 场景配置速查表与坑点提示

配置 A:写中文文章

项目选择
语音引擎Whisper Large V3
润色引擎deepseek-v4-flash(通过 OpenRouter)
激活模式Press & Hold
说明Whisper 中文识别率最高,DeepSeek 的润色效果最好

配置 B:日常办公(微信/邮件/Slack)

项目选择
语音引擎Apple Speech(macOS 26+)或 Parakeet v3
润色引擎Fluid-1(本地)
激活模式Toggle
说明速度快,零配置,润色够用

配置 C:英文内容

项目选择
语音引擎Parakeet Flash 或 Nemotron 3.5
润色引擎Fluid-1
激活模式Press & Hold
说明英文识别延迟最低,Fluid-1 英文润色效果已经很好

配置 D:隐私优先(完全不联网)

项目选择
语音引擎任意本地模型
润色引擎Fluid-1(本地)
激活模式任意
说明所有处理都在本地完成,零数据离开你的 Mac

和其他工具的对比

我把 FluidVoice 和市面上主要的 Mac 语音输入工具做了个对比:

FluidVoiceWispr FlowSuperwhisperMacWhisper
价格免费$15/月$249 终身免费/$19.99
开源是否否否
本地运行是否(云端)是是
AI 润色本地+云端云端本地无
命令模式是否否否
文字改写是是否否
语音引擎数6 种1 种2 种1 种
语言支持25+20+20+25+
隐私最高低(云端)高高

结论很明确:FluidVoice 是目前 Mac 上唯一一个同时满足"免费""开源""本地运行""AI 润色"四个条件的语音输入工具。

Wispr Flow 的 AI 润色可能更强(毕竟是云端大模型),但你每月要付 $15,而且数据要传到云端。Superwhisper 虽然本地优先,但 $249 的价格让很多人望而却步。

FluidVoice 的 Fluid-1 润色虽然不如云端大模型那么"聪明",但对于大多数场景已经够用了。而且如果你想用云端模型(DeepSeek、Kimi),它也支持。


一些需要注意的坑

说了这么多好的,也得说说遇到的问题:

1. 混合中英文识别

如果你说话时中英文混用(比如技术术语用英文、其他用中文),识别准确率会下降。特别是英文技术术语("API""React""Kubernetes"这些),Whisper 有时候会识别成中文谐音。

解决办法:说的时候尽量把英文术语说得慢一点、清晰一点。或者在润色环节让 AI 模型帮忙修正。

2. 专业术语识别

医学、法律、金融等专业术语的识别率会低一些。这是所有语音输入工具的通病,不是 FluidVoice 特有的。

3. 语音引擎的存储空间

Whisper Large V3 模型大概要占几个 GB 的空间。如果你用的是 256GB 存储的 MacBook Air,需要注意一下。

4. Intel Mac 的性能

FluidVoice 在 Intel Mac 上也能用,但模型推理速度会比 Apple Silicon 慢不少。如果你还在用 Intel Mac,建议选择轻量级模型(Parakeet Flash 或 Apple Speech)。

5. UI 有人吐槽

社区里有人吐槽 UI 丑。确实,FluidVoice 的 UI 不算是精心设计的,但作为一个开发者一个人做出来的开源项目,我觉得可以理解。功能够用就行。


它不只是语音输入

写到这儿我发现,FluidVoice 其实已经超出了"语音输入工具"的范畴。

它更像是一个 语音交互层(Voice Interaction Layer),让你可以用语音来和电脑交互,而不只是语音转文字。

命令模式让你能用语音操控电脑。改写功能让你能用语音修改文字。历史记录让你能回顾和管理之前的语音输入。

开发者 altic-dev 在 Reddit 上说过,Windows、iOS 和 Linux 版本也在计划中。如果这个方向走下去,FluidVoice 可能会成为跨平台的语音交互基础设施。


我的建议

如果你是 Mac 用户,不管你写不写代码,我都建议你试试 FluidVoice。原因很简单:

  1. 免费开源:试了不满意,卸了就是,零成本
  2. 本地运行:不传数据到云端,隐私有保障
  3. 安装简单:一条 brew 命令搞定
  4. 效果确实好:至少比我用过的其他免费工具好很多

安装命令再贴一遍:

bash
brew install --cask fluidvoice

GitHub 地址:github.com/altic-dev/FluidVoice

去 Star 一下吧,3,300+ Star 了,这个开发者在一个人做这件事,值得支持。


参考来源:

  • FluidVoice GitHub: github.com/altic-dev/FluidVoice
  • FluidVoice 官网: altic.dev/fluid
  • Homebrew Cask: formulae.brew.sh/cask/fluidvoice
  • Reddit r/macapps: 开发者更新帖和社区讨论
  • dicta.to: Mac 语音识别引擎对比测试
  • Explainx.ai: FluidVoice 1.6.1 详细分析

相关文章

分享: