ByteNoteByteNote
凭什么一天涨三千星?这个开源语音工作站把 ElevenLabs 搬回了本地
字

字节笔记本

2026年9月28日 · 约 5 分钟读完

凭什么一天涨三千星?这个开源语音工作站把 ElevenLabs 搬回了本地

API中转
¥120

配音按字符计费、克隆声音得把素材传上云,一直是视频创作者和有声书作者的隐痛。VoiceStudio 把 ElevenLabs 的核心能力整套搬回了本地:声音克隆、音色设计、视频配音、听写、转录、有声书生成,覆盖 646 种语言,全部跑在你自己的硬件上。这个开源项目最近冲上 GitHub Trending,一天涨了三千多星,总星标已突破 4 万,增速排在全站第二。

项目简介

VoiceStudio 是一个完全本地化运行的开源语音工作站,采用 AGPL-3.0 协议,官方定位就是 ElevenLabs 的开源替代品。桌面端用 Electron 打包,支持 macOS、Windows 和 Linux,也提供 Docker 方式;早期的 Tauri 版本已停止维护,现在 Electron 是唯一的桌面入口。

它的默认语音引擎是 k2-fsa/OmniVoice,官方还维护了一份引擎目录和基准测试,显存不够或者想要不同音质时可以按需切换模型。更难得的是,它不只是个 GUI 工具:内置本地 API 和 MCP 接口,Claude Code、Codex 这类编码 agent 可以直接把配音、转录当成工具来调,也可以把重活交给可选的远程 worker。

VoiceStudio 的声音克隆工作区

核心功能

声音克隆:上传一段干净的参考录音,选好文本就能生成同音色的语音,官方界面里内置了一个演示音色,开箱即可试效果。

音色设计:没有参考音频也没关系,用自然语言描述你想要的声线(比如"低沉的男中音、纪录片旁白感"),系统会按描述生成对应音色。

用文字描述直接设计音色

视频配音:按时间轴对齐台词生成配音,适配短视频翻译、教程本地化这类场景;配合 646 种语言的支持,一条素材可以批量出多语言版本。

听写与转录:全局悬浮窗听写适合日常输入,批量转录适合整理播客和会议录音,这两块对长内容创作者最省时间。

有声书与批处理:长文本按章节切分生成有声书,批处理任务可以挂队列过夜跑。

视频配音工作区按时间轴对齐台词

快速上手

macOS 和 Linux 一行命令安装:

sh
curl -fsSL https://voicestudio.sh/install | sh

Windows 用户直接去 Releases 页面 下载安装包。装好后打开 Voice cloning 工作区,选一个音色或上传参考录音,输入文本点生成;首次使用会提示安装对应的语音模型,按提示确认即可。卸载时加 --uninstall 参数,设置、项目和模型都会保留。

想从源码跑或者参与开发:

bash
git clone https://github.com/debpalash/VoiceStudio.git
cd VoiceStudio
bun install
bun run setup:api
bun run dev

它还有一个很"2026"的安装方式:把官方文档里那段安装提示词直接贴给 Claude Code、Codex 或 Cursor,让 agent 帮你完成装环境、装模型、测试生成全过程;支持 skills 的 agent 也可以执行 npx skills add debpalash/VoiceStudio 获得音频工作流技能。

适合谁用

视频与播客创作者:配音、转录、多语言版本一条龙本地完成,没有按字符计费的账单,素材也不出本机。

隐私和内网场景:医疗、法律、企业内部内容的语音处理全程不出设备,这正是"全本地"最大的价值。

agent 开发者:本地 API 加 MCP 让语音能力可以直接挂进自动化工作流,比如让 agent 定期把文章转成播客音频。

两点提醒:协议是 AGPL-3.0,各语音模型另有自己的许可,商用前要逐个确认;克隆他人声音务必先获得授权,官方文档里也明确了这一条负责任使用原则。对于被订阅费和云端隐私反复劝退的用户,这个项目值得装来试试。

相关文章

分享: