一个人!1564次提交!14个TTS引擎!VoiceStudio把ElevenLabs从里到外拆了一遍!

admin 2026-08-17 07:21:25 网络安全文章 来源:ZONE.CI 全球网 0 阅读模式

文章总结: VoiceStudio是一个由个人开发者debpalash创建的开源语音工作站,支持14个TTS引擎和11个ASR引擎,覆盖646种语言。它提供零样本语音克隆、视频配音、有声书制作等功能,所有处理均在本地运行,保护用户隐私。项目采用AGPL-3.0协议,可免费商用,并兼容OpenAIAPI,适合需要高质量语音合成的开发者和内容创作者。 综合评分: 85 文章分类: 产品介绍,AI安全,安全工具


cover_image

一个人!1564次提交!14个TTS引擎!VoiceStudio把ElevenLabs从里到外拆了一遍!

内存泄漏

2026年8月15日 18:27 辽宁

在小说阅读器读本章

去阅读

以下文章来源于AI探知 ,作者AI探知

AI探知 .

这是您探索人工智能奇妙世界的专属窗口。在这里,我们一同见证人工智能如何重塑现在与未来,开启一场充满惊喜与启迪的 AI 智慧之旅。


你有没有算过,用ElevenLabs做一条配音,要花多少钱?

轻度用户每月5美元,只够生成1万字符。如果你的视频频道每天出两条,光配音成本就能让你怀疑人生。更别提你的声音数据要上传到他们服务器,隐私这件事,基本靠信仰。

半个月前我写过voicebox,那个项目把ElevenLabs和WisprFlow做了个本地平替,当时觉得已经够猛了。结果最近又冒出来一个更狠的——VoiceStudio。

它的slogan是”Make voices. Tell stories. Keep the files.”——翻译过来就是:做声音,讲故事,文件归你。

简单粗暴,直击灵魂。

一个人搞出的”语音全家桶”

先说个让我震惊的事实:这个项目的主要开发者叫debpalash,基本是一个人干的。

1564次提交,41个贡献者(大部分是自动化工具),35个release版本,8月11日刚发布了5.0.0。从语音克隆到视频配音,从有声书制作到全局听写,一个人把这些功能全写完了。

我不是说一个人做就一定好,但这个工作量放在开源社区里,绝对属于”不要命”级别。

VoiceStudio的前身叫OmniVoice-Studio,8月7号刚改了名。改名的同时还发了5.0.0大版本,加了远程GPU Worker支持、安全加固、跨平台安装器一大堆东西。这节奏,像是打了鸡血。

14个TTS引擎+11个ASR引擎,卷到没朋友

VoiceStudio最让我服气的地方,是它的引擎数量。

14个TTS引擎:包括自研的VoiceStudio模型、CosyVoice 3、GPT-SoVITS、VoxCPM2、MOSS-TTS-Nano、KittenTTS、MLX-Audio、Sherpa-ONNX、IndexTTS 2.5、Supertonic 3等等。不同引擎各有特长——有的擅长多语言,有的在CPU上也能跑,有的情绪表达更自然。

11个ASR引擎:WhisperX、Faster-Whisper、MLX Whisper、Parakeet TDT、Moonshine、FunASR/SenseVoice、sherpa-onnx……基本把主流的语音识别方案全包了。

它还有一个智能路由系统:每次生成前自动检查你的GPU型号,告诉你哪个引擎能跑、哪个跑不动,不会偷偷给你切到CPU然后卡成PPT。

ElevenLabs呢?一个模型打天下,32种语言。VoiceStudio直接支持646种语言,翻了20倍。

3秒克隆你的声音,数据不离开电脑

语音克隆这个功能,现在已经是AI配音工具的标配了。但VoiceStudio的做法有几个不一样的地方:

第一,零样本克隆。 只需要3秒的参考音频,就能克隆出你的声音。不需要几个小时的数据集,不需要训练,录一段直接生成。

第二,完全本地运行。 你的声音数据不会上传到任何服务器。克隆出来的声音模型、生成的音频文件,全在你自己电脑上。在一个AI隐私泄露频出的年代,这一点太重要了。

第三,便携式声音档案。 你可以把克隆出来的声音导出为.ovsvoice文件,带走、分享、备份。这个格式包含了你的声音特征和AI水印信息。

说到这里就不得不提它的AI水印功能——用的是Meta开源的AudioSeal技术,在生成的音频里嵌入不可见的神经水印。这种水印能扛住压缩、转码,即使你把它上传到YouTube再下载回来,水印还在。

为什么需要水印?因为当AI克隆声音太容易的时候,鉴别”这段音频是不是AI生成的”就变成了刚需。VoiceStudio在这一点上想得比较远。

不只是配音,是完整的音频生产线

如果只是语音克隆+TTS,那VoiceStudio和市面上其他工具也没太大区别。但它真正让我觉得”这东西有想法”的,是围绕配音搭建的一整套工作流。

视频配音:完整的流水线——转录→翻译→合成→混流→输出MP4。支持场景感知分段、逐说话人声音分配、Smart Fit时间对齐。丢50个视频进去批量处理,然后去喝杯咖啡就行。

有声书制作:EPUB/PDF直接丢进去,自动分章节、多角色配音、生成.m4b文件。每个章节可以绑定不同的声音,进度实时显示,中断了还能断点续传。

多角色故事编辑器:给不同角色分配不同声音,写剧本式地编排对话,然后一次性合成。播客创作者应该会很喜欢这个功能。

全局听写快捷键:macOS上按⌘⇧Space,弹出一个浮动窗口,说完话自动把文字粘贴到你正在用的输入框里。本地LLM还能自动润色转录结果。这个功能直接对标WisprFlow,但完全免费。

MCP服务器:Claude Code、Cursor等支持MCP协议的AI工具可以直接调用VoiceStudio。一行命令接入,让你的编程Agent能说话、能听写。

OpenAI兼容API:一行代码替换

这可能是最骚的操作:VoiceStudio提供了一个和OpenAI完全兼容的API。

# 原来的代码client = OpenAI(base_url="https://api.openai.com/v1")# 改成这行,完事client = OpenAI(base_url="http://localhost:3900/v1", api_key="none")

你之前用OpenAI或ElevenLabs SDK写的所有脚本、Agent、工作流,不用改一行代码就能在本地跑。甚至voice参数可以传你克隆的声音ID,model参数可以指定用哪个TTS引擎。

100多个API端点,完整REST文档直接嵌在应用里。远程调用也行,配个Tailscale就能在局域网其他设备上用。

技术架构:Rust+Python+React的混搭

VoiceStudio的技术栈也挺有意思。

Rust Shell:基于Tauri,负责原生系统集成——全局快捷键、系统托盘、自动更新、单实例锁。

FastAPI后端:100多个端点,SSE/WSS流式传输,SQLite数据库,Alembic迁移。

React前端:Zustand状态管理 + WebSocket事件总线,数据变了UI自动刷新。

引擎层:14个TTS + 11个ASR + Demucs(人声分离)+ Pyannote(说话人分离)+ AudioSeal(水印),全部通过统一路由调度。

支持CUDA、MPS(苹果芯片)、ROCm(AMD显卡),甚至没GPU也能用CPU跑,只是慢三倍。显存不到8GB的话,会自动把TTS模型卸载到CPU,转录继续用GPU,不浪费一点算力。

没有独立显卡的同学也不用慌,选Kokoro引擎,模型只有82M参数,CPU就能流畅跑。

一个人能走多远?

说实话,看到一个人把这么多功能做完,我第一反应是”这能维护得过来吗”。

但转念一想,开源项目的魅力就在这里——它不需要一个人扛所有事。VoiceStudio已经有41个贡献者,Discord社区也很活跃,issue响应速度是”几小时而不是几天”。

而且AGPL-3.0协议意味着任何人都可以免费商用,只要你不把它魔改了然后闭源卖钱。作者甚至提供商业许可证,给那些想把VoiceStudio嵌入闭源产品的公司。

从功能完整度来说,VoiceStudio可能是目前开源社区里最接近”一站式语音工作站”的项目。14个TTS引擎、11个ASR引擎、646种语言、视频配音、有声书制作、AI水印、MCP集成……这些功能堆在一起,放在商业产品里至少值个几十刀月费。

而它完全免费,完全本地,文件归你。

就像它的slogan说的——Keep the files。

GitHub地址:https://github.com/debpalash/VoiceStudio

官网:https://voicestudio.sh


往期精选

上线两天1.4K星!评论区清一色的”这就是我一直在等的东西”!

Prime Agent开源,ARC-AGI-3跑到95.5%超人类专家,但它学会了”作弊”……

别再只会调prompt了:微软这个开源框架,用强化学习”训”你的Agent,代码几乎不用改!

黄仁勋深夜扔了颗开源核弹:34B参数自动驾驶模型免费商用!LingoQA干翻GPT-4o和Gemini 2.5 Pro!

扔一本书进去,它就给你一个可以随时调用的skill!又是一个神级skill:book-to-skill!


追踪AI前沿,深挖GitHub宝藏。

用优质内容陪你成长,

点击关注,携手启航。


免责声明:

本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。

任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。

本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我

本文转载自:内存泄漏 《一个人!1564次提交!14个TTS引擎!VoiceStudio把ElevenLabs从里到外拆了一遍!》

评论:0   参与:  0