一款完全本地运行的开源AI语音工作室,支持语音克隆、语音设计、视频配音、听写、转录和有声书创作,支持646种语言,是ElevenLabs的开源替代品。
- v0.5.6
- 发布于
- 6 天前
- 42,502
- 星标
- 97,565
- 下载
- 同步于
- 1 天前
最新版本
v0.5.62026年9月23日 16:53下载慢?可在上方随时切换镜像源
项目说明
项目概述
VoiceStudio(曾用名 OmniVoice-Studio)是一款完全本地运行的开源AI语音工作室,支持语音克隆、语音设计、视频配音、听写、转录和有声书创作,支持646种语言。它提供16种TTS引擎、11种ASR引擎,支持macOS、Windows、Linux和Docker,无需账号、API密钥或订阅。
主要功能
- 语音克隆与设计
- 视频配音
- 听写与转录
- 故事、有声书和批量生成
- 646种语言支持(实际覆盖率和质量取决于所选引擎)
- 16种TTS引擎 · 11种ASR引擎
- 支持CUDA、Apple Silicon MPS/MLX、ROCm on Linux、CPU,可选远程工作节点
- 提供桌面应用、本地REST/SSE/WebSocket API、OpenAI兼容音频API和MCP服务器
适用人群
- 内容创作者和视频制作者
- 需要语音合成和克隆功能的开发者
- 注重隐私、希望本地运行AI语音工具的用户
快速上手
- 从最新Release下载对应平台的安装包
- macOS 13.3+(Apple Silicon)下载DMG;Windows 10/11下载MSI;Linux下载AppImage(需要glibc 2.39+)
- 也可通过Docker运行(支持CUDA、ROCm、CPU和仅工作节点GPU配置文件)
- 首次启动会创建托管的Python环境并下载默认模型,后续启动会复用
- 打开应用,进入“Voice Cloning”,添加清晰的语音样本(3秒即可,5-15秒效果更佳)
核心优势
- 完全本地运行,数据不上传
- 无需账号、API密钥或订阅
- 支持646种语言
- 提供桌面应用和多协议API
- AGPL-3.0许可
系统要求
- 操作系统:macOS 13.3+(Apple Silicon)、Windows 10/11 x64、Linux x86_64(glibc 2.39+)
- 额外依赖:Intel Mac无法运行本地Python后端,需使用远程后端
历史版本
排序