一款本地优先的开源 AI 语音工作室,支持语音克隆、语音生成和语音输入,是 ElevenLabs 和 WisprFlow 的开源替代品。
- v0.5.0
- 发布于
- 2026年4月26日
- 55,895
- 星标
- 945,011
- 下载
- 同步于
- 1 天前
最新版本
v0.5.02026年4月26日 06:46下载慢?可在上方随时切换镜像源
项目说明
项目概述
Voicebox 是一款本地优先的开源 AI 语音工作室,是 ElevenLabs 和 WisprFlow 的开源替代品。支持语音克隆、语音生成,以及通过全局快捷键在任何应用中语音输入。
主要功能
- 语音克隆:从几秒音频中零样本克隆声音
- 7 种 TTS 引擎:Qwen3-TTS、LuxTTS、Chatterbox、Kokoro 等
- 支持 23 种语言
- 全局听写热键:在任何文本字段中语音输入
- 故事编辑器:多轨时间线用于对话和播客
- 语音个性:为语音配置文件附加自由形式的个性描述
- REST API 和内置 MCP 服务器
适用人群
- 内容创作者和播客制作者
- 需要语音克隆和 TTS 功能的开发者
- 重视隐私、希望本地运行 AI 语音工具的用户
快速上手
- 从 voicebox.sh 下载对应平台的安装包
- macOS(Apple Silicon)下载 DMG,Windows 下载 MSI
- 或使用 Docker:
docker compose up - 安装后启动,导入或录制声音样本进行克隆
- 使用全局热键开始语音输入
核心优势
- 完全隐私:模型、语音数据永不离开本地设备
- 原生性能:基于 Tauri(Rust)构建,非 Electron
- 跨平台:macOS(MLX/Metal)、Windows(CUDA)、Linux、AMD ROCm
- 开源免费,功能媲美商业产品
系统要求
- 操作系统:macOS(Apple Silicon/Intel)、Windows、Linux
- 支持架构:x86_64、arm64
- 额外依赖:无(Docker 可选)
注意事项
- 语音克隆和 TTS 需要一定的计算资源
- 部分高级功能可能需要 GPU 加速
历史版本
排序