jamiepine

一款本地优先的开源 AI 语音工作室,支持语音克隆、语音生成和语音输入,是 ElevenLabs 和 WisprFlow 的开源替代品。

v0.5.0
发布于
2026年4月26日
55,895
星标
945,011
下载
同步于
1 天前

最新版本

v0.5.02026年4月26日 06:46
下载慢?可在上方随时切换镜像源

项目说明

项目概述

Voicebox 是一款本地优先的开源 AI 语音工作室,是 ElevenLabs 和 WisprFlow 的开源替代品。支持语音克隆、语音生成,以及通过全局快捷键在任何应用中语音输入。

主要功能

  • 语音克隆:从几秒音频中零样本克隆声音
  • 7 种 TTS 引擎:Qwen3-TTS、LuxTTS、Chatterbox、Kokoro 等
  • 支持 23 种语言
  • 全局听写热键:在任何文本字段中语音输入
  • 故事编辑器:多轨时间线用于对话和播客
  • 语音个性:为语音配置文件附加自由形式的个性描述
  • REST API 和内置 MCP 服务器

适用人群

  • 内容创作者和播客制作者
  • 需要语音克隆和 TTS 功能的开发者
  • 重视隐私、希望本地运行 AI 语音工具的用户

快速上手

  1. 从 voicebox.sh 下载对应平台的安装包
  2. macOS(Apple Silicon)下载 DMG,Windows 下载 MSI
  3. 或使用 Docker:docker compose up
  4. 安装后启动,导入或录制声音样本进行克隆
  5. 使用全局热键开始语音输入

核心优势

  • 完全隐私:模型、语音数据永不离开本地设备
  • 原生性能:基于 Tauri(Rust)构建,非 Electron
  • 跨平台:macOS(MLX/Metal)、Windows(CUDA)、Linux、AMD ROCm
  • 开源免费,功能媲美商业产品

系统要求

  • 操作系统:macOS(Apple Silicon/Intel)、Windows、Linux
  • 支持架构:x86_64、arm64
  • 额外依赖:无(Docker 可选)

注意事项

  • 语音克隆和 TTS 需要一定的计算资源
  • 部分高级功能可能需要 GPU 加速

历史版本

排序