debpalash

VoiceStudio

一款完全本地运行的开源AI语音工作室,支持语音克隆、语音设计、视频配音、听写、转录和有声书创作,支持646种语言,是ElevenLabs的开源替代品。

v0.5.6
发布于
6 天前
42,502
星标
97,565
下载
同步于
1 天前

最新版本

v0.5.62026年9月23日 16:53
下载慢?可在上方随时切换镜像源

项目说明

项目概述

VoiceStudio(曾用名 OmniVoice-Studio)是一款完全本地运行的开源AI语音工作室,支持语音克隆、语音设计、视频配音、听写、转录和有声书创作,支持646种语言。它提供16种TTS引擎、11种ASR引擎,支持macOS、Windows、Linux和Docker,无需账号、API密钥或订阅。

主要功能

  • 语音克隆与设计
  • 视频配音
  • 听写与转录
  • 故事、有声书和批量生成
  • 646种语言支持(实际覆盖率和质量取决于所选引擎)
  • 16种TTS引擎 · 11种ASR引擎
  • 支持CUDA、Apple Silicon MPS/MLX、ROCm on Linux、CPU,可选远程工作节点
  • 提供桌面应用、本地REST/SSE/WebSocket API、OpenAI兼容音频API和MCP服务器

适用人群

  • 内容创作者和视频制作者
  • 需要语音合成和克隆功能的开发者
  • 注重隐私、希望本地运行AI语音工具的用户

快速上手

  1. 从最新Release下载对应平台的安装包
  2. macOS 13.3+(Apple Silicon)下载DMG;Windows 10/11下载MSI;Linux下载AppImage(需要glibc 2.39+)
  3. 也可通过Docker运行(支持CUDA、ROCm、CPU和仅工作节点GPU配置文件)
  4. 首次启动会创建托管的Python环境并下载默认模型,后续启动会复用
  5. 打开应用,进入“Voice Cloning”,添加清晰的语音样本(3秒即可,5-15秒效果更佳)

核心优势

  • 完全本地运行,数据不上传
  • 无需账号、API密钥或订阅
  • 支持646种语言
  • 提供桌面应用和多协议API
  • AGPL-3.0许可

系统要求

  • 操作系统:macOS 13.3+(Apple Silicon)、Windows 10/11 x64、Linux x86_64(glibc 2.39+)
  • 额外依赖:Intel Mac无法运行本地Python后端,需使用远程后端

历史版本

排序