VoiceStudio
AGPL-3.0PythonVoiceStudio 是开源、完全本地运行的 ElevenLabs 替代方案,支持语音克隆、语音设计、视频配音、听写、转录与有声书制作,覆盖 646 种语言。
VoiceStudio 是开源、完全本地运行的 ElevenLabs 替代方案,支持语音克隆、语音设计、视频配音、听写、转录与有声书制作,覆盖 646 种语言。
VoiceStudio 是一款开源、以本地运行为核心的语音工作台,定位为 ElevenLabs 的替代方案。根据其 README,它提供语音克隆、语音设计、视频配音、听写、转录与有声书制作能力,并宣称支持 646 种语言。默认引擎为 k2-fsa/OmniVoice,同时支持选择其他引擎。桌面端目前仅维护 Electron 版本(0.5.3 是最后一个 Tauri 版本,Tauri 源码已归档)。本地工作流在用户自己的硬件上运行,远程服务为可选项,使用分析数据需要用户同意。项目采用 AGPL-3.0 许可,模型另有各自许可,需在使用前自行确认。
请参考仓库中的 Docker 安装文档 docs/install/docker.md 执行部署(输入信息中未提供明确的 Docker 命令)。
根据 README,VoiceStudio 是开源项目,采用 AGPL-3.0 许可。但其中使用的模型有各自的许可,商业使用前需要分别查看并确认。
README 说明本地工作流在用户自己的硬件上运行,远程服务为可选项,使用分析数据需要用户同意。因此核心流程可以本地完成,但安装依赖或下载模型时可能需要网络。
README 宣称支持 646 种语言,但实际可用语言取决于所选引擎与模型,建议参考官方引擎文档确认。
README 明确指出 Electron 是唯一维护的桌面应用,0.5.3 是最后一个 Tauri 版本。现有 Tauri 用户需要单独安装 Electron,并参考迁移文档。
README 要求仅在有授权的情况下克隆声音。请确保你拥有相应许可,并遵守当地法律法规。
README 给出的步骤是:克隆仓库后依次执行 bun install、bun run setup:api,然后在仓库根目录执行 bun run dev。Electron 会负责监管后端,不要另外启动第二个后端。