Voice-Pro:可本地部署的 AI 语音工具,集字幕、翻译和语音克隆于一体

发布于 更新于
37
1

一句话介绍:Voice-Pro 将语音识别、人声分离、翻译、文字转语音和语音克隆集中到一个网页界面,适合制作字幕、视频配音和多语言内容。

阿喵前言

给视频做一套外语配音,往往需要来回切换几个工具:提取音频、识别字幕、翻译文本,再生成新的语音。

Voice-Pro 把这些环节放进了同一个工作台。部署到自己的电脑后,通过浏览器就能操作,适合想自己掌控音频处理流程的用户。

资源介绍

Voice-Pro 是基于 Gradio 的开源语音处理应用。它整合 Whisper、Demucs、Edge-TTS、kokoro,以及 F5-TTS、E2-TTS、CosyVoice 等工具,覆盖从音视频处理到语音生成的常见需求。项目介绍

例如,处理一段采访视频时,可以先分离人声、识别字幕,校对并翻译文本后,再生成目标语言的配音。最终效果仍需要试听和调整,尤其是人名、专业术语及语气。

截图

特色

  • Whisper 系列模型识别语音、生成字幕
  • Demucs 分离人声与背景音乐
  • 支持字幕翻译和实时语音翻译
  • Edge-TTS、kokoro 将文字转换为语音
  • F5-TTS、E2-TTS、CosyVoice 支持零样本语音克隆
  • 集成 YouTube 下载及音频提取
  • 浏览器界面操作,可在本机部署

以上功能的语言覆盖范围因模型和服务而异,并非每个语音模型都支持全部语言。功能说明

注意

  • 本地部署不等于完全离线:Edge-TTS、默认翻译服务及在线视频下载需要联网。
  • 官方明确验证的是 Windows+NVIDIA 显卡环境,Mac 和 Linux 的运行情况尚未验证。
  • 首次运行需要下载依赖和模型,建议预留至少 20GB 空间;官方列出的显存要求为 4GB 起,优先考虑 8GB 以上。
  • README 仍保留暂缓更新的公告,使用前建议查看近期提交和 Issues。
  • 克隆声音应使用本人或获得授权的录音;商用前还需核对所用模型的许可。

部署条件和联网服务说明可见官方 README。

教程

以 Windows 为例:

  1. 打开 GitHub 仓库,点击 Code → Download ZIP,下载并解压源码。
  2. 运行 start.bat,等待安装环境和下载模型。首次启动时间取决于网络速度。
  3. 浏览器打开后进入操作界面;若没有自动打开,可访问启动窗口显示的本地地址。
  4. 制作字幕时选择 Whisper Caption,导入素材并设置识别语言。
  5. 翻译字幕使用 Translate;生成配音或克隆声音使用 Speech Generation。
  6. 先用短素材测试,校对字幕并试听语音,再处理完整内容。

当前安装说明允许跳过需要管理员权限的 configure.bat,直接由 start.bat 准备运行环境。安装教程

常见问题(FAQ)

Voice-Pro 支持哪些操作系统?
官方明确验证的是 Windows + NVIDIA 显卡环境,Mac 和 Linux 的运行情况尚未验证,建议使用 Windows 系统部署。
Voice-Pro 可以完全离线使用吗?
不完全。Edge-TTS、默认翻译服务和在线视频下载需要联网,但核心的语音识别和生成模型可以本地运行。
部署 Voice-Pro 需要多少硬件资源?
官方要求至少 4GB 显存,推荐 8GB 以上,并预留至少 20GB 存储空间用于下载依赖和模型。
Voice-Pro 支持语音克隆吗?
支持。通过 F5-TTS、E2-TTS、CosyVoice 实现零样本语音克隆,但需使用本人或获得授权的录音,商用前还需核对模型许可。

Voice-Pro

下载次数 5
一对一服务
技术支持
免费安装
免费升级
0 / 600
1 讨论
热门最新
总结

感谢分享,正好需要本地部署的语音工具,先收藏了!

资源选择

已下载 5 次 评分 5

获取方式