yovoice:开源本地 AI 配音工具,支持声音克隆与情绪控制

发布于 更新于
34
1

一句话介绍:yovoice 是一款适用于 macOS 和 Windows 的开源声音创作工具,支持本地文字转语音、音色克隆和情绪调整,无需调用云端 API,也没有按字数计费的开销。

阿喵前言

做视频旁白、故事配音或有声内容时,文字转语音只是第一步。想让声音符合角色,还得调整音色、语气和情绪,反复试听。

yovoice 把这些操作集中到一个创作工作台里。模型下载到电脑后,就能在本地生成语音,适合需要经常修改文稿、尝试不同声音的用户。

资源介绍

yovoice 支持输入文字或导入字幕,并围绕角色组织配音作品。参考音频可以直接导入或录制,再进行裁剪、生成、试听和导出,形成一套完整的音频创作流程。

它提供多种模型选择,包括 IndexTTS、VoxCPM2、OmniVoice、Qwen3-TTS 和 Kokoro。不同模型各有侧重:有的擅长参考音色克隆,有的支持情绪控制,也有的可以直接根据文字描述设计声音。

中文、英语、日语等语言的支持范围取决于所选模型。例如 IndexTTS 2.0 主要支持中英,2.5 则增加了日语等语言。

截图

特色

  • 本地文字转语音,无按字数计费
  • 支持参考音色克隆和演绎模仿
  • 可用情绪设置或文字描述调整表达
  • 部分模型支持无需参考录音的声音设计
  • 支持参考音频录制、导入和裁剪
  • 提供故事配音、试听与作品导出
  • 支持模型下载续传和 GGUF 导入
  • 提供 CLI 与 Agent Skill,可交给 AI Agent 完成配音

硬件方面,Apple Silicon 支持 Metal 加速;Windows 支持 CPU、NVIDIA CUDA 和实验性 Vulkan。

注意

  • macOS 安装包面向 macOS 14 及以上的 Apple Silicon 设备;Windows 面向 Windows 10/11 x64。
  • 首次下载模型需要联网,生成速度取决于硬件和模型大小。
  • 并非所有模型都支持声音克隆、情绪控制或全部语言。
  • 程序开源许可与模型许可分别适用;OmniVoice 权重仅限非商业用途。
  • 克隆声音应使用本人或获得授权的录音。
  • 建议先用短文本试听,确认发音和语气后再生成长篇内容。

使用教程

  1. 前往 GitHub Releases,下载对应平台的安装包。
  2. macOS 打开 .dmg,将应用拖入“应用程序”;Windows 运行 -setup.exe。
  3. 启动后进入设置,下载需要的语音模型。
  4. 新建作品,选择“故事配音”或“语音生成”。
  5. 输入文字或导入字幕,选择角色并设置声音;需要克隆时,添加参考录音。
  6. 点击“生成语音”,试听并调整,满意后导出作品。

如果希望由 AI Agent 根据文稿和参考录音完成配音,也可以使用项目提供的 yovoice Skill,通过独立 CLI 运行,无需打开桌面应用。

常见问题(FAQ)

yovoice 支持哪些操作系统?
yovoice 支持 macOS 14 及以上的 Apple Silicon 设备和 Windows 10/11 x64 系统。
yovoice 是否需要联网或付费?
yovoice 是开源工具,本地运行,无按字数计费;首次下载模型需要联网,之后可离线使用。
yovoice 支持哪些语音模型?
yovoice 提供 IndexTTS、VoxCPM2、OmniVoice、Qwen3-TTS 和 Kokoro 等多种模型,不同模型在声音克隆、情绪控制和语言支持上有所侧重。
如何使用 yovoice 进行声音克隆?
在 yovoice 中新建作品,选择故事配音或语音生成,输入文字或导入字幕,添加参考录音(导入或录制),选择模型后即可生成克隆语音。
0 / 600
1 讨论
热门最新
总结

这个工具看起来很实用,本地运行还支持声音克隆,正好需要做视频旁白,回去试试 macOS 版本。