首页 / 详情
Site icon

RVC

基本信息

RVC 网站截图预览

工具详情

RVC

1. 平台介绍

Retrieval-based Voice Conversion WebUI (RVC) 是一个开源的 V2V(Voice-to-Voice,语音到语音) 声音变换与克隆框架。它基于 VITS 架构 与 基于特征检索(Retrieval-based) 的技术改进,核心能力在于能够把源音频的音色替换为目标 Speaker 的音色,同时保留原语音的 语调、情感和节奏。

2. 主要功能

  1. 推理转换(AI 翻唱 / 变声):支持上传干声/语音并选择模型以生成目标音色的音频。用户可调整 变调(Pitch)、变音算法(如 RMVPE, PM, Harvest, Crepe)及音色融合度。
  2. 模型训练(声音克隆):仅需 10~20 分钟 干净的目标语音干声即可训练出专属音色模型。
  3. 实时变声(GUI):配合虚拟音频线(如 VB-Cable)与低延迟驱动(ASIO),可在 Discord、游戏、直播等场景中实现低延迟实时变声。
  4. 辅助工具:
  5. 人声伴奏分离:内置人声与伴奏切分工具。
  6. 模型融合(Ckpt Merge):可将多个音色权重进行比例叠加,混合出新的音色。

3. 适用人群

  1. VTuber / 游戏主播 / 内容创作者:用于实时变声或制作角色语音包。
  2. AI 音乐爱好者:用于制作 AI 歌手翻唱(AI Cover)。
  3. 配音员 / 音频工程师:用于修正人声音效或做音色替换。

4. 免费/付费情况

  1. 完全免费与开源:项目基于 MIT 许可证 开源,费用为 100% 免费,支持离线部署运行。
  2. 源码与更新地址:项目托管于 GitHub - RVC-Project/Retrieval-based-Voice-Conversion-WebUI。

5. 如何使用(快速上手指南)

硬件与环境准备

  1. 操作系统:支持 Windows / Linux / macOS。
  2. 硬件建议:推荐使用 NVIDIA 显卡(建议 6GB 及以上显存;纯 CPU 可运行但推理/训练极其缓慢)。

下载与启动

  1. 从 GitHub Release 页面下载整合包(预安装环境与依赖)。
  2. 解压后点击 go-webui.bat 启动 WebUI 界面,默认会自动打开浏览器访问 http://127.0.0.1:7865。
  3. (如需实时变声)运行 go-realtime_gui.bat

音色推理(转换声音)

  1. 切换到 “模型推理” 选项卡。
  2. 将训练好的 .pth 模型文件放入 assets/weights/ 目录,将对应 .index 文件放入 assets/indices/
  3. 点击“刷新音色列表”,选择目标模型。
  4. 上传需要转换的音频文件。
  5. 调节关键参数:
  6. 变调(Pitch/Key):男声变女声通常设置为 +12,女声变男声 -12;若是同性别翻唱保持 0。
  7. 音高提取算法:优先推荐 RMVPE(效果最好且速度快、不哑音)。
  8. 检索特征占比:建议保持 0.6 - 0.75,防止漏音。
  9. 点击 “转换” 并导出音频。

模型训练(自制音色)

  1. 切换到 “训练” 选项卡。
  2. 步骤 1:输入实验名称,选择采样率(推荐 40k/48k)与是否包含音高 F0。
  3. 步骤 2a:指定训练干声文件夹路径,点击“处理数据”。
  4. 步骤 2b:选择 RMVPE 算法提取特征和音高。
  5. 步骤 3:设置总训练轮数(Epoch,建议 100~300),点击“训练模型”与“训练特征索引”。

6. 注意事项

  1. 数据质量决定一切:训练素材务必使用无噪音、无伴奏、无重度混响的 干净干声。有杂音的数据会导致输出有电音或破音。
  2. 版权与肖像权安全:切勿将未经授权的他人音色模型用于公开发布、商业用途或欺诈行为。
  3. 算法选择:推理和提取音高时优先使用 RMVPE。以前常用的 Harvest 耗时极长,PM 容易变哑音。
  4. 路径不能包含中文:存放 RVC 项目文件及音频数据集的目录路径中 严禁包含中文或特殊字符,否则容易引发 PyTorch 加载报错。


评论

暂无评论