合规与免责声明:本项目及其衍生用法须遵守《互联网信息服务深度合成管理规定》及相关法律法规。请勿用于冒充他人、欺诈、侵犯他人声音权/肖像权或任何违法违规用途。使用本工具训练、转换他人声音前,须取得本人授权。因不当使用产生的责任由使用者自负。

什么是 RVC?

https://pan.quark.cn/s/06045dd4fb6b
RVC(Retrieval-based Voice Conversion)是一款基于 VITS 模型的开源 AI 语音转换工具,可实现高质量的语音转换,在保留原语音情感、语调与节奏特征的同时改变音色。

与传统变声工具产生的机械音不同,RVC 的转换效果更显自然。它支持实时语音转换(适用于直播表演、有声内容制作等场景),也能生成 AI 翻唱作品,还可基于少量样本训练专属的声音模型。


一、RVC

选择适合你的版本

根据你的电脑配置选择对应版本:

版本适用设备特点
NVIDIA 版NVIDIA 显卡用户利用 CUDA 加速,推理速度最快,延迟最低,实时转换效果最佳
AMD/Intel 版AMD/Intel 显卡或纯 CPU 用户使用 DirectML 或 CPU 推理,速度稍慢,但非实时转换完全够用

如何查看你的显卡?

Win + R 键,输入 dxdiag 并回车,在「显示」标签页中查看显卡型号:

  • 制造商显示 NVIDIA → 选 NVIDIA 版
  • 显示 AMD、Intel 或其他 → 选 AMD/Intel 版

二、安装与启动

安装步骤

  1. 解压文件:将下载的压缩包解压到非中文路径的目录(建议放在磁盘根目录,如 D:\RVC),路径中不要包含中文或特殊符号,否则可能导致程序异常。

  2. 运行启动脚本:进入解压后的文件夹,双击 go-realtime-gui-dml.bat(Windows 系统)。启动脚本会自动检测运行环境,首次启动可能需要几分钟加载依赖和模型文件。
    请添加图片描述

  3. 启动成功:终端窗口会显示一串地址信息,同时会自动打开 RVC 的 GUI 图形界面。
    请添加图片描述


三、使用前准备

获取更多声音模型

部署包自带了一些基础模型,如果你想要更多音色选择,可以从以下平台下载社区公开分享的模型:

  • ModelScope 魔搭(modelscope.cn):阿里云旗下的 AI 模型社区,国内访问速度快,中文模型丰富,可在其中搜索 RVC 相关公开模型
  • Voice-Models(voice-models.com):社区开放的 RVC 模型库,支持在线试听预览

⚠️ 提醒:下载和使用第三方模型时请确认其授权情况,切勿使用未获授权的真实人物声音模型从事任何商业或公开传播活动,以免侵犯他人声音权益。

模型文件说明

下载后的模型通常包含两个核心文件:

  • .pth 文件:权重文件,存储声音的音色特征,需放到 weights 文件夹
  • .index 文件:特征索引文件,基于 FAISS 技术,负责对比输入音频并纠正音色偏移,需放到 logs/你的模型名/ 文件夹(缺少此文件也能用,但相似度会下降)

关于虚拟声卡

如果你需要将 RVC 的实时转换结果接入到其他软件(如直播、录音软件),需要安装虚拟声卡。虚拟声卡的作用是在软件之间搭建音频通道,把 RVC 处理后的音频流转给目标软件。

常用的两款虚拟声卡:

  • VB-Cable:轻量免费,一条虚拟通道
  • Voicemeeter Banana:功能更丰富,支持多通道混音

安装完成后,在 RVC 实时转换页面将输出设备设为虚拟声卡,再在目标软件的音频输入设置中选择同一个虚拟声卡即可。


四、基础使用流程

1. 选择模型

在 GUI 界面中选择正确路径的 .pth 文件和 .index 文件,可以是 RVC 自带的,也可以是自己下载或训练的。
请添加图片描述

2. 选择音频设备

  • 输入设备:选择你的硬件麦克风
  • 输出设备:选择你的虚拟声卡输出线路(如 VoiceMeeter Input (VB-Audio Voi (MME)))

3. 调整参数

参数说明推荐设置
音调设置值越大,音调越高升调:712<br/>降调:-7-12
同类音色微调:0 左右
响度因子相当于音量大小根据自己的需求调整

其他参数暂时保持默认,后续使用过程中可以自由探索。

4. 启动转换

所有设置完成后,点击左下角的「开始音频转换」,等待黑色窗口不断输出数值,表示转换流程正常运行。
请添加图片描述
请添加图片描述


五、总结

RVC 是目前开源社区中较为成熟的 AI 语音转换框架之一,基于 VITS 模型,提供了语音转换、实时转换、模型训练和 AI 翻唱等全套功能,效果自然,上手门槛不高。
本地部署环境包下载后解压即用,Windows 用户双击 go-realtime-gui-dml.bat 就能启动 GUI 界面。无论是用于有声内容创作、AI 翻唱研究,还是探索语音合成技术,RVC 都是一个值得学习的开源项目。
再次提醒:AI 语音转换属于深度合成技术,请在合规、授权的前提下使用,尊重他人声音权益,遵守平台与法律法规。

部署包内未包含任何商业化付费内容,仅为开源项目运行环境的本地化整理备份。如你网络畅通,强烈推荐直接从 GitHub 官方仓库获取,以获得最新版本与完整源码。


本文为开源项目本地部署的技术学习记录,转引请注明来源。

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐