
10分钟语音数据就能练出AI歌手RVC变声WebUI完整入门与快速上手【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRVCRetrieval-based-Voice-Conversion-WebUI是一个基于 VITS 的开源变声框架。你只需要准备 10 分钟左右的目标人声录音就能训练出一个把别人声音变成这个音色的转换模型全程都在网页界面里完成。它把人声伴奏分离、一键训练、单次/批量推理、实时变声打包在同一个工具里对显卡要求也不高入门门槛明显低于同类变声方案。训练变声模型RVC 把哪几件麻烦事替你解决了做声音转换的人通常卡在三个地方数据量大、显卡要求高。传统 VITS 系方案动辄要几十小时录音和高端显卡才能起步普通电脑根本跑不动。RVC 的底模用接近 50 小时的开源 VCTK 数据集训练无版权顾虑训练从预训练权重开始而不是从零学起所以 10 分钟级的高质量录音就够较差的显卡也能快速训完。音色泄漏。转换结果会不自觉地带上输入说话人的音色。RVC 用 top1 检索在推理时把输入源特征替换成训练集特征来堵住这条泄漏路径再用 index rate 滑杆在保音色和保音质之间取舍。唱歌场景容易哑音。音高提取质量直接决定歌声变声的效果。RVC 接入了 InterSpeech 2023 的 RMVPE 人声音高提取算法效果比 crepe_full 更好速度更快、资源占用更小。此外做训练集往往要先从歌曲里分离人声RVC 内置了 UVR5 分离模型不用另外装工具。两条最快路线把 RVC WebUI 跑起来路线一整合包新手推荐。下载并解压RVC-beta.7zWindows 用户双击go-web.batmacOS 用户执行sh ./run.sh。依赖、预训练模型都打好了这一步省掉后面所有配置。路线二源码安装技术用户。先克隆仓库git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI接着在 Python 3.8 环境里装依赖PyTorch 和 RVC 依赖分开装pip install torch torchvision torchaudio pip install -r requirements.txt最后一条命令按你的显卡换文件N 卡用requirements.txtA 卡/I 卡DirectML用requirements-dml.txtA 卡 ROCm仅 Linux用requirements-amd.txtI 卡 IPEX仅 Linux用requirements-ipex.txt。装完依赖还差两类文件预训练模型assets/hubert_base.pt、assets/pretrained、assets/uvr5_weights四个目录想要 v2 底模再加assets/pretrained_v2。tools/文件夹里自带下载脚本直接执行即可。ffmpegUbuntu/Debian 执行sudo apt install ffmpegmacOS 执行brew install ffmpegWindows 用户下载 ffmpeg.exe 和 ffprobe.exe 放进项目根目录。如果要用 RMVPE 音高提取把rmvpe.pt放到项目根目录A 卡/I 卡可选 onnx 版本。全部就位后启动python infer-web.py打开界面后五件事分别在哪里做训练在训练选项卡填实验名勾选模型是否带音高指导唱歌必选纯语音可以不要指定音频文件夹后点一键训练——预处理、提取音高和特征、模型训练、索引训练会一次性按顺序跑完实验数据都存放在logs/实验名/下。总轮数total_epoch的参考底噪大的训练集 20~30 轮就够音质高且时长的可以拉到 200。推理模型推理选项卡分单次和批量两个子页。单次推理选推理音色、音高提取算法rmvpe 效果最好、harvest 低音好但慢、pm 快歌声可用、index rate 后处理一段音频批量推理直接丢进整个文件夹转换结果输出到指定目录。人声伴奏分离伴奏人声分离去混响去回声选项卡走 UVR5 模型不带和声的音频选 HP2/HP3保留人声带和声的选 HP5仅保留主人声混响重的先用 MDX-Net 去混响、再上 DeEcho-Aggressive 去延迟是公认最干净的组合。ckpt处理把两个模型融合ckpt-merge可以调整最终音色从训练大 checkpoint 里提取 60MB 的小模型用于分享和推理——注意logs/下几百 MB 的 pth 是实验状态文件不能直接拿来推理。实时变声双击go-realtime-gui.bat启动独立小界面标准设备端到端延迟 170ms输入输出都走 ASIO 的话可压到 90ms。参数支持热更新调参不用重启。全局参数设备卡号、半精度、显存相关阈值在 configs/config.py 里改卡号和显卡的对应关系在训练选项卡的显卡信息栏能看到。界面语言会跟随系统自动切换支持中英文、日文、韩文、法文、葡萄牙文等见 i18n/locale/。哪些显卡、系统和数据量跑得动显卡N 卡CUDA是主力A 卡走 ROCm仅 Linux或 DirectMLI 卡走 IPEX仅 Linux或 DirectML。4G 显存是实际底线4G 以下不建议尝试。系统Windows、Linux、macOS 均支持仓库自带 Dockerfile 也可以容器化运行。模型版本v1 和 v2 两代底模采样率 32k/40k/48k 可选配置在 configs/ 下。训练数据推荐 10~50 分钟低底噪录音如果音色特色明显且音质高5~10 分钟也能出效果。1~2 分钟的案例存在但不可复现不建议参考。实时延迟普通声卡链路 170msASIO 链路 90ms依赖硬件驱动支持。遇到 RVC 报错对照这五类逐个修现象报 ffmpeg error / utf8 error。可能原因大概率不是 ffmpeg 本身的问题而是音频路径里带了空格、括号或中文。 解决把训练集文件夹挪到纯英文、无空格的短路径下重新跑。现象WebUI 提示 Connection Error。可能原因黑色的控制台窗口被关掉了后端进程已退出。 解决保持终端窗口打开再刷新页面。现象WebUI 弹出Expecting value: line 1 column 1 (char 0)。可能原因局域网或全局代理拦截了本地连接包括服务端的http_proxy/https_proxy。 解决关闭客户端和服务端两侧代理后重试。现象Cuda error / Cuda out of memory。可能原因显存不够大概率或设备不支持小概率。 解决训练时把 batch size 调小推理时按情况调小configs/config.py末尾的x_pad、x_query、x_center、x_max4G 显存以下基本只能放弃。现象Windows 报找不到 llvmlite.dll。可能原因缺少 VC 运行库。 解决安装 VC 2015-2022 x64 可再发行组件然后重启 WebUI。更完整的问答在 docs/cn/faq.md更新历史见 docs/cn/Changelog_CN.md。想深入代码从哪几个目录下手协议是什么代码入口是 infer-web.py按职责分四块看最快infer/lib/ 是推理核心含 jit 加速和 ONNX 推理infer/modules/ 放训练、UVR5 分离和实时变声vc/pipeline.py的实现configs/ 管理各版本模型配置tools/ 里是批量推理、索引训练、权重转换等命令行工具。非 WebUI 场景可以直接用 tools/infer_cli.py 走命令行推理。项目采用 MIT 许可底模基于开源 VCTK 数据集训练商用无版权负担。想参与开发可以先读 CONTRIBUTING.md问题反馈和讨论入口写在 README 顶部链接里。跑通你的第一个音色模型今晚就可以开始挑一段 10 分钟的低底噪人声在训练选项卡走一遍一键训练刷新一下推理音色就能看到自己的模型。中途卡住的报错先翻一遍 docs/cn/faq.md解决不了再去项目 Issues 或社区问。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考