10分钟语音快速训练AI变声:RVC WebUI完整上手教程
10分钟语音快速训练AI变声RVC WebUI完整上手教程【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI想用自己的声音翻唱一首歌或者给播客、短视频配一个固定的声音Retrieval-based-Voice-Conversion-WebUI简称 RVC是一款基于 VITS 的免费开源变声框架你提供 10 分钟左右的清晰人声它就能训练出一个可用于唱歌和说话的音色模型训练、推理、实时变声全部在网页界面里完成。适合音乐创作者、视频作者以及没有深度学习背景但想做出自己的 AI 声线的普通用户。RVC 能帮你做什么小数据训练音色模型官方建议 10 分钟到 50 分钟低底噪语音即可得益于 top1 检索替换输入源特征能减少音色泄漏网页界面一站式操作数据预处理、特征提取、训练、索引生成都在 WebUI 里点按钮完成实时变声端到端延迟约 170ms使用 ASIO 输入输出设备可压到约 90ms人声伴奏分离内置 UVR5从歌曲里快速拆出人声模型融合通过 ckpt 选项卡的 ckpt-merge 混合两个模型的音色RMVPE 音高提取较新的音高算法能解决哑音问题比 crepe_full 更快、占用更小A 卡 / I 卡加速支持 DML、ROCm、IPEX 三种后端环境准备显卡、Python 与依赖清单先看你的显卡选依赖文件Python 需要 3.8 以上版本显卡 / 系统依赖文件N 卡CUDArequirements.txtA 卡ROCm仅 Linuxrequirements-amd.txtA 卡 / I 卡DMLrequirements-dml.txtI 卡IPEX仅 Linuxrequirements-ipex.txt显存方面4GB 起步低于 4GB 的显卡基本不建议尝试。git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI pip install torch torchvision torchaudio pip install -r requirements.txt最后一条命令按上表换成你对应的文件。除了 Python 依赖还需要两样东西ffmpegUbuntu/Debian 执行sudo apt install ffmpegmacOS 用brew install ffmpegWindows 下载 ffmpeg.exe 和 ffprobe.exe 放到项目根目录预训练模型assets/hubert/hubert_base.pt、assets/pretrained、assets/uvr5_weights三个路径tools目录里提供了下载脚本想用 v2 底模还要额外下assets/pretrained_v2。RMVPE 音高模型的rmvpe.pt放在项目根目录用 WebUI 训练第一个变声模型数据怎么准备安静环境、稳定距离录一段至少 10 分钟的清晰人声避开背景音乐和破音放进一个独立文件夹建议放在项目assets下新建目录。路径里不要有空格、括号或中文否则会触发 ffmpeg 报错。一键训练的操作步骤启动方式按系统选Windows 双击go-web.batLinux/Mac 执行sh ./run.sh或python infer-web.py。打开训练选项卡后依次填写实验名、数据集路径、采样率32k/40k/48k、音高提取算法推荐 rmvpe、训练轮数和每张显卡的 batch_size点一键训练。流程会自动走提取音高和处理数据 → 训练模型日志里能看到实时损失值→ 训练索引。终端打印Training is done. The program is closed.即训练成功后面紧邻的报错可以忽略。产物放在哪里assets/weights/下出现约 60MB 的实验名.pth这是用于推理的模型同名added_xxx.index是音色检索索引logs/实验名/下的几百 MB pth 是实验状态存档供复现或续训不要拿它去推理或分享结果验证与参数调整怎么判断训好了推理选项卡点刷新音色列表里能选到你的实验名说明模型已加载。上传一段测试音频转换后如果音色不像先查logs/实验名/下的训练日志确认训练过程没有中断。关键参数怎么调参数建议值作用total_epoch音质差底噪大时 20~30音质高、时长多时可到 200训练轮数batch_size按显存调界面会按显存自动给默认值越大越快越吃显存f0up_key0 原调12 升八度-12 降八度音高偏移index_rate0.3~0.5调高更贴近训练集音色调低更依赖底模音高算法rmvpe效果最好且开销小遇到异常怎么办显存不足CUDA out of memory训练就减小 batch_size推理时调小 configs/config.py 末尾的x_pad、x_query、x_center、x_max训练结束没有索引文件通常是索引步骤卡住单独再点一次「训练索引」按钮Connection Error控制台黑窗口被关掉了重新打开程序WebUI 报 Expecting value关掉系统的局域网/全局代理更多情况可查 中文 FAQ。进阶用法批量转换、API 与分享模型批量处理一批音频界面不适合处理几百个文件时用仓库自带的 tools/infer_batch_rvc.pypython tools/infer_batch_rvc.py \ --input_path ./input_wavs \ --index_path ./assets/weights/added_IVF256_Flat_nprobe_1.index \ --model_name 实验名 \ --opt_path ./output \ --f0up_key 0 --f0method rmvpe --index_rate 0.5注意它只处理目录里的.wav文件输出写入--opt_path指定路径。把实时变声做成服务api_240604.py 是一个 FastAPI 实时变声服务对外提供/inputDevices、/outputDevices、/config、/start、/stop几个接口可以把它嵌进你自己的客户端实现选设备 → 推参数 → 开始/停止的完整控制。正确分享模型把weights/实验名.pth60MB 左右和对应的added_xxx.index一起打包发出去对方解压到 weights 目录刷新音色即可。千万不要分享logs/下的大 pth直接拿去推理会报 key 不存在的错误。常见问题需要多少显存4GB 起步batch_size 为 2 时 6GB 足够。4GB 以下的显卡建议放弃训练。训练多久合适10 分钟数据在 RTX 3060 上约 1~2 小时。数据量越大越慢但音质上限也越高。ffmpeg 报错一定是 ffmpeg 的问题吗大概率不是。先检查音频路径有没有空格、()或中文。实时变声延迟高换 ASIO 设备并把缓冲区调小关闭后台占音频的程序。中断的训练能接着跑吗用相同实验名和参数重新启动会从上次 checkpoint 继续中途加数据则换新实验名并拷贝上次的 G/D 文件进去。下一步RVC 把录 10 分钟声音 → 得到一个可用音色模型这件事压缩到了几个按钮的距离。接下来做三件事录一段 10 分钟干净人声、跑通第一次一键训练、用推理选项卡转换一首测试歌曲跑通后再回来调 total_epoch 和 index_rate。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

最新新闻

日新闻

周新闻

月新闻