RVC WebUI声音克隆实操教程:用10分钟音频做出属于你的AI变声模型
RVC WebUI声音克隆实操教程用10分钟音频做出属于你的AI变声模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI做视频配音时想换一种声音念台词却不想重录RVC WebUI 是一款开源的 AI 变声与声音克隆工具你只需准备 10 到 30 分钟干净人声就能训练出一个属于某个音色的模型之后开口说话即输出该音色。本篇按装环境 → 放模型 → 启动 → 训出第一个模型的顺序逐步走完全部命令可直接执行。 原理检索式变声和普通调音高有什么区别普通变声器只是整体抬高或压低音高像把整首歌移调音色信息会跟着失真。RVC WebUI 的做法类似配音演员参考原声它先把你 10 分钟以上的训练音频切成大量片段、存入特征库推理时用 top1 检索找出与当前输入最接近的片段特征再替换进合成流程。这样音高、情绪照搬你的输入音色则稳定来自训练集源音色不会泄漏到输出里。✅ 开工前自检先确认你的机器能不能跑检查项可运行的门槛不达标的影响显卡NVIDIA显存 4GB 起步4GB 可用6GB 以上更稳4GB 以下显存建议放弃训练仅推理或改用其他设备显卡AMD/Intel走 DirectML 路线Windows 下装requirements-dml.txt即可只能单精度推理速度偏慢内存16GB 建议值训练集过大时索引步骤会卡住Python大于 3.8依赖安装失败依赖清单N 卡requirements.txtA 卡/I 卡requirements-dml.txt装错清单会报 CUDA/DirectML 相关错误先对照上表判断一次再往下走能省掉大半排障时间。 完整实操五步训出第一个模型第 1 步克隆仓库git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI目的拿到全部源码与脚本。看到终端输出仓库目录内容即成功。第 2 步装依赖pip install torch torchvision torchaudio pip install -r requirements.txt第一条装 PyTorch 核心已装可跳过第二条按显卡装清单A 卡/I 卡用户把文件换成requirements-dml.txt。无报错、最后返回命令提示符即成功。第 3 步放入预训练模型python tools/download_models.py仓库内自带下载脚本会拉取assets/hubert/hubert_base.pt、assets/pretrained/v2 模型在assets/pretrained_v2/以及 UVR5 人声分离权重。若用 RMVPE 音高算法还需把rmvpe.pt放到项目根目录。看到 All models downloaded! 即成功。Windows 用户记得把 ffmpeg.exe 放在项目根目录。第 4 步启动 Web 界面python infer-web.py终端会打印监听地址。浏览器打开http://localhost:7865出现训练/推理界面即启动成功整合包的go-web.bat用 7897 端口原理相同。第 5 步训练第一个模型在界面的训练集格式化页签放入 10 分钟以上低底噪人声依次走完三步切分音频 提取音高特征f0 算法选 rmvpe效果最稳提取总特征填写训练设置total_epoch默认 20音质好的训练集可提到 200save_every_epoch默认 5batch_size默认按显存自动给出4GB 显存调成 1。点击训练后看到 logs/实验名下出现.pth文件、且 weights 文件夹下生成 60MB 以上的推理模型即训练成功。训练完把该模型拖进推理页签上传一段你自己的音频点合成听到目标音色开口整个闭环就跑通了。 参数速查按目标选 f0_method 和 index_rate目标f0_methodindex_rate半精度 is_half说明实时变声低延迟优先rmvpe0.75True音高准、速度快端到端延迟约 170ms接 ASIO 设备可压到 90ms高音质录音音质优先crepe0.5False精度最高但慢适合离线合成批量处理效率优先pm0.8False可放 CPU最快的音高提取算力占用最低三条调优经验index_rate在 0.50.8 之间调值越大越像目标音色越小越保留你的原始说话方式。训练集底噪大时total_epoch给 2030 就够调高只会放大底噪音质高、时长足1050 分钟才值得拉到 200 左右。4GB 以下显存的卡会自动被程序切成 fp32此时不要手动追求半精度先保证跑得动。 排障清单现象 → 最可能原因 → 解决动作浏览器打不开界面 / 提示 Connection Error→ 控制台黑窗口被关了或系统代理拦截 → 保持终端窗口存活关闭全局代理后重启。处理音频时报 ffmpeg error 或 utf8 error→ 文件路径含空格、括号或中文 → 把音频挪到纯英文、无空格的路径再切分。训练或推理报 CUDA out of memory→ 显存不足 → 训练把batch_size降到 1推理则调小configs/config.py末尾的x_pad、x_query、x_max。音色有机械感、不自然→ 训练数据不足或参数不匹配 → 数据补到 20 分钟以上index_rate在 0.50.8 间微调换一种 f0 算法对比。训练显示完成但找不到索引文件→ 训练集过大卡在加索引步骤 → 再次点击训练索引按钮即可。下一步用训好的.pth加.index到实时变声界面gui_v1.py跑一遍麦克风验证端到端延迟显示。遇到问题按顺序查 docs/cn/faq.md 的问答、configs/ 下的采样率配置以及 docs/en/README.en.md 的英文对照说明。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

最新新闻

日新闻

周新闻

月新闻