GPT-SoVITS 教程:1 分钟录音克隆音色,原生 48k 合成
GPT-SoVITS 教程1 分钟录音克隆音色原生 48k 合成【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS 是一款少样本 TTS 引擎5 秒参考音频可零样本克隆音色1 分钟录音即可微调出专属声音。v4 原生输出 48kHz 音频v2ProPlus 在 RTX 4090 上 RTF 低至 0.0141400 词文本仅 3.36 秒合成完支持中、英、日、韩、粤五种语言。三步装好环境与模型环境门槛为 conda Python 3.10显卡需支持 CUDA 12.6/12.8ROCm、MPS 与纯 CPU 也能跑。git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS cd GPT-SoVITS bash install.sh --device CU128 --source HF--device按硬件选 CU126/CU128/ROCM/MPS/CPU--source选下载源国内网络建议 ModelScope脚本会把预训练模型拉进 GPT_SoVITS/pretrained_models/v4 需确认含gsv-v4-pretrained/s2Gv4.pth与vocoder.pth追加--download-uvr5可顺带下载人声分离模型 让第一条声音 5 分钟内出来安装完执行python webui.py浏览器打开端口 9874 的 WebUI选择零样本模式上传 5 秒左右的干净参考音频模型下拉框选 v4输入一段中文文本点击合成听到输出音即代表整条链路可用拆解 48k 音质背后的三个机制整数倍上采样链GPT_SoVITS/configs/s2v2ProPlus.json 中各上采样阶段为 10、8、2、2、2v3 的金属音正来自非整数倍上采样该配置从根源消除BigVGAN 直接产出 48k 音频v3 仅 24k两段式结构GPT 模型负责语义与韵律SoVITS 负责声学细节预训练语料从 2k 小时扩到 5k 小时1 分钟数据微调即明显优于零样本半精度默认开启GPT_SoVITS/configs/tts_infer.yaml中is_half: true新显卡下推理更快、显存更省按需调整三个开关训练集音质一般 → 模型下拉框改选 v2Pro 系列 → 音质接近 v4硬件占用与速度等同 v2显存不足 → 关闭半精度改跑 FP32 → 合成不再溢出SM 6.1 以上新卡保留 FP16 换速度无 GPU → 用GPT_SoVITS/export_torch_script.py导出优化模型再推理 → 长文本分段合成参考音频保持 5 秒左右匹配三类落地场景短视频/播客创作者录 1 分钟自己的声音微调后续口播由模型生成48k 成品无需升采样直接交付跨语言配音中文素材训练推理时切换日语、韩语、英语文本WebUI 自带 UVR5 分离、自动切分、ASR 标注一套流程攒出训练集旧音频翻新先经tools/uvr5/分离人声、tools/cmd-denoise.py降噪再合成替代配音适合影视二创与配音修复对照表格排查常见故障症状可能原因解决方法音色下拉框为空预训练模型没放对位置检查GPT_SoVITS/pretrained_models/是否含对应版本的.pth/.ckpt提示未找到显卡、退回 CPU驱动或 CUDA 缺失装好驱动或显式指定--device CPU合成出现金属音v3 权重或非整数倍上采样配置换 v4 并重新下载vocoder.pthv3/v4 效果不如 v2v3/v4 对数据质量挑剔先分离降噪或改用 v2Pro 系列Mac 训出的模型质量偏低已知现象改用 CPU 模式训练显存溢出显存不足关闭半精度或换更大显存的卡先用 5 秒参考音频跑一次零样本合成确认整条链路通了录 1 分钟干净人声微调对比相似度差异升级版本前先看 docs/en/Changelog_EN.md 的更新记录【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

最新新闻

日新闻

周新闻

月新闻