
GPT-SoVITS5 秒音频克隆音色一句话合成不到 1 秒【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS 是个少样本语音克隆工具。不用录几小时干净素材5 秒参考音频就能克隆音色零样本就是不用训练。1 分钟录音可微调相似度更稳。4090 上推理 RTF 0.0141400 字文本 3.36 秒出 4 分钟音频。 从 0 到第一条结果Windows 用户直接下官方整合包双击go-webui.bat就行。Linux 和 macOS 按下面顺序执行git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS cd GPT-SoVITS conda create -n GPTSoVits python3.10 conda activate GPTSoVits bash install.sh --device CU128 --source HF python webui.pyinstall.sh会自动把底模、G2PW 拼音模型、NLTK 数据拉到对应目录不用手动搬。CUDA 12.6 的机器把CU128换成CU126没有独显选CPUmacOS 选MPS国内网络把--source HF换成HF-Mirror或ModelScope。终端打印地址后浏览器打开 9874 端口。硬件要求一行说清4GB 以上显存的 NVIDIA 显卡可跑低于此值或无显卡自动落回 CPUM4 CPU 上 RTF 0.526能用但慢。出第一条合成只要三步进「1C-推理」页签GPT/SoVITS 模型列表选 v2Pro 或 v2ProPlus 底模不训练直接推点「开启TTS推理WebUI」在 9872 端口打开的推理页里填参考音频的文本、上传 5 秒参考音频、输入目标文字点合成。几秒后结果区出现新音色的语音。它能做到什么按手里的素材分档手里有 5 秒干净人声→ 直接零样本推理填文本、传音频、点合成 → 得到这个音色的新语音全程 0 训练音色贴合度受参考音频质量限制。手里有 1 分钟干净录音→ 切完片跑一轮微调先 GPT 再 SoVITS默认各 15 轮 / 2 轮→ 音色贴合度和稳定性明显上升像又不像的感觉消失。手里只有一种语言的音色→ 把目标文本的语言标签切成英文、日语、韩语或粤语 → 仍是这个音色在念不用另外录底稿。中文、英文、日语、韩语、粤语共 5 种都支持跨语言推理。手里是有噪音的录音→ 先用「0a-UVR5」分离出纯人声 → 干净人声喂给零样本底噪和混响基本去掉。对比维度传统 TTS 流水线GPT-SoVITS素材门槛几十分钟干净录音5 秒参考音频起步出第一条结果数小时训练零样本直接推理语言覆盖通常单语言中英日韩粤 5 种推理耗时因流水线而异1400 字约 3.36 秒4090运行环境专用服务器或云消费级显卡甚至 CPU 完整流程跑一遍零样本听完不满意再按顺序把微调流程走一遍。1. 去「0-前置数据集获取工具 → 0a-UVR5」→ 点开启分离人声 → 输出目录得到干净人声文件夹。有歌声或混响必做纯录音可跳过。2. 去「0b-语音切分工具」→ 填输入路径和输出目录output/slicer_opt点开启 → 输出目录里出现一批按静音点切好的子音频每段默认最短 4 秒。3. 去「0c-语音识别工具」→ 选 ASR 模型和语言点开启 → 生成.list识别结果文件页面自动回填路径。4. 去「0d-语音文本校对标注工具」→ 填.list文件路径开启标注 WebUI9871 端口→ 逐条对照音频改错字。错字是合成念错的主要原因别省这步。5. 去「1-GPT-SoVITS-TTS → 1A-训练集格式化工具」→ 填文本标注文件、音频目录和实验名点「1Aabc 一键三连」→ 进度依次显示 1A-Done、1B-Done、1C-Done实验目录生成2-name2text.txt、6-name2semantic.tsv等文件。6. 去「1B-微调训练」→ 先点 SoVITS 训练1Ba默认 2 轮再点 GPT 训练1Bb默认 15 轮→ 权重分别落进SoVITS_weights_v2Pro/和GPT_weights_v2Pro/目录。7. 回「1C-推理」→ 点刷新模型路径选刚训好的模型重新开启推理 WebUI 合成 → 和零样本结果对比差别一听就知道。想跳过标注页手写列表也行.list每行一条格式是音频路径|说话人|语言|文本例如./a.wav|我|zh|你好世界。常见问题速查现象原因处理办法合成语音念错字、变调训练文本和音频对不上或语言标签标错逐条校对.list改错后重训 GPT1Bb合成结果带底噪参考音频本身不干净先用 0a UVR5 分离人声再喂进去训练或切片显存爆掉切片过长或 batch_size 太大把切片参数调短或开启is_half混合精度启动提示模型不存在底模没下载完整重跑install.sh它会补下缺失的预训练模型CPU 上合成特别慢无显卡时推理跑 CPU换 GPU 跑或勾选并行推理版本想抠原理从哪看GPT_SoVITS/AR/— GPT 侧自回归模型负责生成语义 token 序列GPT_SoVITS/module/— SoVITS 声学模型结构和 VQ 量化向量量化把连续特征变成离散码本GPT_SoVITS/TTS_infer_pack/— 推理主流程和多语言文本预处理GPT_SoVITS/prepare_datasets/— 文本、自监督特征、语义 token 三步提取脚本GPT_SoVITS/feature_extractor/— 中文 HuBERT 和 Whisper 编码器特征提取实现中文文档入口docs/cn/README.md先用自己 5 秒人声跑一遍零样本不满意再把录音加到 1 分钟做一次微调比反复调参数更实在。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考