AudioSR音频超分辨率快速上手:任意采样率音频一键提升至48kHz

📅 发布时间:2026/8/24 9:29:13
AudioSR音频超分辨率快速上手:任意采样率音频一键提升至48kHz AudioSR音频超分辨率快速上手任意采样率音频一键提升至48kHz【免费下载链接】versatile_audio_super_resolutionVersatile audio super resolution (any - 48kHz) with AudioSR.项目地址: https://gitcode.com/gh_mirrors/ve/versatile_audio_super_resolutionAudioSR是一个开源音频超分辨率命令行工具把任意采样率的音频丢进去它用扩散模型补回缺失的高频细节输出统一的 48kHz 高保真音频。无论是电话录音、老磁带翻录还是 MP3 压缩过的音乐它都适用。低采样率录音修复场景重采样解决不了的问题处理旧录音的人通常会遇到几类头疼的素材8kHz/16kHz 的电话录音、会议录音声音闷像隔了一层纸老设备翻录的磁带、CD 转制文件高频衰减严重流媒体下载的 MP3刺耳的压缩伪影明显高频发干。很多人第一反应是提高采样率。但重采样只是把横轴拉长了原来丢失的高频并不会凭空出现——频谱上依然是空的。AudioSR 做的是另一件事基于音频里还存在的低频信息用生成模型把高频画回来。所以它能做的事是恢复质感而不是单纯改变采样率。原理速览扩散模型如何补回高频细节可以把 AudioSR 想象成一位看过上千张高清原图的修复师给他一张只剩轮廓和色调的老照片他能补出皮肤纹理和发丝因为他见过太多高清版本长什么样。AudioSR 在大量 48kHz 高质量音频上训练过同样的规律——给定一段被削掉高频的音频高频应该长什么样子。所以它能对低通、压缩后的音频做出听起来自然的高频重建而不是用滤波器硬推。工程上它做了三层简化这也是它快的原因先算 256 维梅尔频谱再经自编码器压成 16 通道的潜在表示latent扩散模型在这个小空间里做去噪不用直接生成波形采样走 DDIM步数可控默认 50 步__main__.py中--ddim_steps默认值 50重建后直接输出 48kHz 波形整条主流程在 pipeline.py 中。三步上手安装、运行、查看 48kHz 结果第 1 步安装推荐用 conda 建一个干净的 Python 3.9 环境避免依赖冲突。也可以直接克隆仓库从源码安装git clone https://gitcode.com/gh_mirrors/ve/versatile_audio_super_resolution cd versatile_audio_super_resolution pip install -e .如果只要现成版本pip3 install audiosr0.0.7。第 2 步运行命令行用法非常简单-i传单文件-il传文件列表仓库里自带batch.lst示例每行一个音频路径audiosr -i example/music.wav # 批量处理 audiosr -il batch.lst首次运行会自动从 HuggingFace 下载basic模型权重需要有外网。没有 GPU 也没关系程序会按 CUDA → MPS → CPU 的顺序自动选设备pipeline.py的build_model。第 3 步看结果输出默认存到./output/时间戳/下文件名带后缀_AudioSR_Processed_48K。运行完终端会提示Save audio to ...用播放器打开对比即可。想要网页版界面就运行python app.py会启动一个 Gradio 页面可拖动 Guidance Scale 和 DDIM Steps 滑块实时试听。进阶技巧按场景选对配置压缩音频MP3该先做什么。AudioSR 训练时的高频缺失是由低通滤波模拟出来的而 MP3 压缩在截止频率附近留下频谱空洞模式不一样直接处理效果会打折扣对比example/figs/mp3.png与mp3_after.png能明显看到。命令行入口会先自动估计音频的截止频率并做一次低通规整pipeline.py的lowpass_filtering_prepare_inference滤波器实现在 lowpass.py大多数情况无需额外操作如果你在自己的脚本里手动预处理 MP3具体脚本需以仓库实际为准思路是先把它压回标准低通形态再送进模型。长音频用分段模式。模型按 5.12 秒的整数倍对齐输入超过 10.24 秒会打印性能警告。长文件加--chunking即可默认按 15 秒一段、2 秒重叠处理段与段之间做交叉淡化音量也会逐段对齐回原始响度audiosr -i long_podcast.wav --chunking模型按内容选。basic默认面向音乐、音效等通用音频speech专为语音训练播客、会议录音选它更稳audiosr -i podcast.wav --model_name speech对结果不满意时换种子。扩散模型带随机性--seed默认 42同一输入换不同 seed 会得到不同的高频细节。保存音频时程序也会主动提示你多试几个 seed 挑最好听的版本。参数对照质量、速度、显存的权衡配置命令示例生成质量处理时长资源开销快速试听--ddim_steps 20 --guidance_scale 3.5可用细节略糙最短最低默认均衡--ddim_steps 50即不传参良好中等中等追求质感--ddim_steps 100 --guidance_scale 3.5细节最丰富约为快速档 5 倍最高两个参数的作用不同ddim_steps控制采样步数步数越多细节越完整耗时线性增加guidance_scale控制生成结果贴合输入的低频骨架程度命令行默认 3.5__main__.pyGradio 界面默认 2.6。数值过大时高频可能显得用力过猛可在 2.0–3.5 之间小幅调整试听。显存紧张时加-d cpu回退到 CPU速度会明显下降但一定能跑完。常见问题三个最容易被卡住的点输出文件比原音频长或短了几百毫秒可能原因模型按 5.12 秒整数倍对齐输入处理前会做填充保存时再按原始时长裁掉尾部静音首尾边界可能有轻微截断。解决方案属正常现象听感上通常无影响若对首尾精确度要求高用 ffmpeg 预先裁掉首尾静音再处理处理后的文件时长以输出为准不要拿它反向对齐时间轴。处理 MP3 后高频还是发干、有毛刺可能原因MP3 的频谱空洞模式与训练时的低通模式差异大模型没能接上高频表现为重建不充分见example/figs/mp3.png与mp3_after.png的对比。解决方案确认走的是命令行入口让自动低通规整生效手动链路需补齐预处理参考 utils.py 中的lowpass_filtering_prepare_inference换--seed试 3–5 个值挑高频最自然的版本仍不理想时降低--ddim_steps至 30–40 试一次或改用--model_name speech语音内容。跑得慢或显存爆掉可能原因ddim_steps过高或长音频未开分段一次性载入。解决方案长音频加--chunking默认 15 秒/段、2 秒重叠把--ddim_steps从 50 降到 30–40显存仍不足时加-d cpu用 CPU 跑牺牲速度换稳定。小结AudioSR 把补高频这件重采样做不了的事做成了三条命令能跑完的流程安装后audiosr -i 文件.wav即可得到 48kHz 输出。记住三件事长音频加--chunking语音内容换--model_name speech效果不理想先换 seed 再调参。现在找一段你觉得最闷的旧录音跑一遍上面的命令用频谱图看看 8kHz 以上到底补回了多少东西。【免费下载链接】versatile_audio_super_resolutionVersatile audio super resolution (any - 48kHz) with AudioSR.项目地址: https://gitcode.com/gh_mirrors/ve/versatile_audio_super_resolution创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考