☰
Amphion 预训练 HiFi-GAN 语音声码器使用指南:下载、目录结构与源码解析
2026/10/2 13:25:45 网站建设 项目流程
  • 音频
  • 语音
  • 媒体生成
  • 深度学习

【免费下载链接】Amphion

Amphion (/æmˈfaɪən/) is a toolkit for Audio, Music, and Speech Generation. Its purpose is to support reproducible research and help junior researchers and engineers get started in the field of audio, music, and speech generation research and development.

项目地址:https://gitcode.com/GitHub_Trending/am/Amphion
点击查看免费下载

Amphion(/æmˈfaɪən/)是面向音频、音乐与语音生成的可复现研究工具包,其声码器(Vocoder)模块负责将梅尔频谱等声学特征还原为可听波形。本文围绕仓库中发布的hifigan_speech预训练 HiFi-GAN 语音声码器展开,讲解如何下载并正确部署该模型、其网络结构与训练配置的源码级细节,以及在 Amphion 中调用它完成波形重建的完整操作路径。

模型概况:hifigan_speech预训练权重

Amphion 官方在pretrained/hifigan/README.md中发布了面向通用语音的 HiFi-GAN 预训练模型hifigan_speech。其核心信息如下:

  • 模型标识:hifigan_speech
  • 托管平台:HuggingFace 平台的amphion/hifigan_speech_bigdata模型仓库
  • 训练数据:VCTK + LibriTTS + LJSpeech 三个开源语音数据集

据 egs/vocoder/gan/tfr_enhanced_hifigan/README.md 的说明,该 HiFi-GAN 检查点使用约685 小时语音数据训练而成,是 Amphion 在语音声码器方向发布的标准预训练权重。它不绑定某个特定下游任务,而是作为通用语音波形生成器,可服务于文本转语音、语音转换、歌声合成等各类流水线的最后一级。

下载与部署:目录结构要求

与仓库内其他预训练依赖(如 BigVGAN、DiffWave)一致,hifigan_speech同样以「整目录落盘」的方式使用。pretrained/README.md 给出了明确要求:需要将hifigan_speech整个文件夹下载并放入Amphion/pretrained/hifigan目录,最终目录结构如下:

Amphion ┣ pretrained ┃ ┣ hifigan ┃ ┃ ┣ hifigan_speech ┃ ┃ ┃ ┣ log ┃ ┃ ┃ ┣ result ┃ ┃ ┃ ┣ checkpoint ┃ ┃ ┃ ┣ args.json

其中:

  • checkpoint目录存放模型权重与训练中间产物;
  • args.json记录该次训练使用的全部超参数,是推理时恢复模型结构的关键依据;
  • log、result分别存放训练日志与过程中的合成样本。

注意:必须保持「文件夹套文件夹」的完整结构(pretrained/hifigan/hifigan_speech/...),不要只把权重文件单独拷出,否则 Amphion 在按路径加载预训练声码器时可能无法定位args.json与checkpoint。

网络架构源码解析:HiFiGAN 生成器实现

Amphion 对 HiFi-GAN 生成器的实现位于 models/vocoders/gan/generator/hifigan.py,核心类是HiFiGAN(第 150 行起)。从源码结构看,其前向计算分为四个阶段(对应forward方法,第 202-218 行):

  1. 输入投影:conv_pre将cfg.preprocess.n_mel维的梅尔谱经一个核大小为 7 的 Conv1d 投影到upsample_initial_channel通道(默认 256);
  2. 多级转置卷积上采样:按upsample_rates(默认[8, 8, 4],总上采样倍率 256)逐级用ConvTranspose1d提升时间分辨率,每一级通道数按upsample_initial_channel // (2 ** (i+1))递减;
  3. 多感受野残差块:每个上采样级之后并联num_kernels(默认 3)个残差块(ResBlock1/ResBlock2),不同残差块使用不同的核大小与膨胀率以捕获多尺度波形细节,输出取各分支平均;
  4. 输出整形:conv_post将特征压缩回单通道,经tanh输出最终波形。

此外,生成器对卷积层使用weight_norm并在第 145 行提供remove_weight_norm方法——这正是 HiFi-GAN 推理阶段「移除权重归一化以降低开销」的标准做法。该实现完全对齐经典 HiFi-GAN 的「多感受野融合 + 周期/尺度判别器对抗训练」设计。

训练配置参数对照:exp_config.json

Amphion 为 HiFi-GAN 提供了开箱即用的训练配置 egs/vocoder/gan/hifigan/exp_config.json,其model.hifigan字段与上述源码逐项对应:

"model": { "generator": "hifigan", "hifigan": { "resblock": "2", "upsample_rates": [8, 8, 4], "upsample_kernel_sizes": [16, 16, 8], "upsample_initial_channel": 256, "resblock_kernel_sizes": [3, 5, 7], "resblock_dilation_sizes": [[1, 2], [2, 6], [3, 12]] } }

各参数在源码中的实际作用如下:

  • resblock:选择残差块类型,"1"使用 ResBlock1、"2"使用 ResBlock2(hifigan.py);
  • upsample_rates/upsample_kernel_sizes:成对驱动各级转置卷积(zip遍历,见第 168-173 行),乘积 8×8×4=256 即梅尔谱帧率到采样率的放大倍数;
  • upsample_initial_channel:决定conv_pre的输出宽度与各级通道衰减的基数(第 156-184 行);
  • resblock_kernel_sizes/resblock_dilation_sizes:与残差块数量一一对应,len值被记为num_kernels,直接决定并联残差分支数(第 154-155 行)。

配置同时指定了预处理只提取梅尔谱与原始音频(extract_mel/extract_audio),训练损失项包含feature、discriminator、generator、mel四类——其中mel损失保证了波形重建后梅尔域的重构一致性。结合 egs/vocoder/gan/README.md 可知,HiFi-GAN 是 Amphion GAN 声码器家族的一员,判别器侧支持 MSD(多尺度)、MPD(多周期)、MS-STFTD 等多种选择。

在 Amphion 中使用:加载与推理

预训练hifigan_speech的直接用途是作为声码器完成最终波形合成。Amphion 的 GAN 声码器流水线(egs/vocoder/gan/README.md)分为数据准备、特征提取、训练、推理四步,其中推理通过 egs/vocoder/gan/hifigan/run.sh 的--stage 3触发,底层调用 bins/vocoder/inference.py。脚本支持三种输入模式:

sh egs/vocoder/gan/hifigan/run.sh --stage 3 \ --infer_mode [infer_from_dataset|infer_from_feature|infer_from_audio] \ --infer_datasets "libritts vctk ljspeech" \ --infer_feature_dir [预测声学特征目录] \ --infer_audio_dir [音频目录] \ --infer_expt_dir Amphion/ckpts/vocoder/[YourExptName] \ --infer_output_dir Amphion/ckpts/vocoder/[YourExptName]/result
  • infer_from_dataset:从数据集直接读取梅尔特征合成;
  • infer_from_feature:输入自备的mels/*.npy声学特征目录,适合接在 TTS/VC 等模型的预测特征之后;
  • infer_from_audio:输入 wav 文件做快速分析-重合成验证。

若直接以官方预训练权重作为声码器,可将--infer_expt_dir指向pretrained/hifigan/hifigan_speech(该目录下含checkpoint与args.json,符合加载约定)。此外,若需在已有检查点基础上继续训练或微调,可参照 egs/vocoder/gan/tfr_enhanced_hifigan/README.md 的用法,用--resume_type resume(恢复全部训练状态)或--resume_type finetune(仅加载模型权重)配合--checkpoint指定断点路径。

使用注意事项

  • 默认CUDA_VISIBLE_DEVICES="0",多卡训练/推理时通过--gpu "0,1,2,3"指定;
  • 多进程训练默认主端口29500,冲突时用--main_process_port调整;
  • 预训练模型面向「语音」领域(VCTK/LibriTTS/LJSpeech),若任务域差异较大(如歌声),建议参照 tfr_enhanced_hifigan 等方案在目标数据上微调后使用;
  • 模型托管于 HuggingFace 的amphion/hifigan_speech_bigdata仓库,下载时务必保留hifigan_speech文件夹的完整内部结构。

小结

hifigan_speech是 Amphion 面向通用语音发布的高质量预训练 HiFi-GAN 声码器(约 685 小时语音数据训练,覆盖 VCTK、LibriTTS、LJSpeech)。通过本文介绍的下载目录规范(放入pretrained/hifigan/hifigan_speech)、源码级参数理解(upsample_rates、resblock_kernel_sizes等)与三种推理模式,读者可以在自己的 TTS/VC 流水线中直接复用该模型完成梅尔谱到波形的重建,或基于其权重在目标数据上进行微调。

  • 音频
  • 语音
  • 媒体生成
  • 深度学习

【免费下载链接】Amphion

Amphion (/æmˈfaɪən/) is a toolkit for Audio, Music, and Speech Generation. Its purpose is to support reproducible research and help junior researchers and engineers get started in the field of audio, music, and speech generation research and development.

项目地址:https://gitcode.com/GitHub_Trending/am/Amphion
点击查看免费下载

相关推荐

上一篇:Dexed FM合成器完全指南:从零开始掌握专业级音色设计
下一篇:开源电子签名平台:如何用DocuSeal和Documenso告别昂贵的SaaS订阅

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询