☰
AuK:统一自然语言指令驱动的开源语音生成与编辑基础模型 —— 架构解析、任务全景与部署实践
2026/9/30 8:00:56 网站建设 项目流程
  • 人工智能
  • 基础模型
  • 语音
  • 音频
  • 媒体生成

【免费下载链接】AuK

项目地址:https://ai.gitcode.com/tencent_hunyuan/AuK
点击查看免费下载

导读

本文以 Tencent Hunyuan 开源仓库 README.md 为核心,系统解读AuK这一 1.5B 参数语音基础模型:它如何通过一个统一的自然语言指令接口,同时覆盖零样本 TTS、语音内容/声学/副语言编辑、语音增强与音源分离等 15 项任务。你将掌握 AuK 的整体架构设计(扩散主干 + MLLM 编码器 + 流匹配 VAE)、完整权重下载与目录组织方式、SGLang-Omni 快速推理启动命令,以及各任务在统一指令范式下的能力边界。全文以仓库内 config.yaml 等真实配置为源码级佐证,可直接指导实操。

一、项目概览:一个模型、两大变体、统一指令接口

AuK(AuK: An Open-Source Foundational Model for Speech Generation and Editing)是一个 1.5B 参数的语音生成与编辑基础模型。据 README.md 介绍,它基于数百万小时的多样化音频数据训练而成,核心设计哲学是:一切任务都通过同一种自然语言指令接口暴露,用户不需要针对每种任务切换专用模型或专用 API 格式。

AuK 提供两个官方变体:

模型说明特点
AuK高质量生成基础模型本仓库包含其官方权重
AuK-Flash蒸馏加速模型支持4 步快速推理(4-step distilled inference),适合对延迟敏感的场景

需要说明的是,本仓库发布的是AuK base 模型的官方权重;AuK-Flash 为可选的加速蒸馏版本,两者在使用上共享同一套指令接口与推理流程。从仓库文件结构(auk_base.safetensors、vae.safetensors)可以看出,基础权重与 VAE 权重在仓库中分开存放,这也与下文"运行时从独立文件加载 VAE"的机制一致。

二、模型架构:指令理解 → 扩散生成 → 流匹配 VAE 解码

README 将 AuK 的架构概括为"基础模型 + MLLM 编码器 + VAE",其中模型 checkpoint 内包含Diffusion Transformer 与 layer-fusion 权重,而MLLM 编码器与 VAE 在运行时从独立文件加载。仓库根目录的 config.yaml 为我们提供了架构层级的完整参数依据,可以还原出如下全链路:

输入侧(指令与条件理解)

  • text_encoder.text_encoder_path: ckpts/Qwen2.5-Omni-3B:AuK 复用Qwen2.5-Omni-3B多模态大语言模型(MLLM)作为文本/指令编码器,负责把自然语言指令(如"把这段语音换成开心的语气")编码为条件特征。这是 README 中"统一自然语言指令接口"的底层实现——指令语义理解完全交给通用 MLLM,而不用为每个任务单独训练语义模块。
  • 架构侧text_hidden_dim: 2048定义了文本特征维度,用于与音频隐空间条件对齐。

生成侧(扩散主干)

  • model.backbone: Flux2Edit:生成主干采用Flux 风格的 Diffusion Transformer(DiT)结构,包含双流(attention)与单流(single attention)层配置:num_layers: 10、num_single_layers: 20,模型宽度dim: 1536、注意力头数heads: 24、FFN 扩展倍数ff_mult: 2。
  • model.cfm_class: CFMEdit:采用条件流匹配(Conditional Flow Matching)作为生成目标的训练范式,配合schedule.t_sampling: logistic_normal(对数正态时间采样)以及P_mean: -0.8、P_std: 0.8的调度超参,控制扩散/流匹配过程中的时间步采样分布。

输出侧(声码器)

  • vae.vae_name: BigVGANFlowVAE:采用融合流匹配的BigVGAN 家族 VAE作为神经声码器,将隐空间表征还原为波形。关键参数如下:
配置项值含义
latent_dim64隐空间通道数
downsample_rate480整体下采样倍率
target_sample_rate24000输出目标采样率(24 kHz)
upsample_rates[5, 4, 3, 2, 2, 2]上采样倍率序列
upsample_kernel_sizes[10, 8, 6, 4, 4, 4]上采样卷积核
resblock_kernel_sizes[3, 7, 11]残差块卷积核
downsample_channels[12, 24, 48, 96, 192, 384, 768]各下采样层通道数
snake_logscaletrue使用 Snake 激活(对数尺度)
causaltrue因果卷积,支持流式/低延迟解码
flow_hidden_channels256流匹配分支隐藏通道

推理侧配置细节:attn_backend: flash_attn默认启用 FlashAttention,但配置注释明确说明CLI 在推理时会覆盖为torch(避免引入 flash_attn 依赖);checkpoint_activations: True配合checkpoint_every_n_layers: 4启用梯度检查点,注释显示该设置可将峰值显存从约 91G 降至约 75G,这为后续微调场景提供了显存预算参考。

从源码结构看,AuK 的"layer-fusion"权重与config.yaml中双流/单流层并存的结构相互印证——它表明扩散主干内部存在跨层特征融合机制,以增强编辑类任务对局部音频特征(音色、情感、韵律)的精准控制。

三、支持的任务全景:六大类别、15 项任务、一种指令范式

AuK 的能力覆盖面是其核心卖点:不需要换模型、不需要改接口,只需用自然语言描述"想做什么",模型即可完成对应任务。README 中的任务总表(Supported Tasks)按类别完整列出如下:

类别任务说明
语音生成Zero-shot TTS用参考音频的音色朗读目标文本
语音生成Instruct TTS仅凭一句语音描述生成语音,无需参考音频
内容编辑Speech Content Editing改写"说了什么"——替换、插入或删除文本内容
内容编辑Lyric Editing改写演唱录音中的歌词,同时保留旋律与音色
声学编辑Pitch Editing按半音升高或降低音高
声学编辑Speed Editing调整语速,输出长度随速度系数伸缩
声学编辑Volume Editing按分贝升高或降低音量
副语言编辑Emotion在保留内容与音色的前提下改变情感
副语言编辑Timbre按描述改变音色,内容保持不变
副语言编辑De-accent去除地域口音,同时保留说话人音色与内容
副语言编辑Nonverbal Editing移除或添加呼吸、笑声、咳嗽等非言语声音
副语言编辑Whisper Conversion在正常语音与耳语之间转换,保留说话人与内容
增强与分离Speech Enhancement降噪、去混响,恢复自然清晰的语音
增强与分离Speech Separation按说话顺序只保留某一位说话人,移除其他声音
增强与分离Music Separation从混合音频中提取人声,或保留所有人类声音
增强与分离Target Speaker Extraction依据"说了什么"锁定并保留目标说话人

要点解读:

  1. 任务粒度可组合:例如"De-accent + Emotion + Volume Editing"可以串联成一条流水线,全部通过自然语言描述驱动,这是传统单任务系统难以做到的。
  2. 编辑任务的核心约束:README 在每项编辑任务的描述中都强调"保留音色/内容/旋律"等不变属性,这说明 AuK 的编辑能力建立在条件解耦之上——扩散主干 + layer-fusion 机制让模型能独立操控内容、声学与副语言三个维度的表征。
  3. 增强与分离任务被纳入统一接口:语音增强、人声/音乐分离、目标说话人提取这些传统上由专用模型承担的任务,在 AuK 中同样通过指令触发,体现了"基础模型统一多任务"的范式迁移。

(说明:完整版 README 中每项任务均附带指向 Cookbook 章节的链接,提供对应指令模板及 CLI/Python 示例;当前镜像仓库以 README 与配置为发布主体,实践时可结合官方 Hugging Face/ModelScope 演示空间验证各任务的指令效果。)

四、权重下载与目录组织:两条渠道、三份组件

AuK 的推理需要三份组件:AuK 基础权重(含 Diffusion Transformer 与 layer-fusion 权重)、MLLM 编码器(Qwen2.5-Omni-3B)以及VAE 权重。README 提供了 Hugging Face 与 ModelScope 两条等价下载渠道。

Hugging Face 渠道:

pip install -U "huggingface_hub[cli]" # AuK-Base hf download tencent/AuK --local-dir ./ckpts/AuK # AuK-Flash (4-step distilled) hf download tencent/AuK-Flash --local-dir ./ckpts/AuK-Flash # MLLM Encoder hf download Qwen/Qwen2.5-Omni-3B --local-dir ./ckpts/Qwen2.5-Omni-3B

ModelScope 渠道:

pip install -U modelscope # AuK-Base modelscope download --model Tencent-Hunyuan/AuK --local_dir ./ckpts/AuK # AuK-Flash (4-step distilled) modelscope download --model Tencent-Hunyuan/AuK-Flash --local_dir ./ckpts/AuK-Flash # MLLM Encoder modelscope download --model Qwen/Qwen2.5-Omni-3B --local_dir ./ckpts/Qwen2.5-Omni-3B

期望的目录结构:

ckpts/ ├── AuK/ ├── AuK-Flash/ # optional └── Qwen2.5-Omni-3B/

关于权重组成的关键注意事项(README 原话要点):

  • 模型 checkpoint 仅包含diffusion transformer 与 layer-fusion 权重;
  • MLLM 编码器与 VAE 在运行时从独立文件加载(对应仓库中的 vae.safetensors,配置项vae.vae_model_path: ckpts/AuK/vae.safetensors即指向该路径);
  • 因此,checkpoint 加载过程中缺少text_encoder.*键是预期行为,无需视为异常——这是 AuK 模块化设计的直接体现:模型本体与语义编码器解耦,可独立升级或替换。

五、快速推理:SGLang-Omni 的 Day 0 支持

AuK 在开源之初即获得了SGLang Omni团队的 Day 0 支持。使用 SGLang Omni 启动 AuK 服务的命令非常简洁:

python -m sglang_omni.cli serve --model-path tencent/AuK

该命令以模型在 Hugging Face 上的 ID(tencent/AuK)作为--model-path直接拉起服务,SGLang Omni 负责加载 MLLM 编码器、扩散主干与 VAE 并完成推理管线编排。这一路径适合需要服务化部署、并发推理或进一步做推理优化的场景;对更详细的配置选项与优化路线,README 指向 SGLang Omni 官方 Cookbook 中的 AuK 专题与对应的优化 Roadmap 议题。

(提示:若仅做单次实验,也可直接从 Hugging Face / ModelScope 演示空间体验各任务效果;仓库本身以发布权重与配置为主,不包含本地 CLI 训练脚本。)

六、性能表现:跨四类任务的能力验证

README 的性能章节展示了 AuK 在语音生成(speech generation)、语音编辑(editing)、语音增强(enhancement)与音源分离(separation)四类基准上的性能对比图。该图传达的核心信息与本文脉络一致:一个模型在同一指令接口下,于四类任务上都具备与领域专用模型可比或更优的竞争力。需要客观看待的是,具体数值与对比对象以官方技术报告(见下节引用条目)为准,本文不展开未经仓库确认的数据细节。

七、引用与许可

学术引用:使用 AuK 进行研究时,可引用官方技术报告条目:

@misc{ma2026auktechnicalreportopensource, title={AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing}, author={Ziyang Ma and Zhikang Niu and Wenming Tu and Tianrui Wang and Ruiqi Yan and Junxi Liu and Yanru Huo and Nickk Huang and Yang Liu and Qicong Xie and Zeyu Xie and Hui Wang and Haitao Li and Zixuan Jiang and Yalin Li and Jie Fang and Yifan Duan and Zeyue Tian and Guangzheng Li and Haina Zhu and Shuyi Wang and Jinwen Wang and Mingyu Cui and Tian Tan and Auden and Sen Liang and Steve Yves and Shan Yang and Liefeng Bo and Zilong Zheng and Kai Yu and Eng-Siong Chng and Xie Chen}, year={2026}, eprint={2609.08936}, archivePrefix={arXiv}, primaryClass={cs.SD}, url={https://arxiv.org/abs/2609.08936}, }

开源许可:AuK 采用MIT License发布,完整条款见仓库 LICENSE。该许可以开放方式覆盖训练代码、推理代码、参数与权重,允许自由使用、修改与再分发,适合社区二次开发与商业集成。

总结:AuK 给语音 AI 工程带来的三个关键启示

  1. 指令即接口:将 TTS、编辑、增强、分离全部收敛到自然语言指令范式,显著降低多任务系统的工程复杂度——text_encoder复用通用 MLLM(Qwen2.5-Omni-3B)是关键实现决策,见 config.yaml。
  2. 模块化解耦:基础权重、MLLM 编码器、VAE 三份组件独立加载(README 明确"缺少text_encoder.*键属预期行为"),使组件可独立升级,也为不同部署形态(离线批处理 vs 服务化推理)提供灵活性。
  3. 扩散 + 流匹配的统一生成框架:Flux2Edit 主干 + CFMEdit 条件流匹配 + BigVGANFlowVAE 的组合(config.yaml),让一个模型同时胜任生成与精细编辑,配合 AuK-Flash 蒸馏变体可在质量与速度之间取舍。
  • 人工智能
  • 基础模型
  • 语音
  • 音频
  • 媒体生成

【免费下载链接】AuK

项目地址:https://ai.gitcode.com/tencent_hunyuan/AuK
点击查看免费下载

相关推荐

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询