arXiv 技术报告 · 一百九十五万小时监督 · 二百五十六卡训练 · 代码与权重开源

一句话指挥声音:统一语音生成与编辑的开源基础模型 AuK

Tencent Hunyuan AuK Team · arXiv (cs.SD / eess.AS) · 2026 · arXiv: 2609.08936
原题:AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing
Open Access 新颖度 0.87

🧒 初中生也能看懂的版本

① 研究背景(为什么要做?)

语音技术这些年分裂成了很多互不相通的小工具。想把文字念成话,用一个模型;想模仿某人的音色,用另一个模型;想把录音里的某个词换掉,又是另一个;想把说话人的情绪从平淡改成兴奋、把口音换一换、把背景噪音去掉、把两个人同时说话的录音分开——每一件事,都有一个专门的模型。

可现实中人们的需求几乎从来不是单独出现的。你录了一段音,可能同时想去掉杂音、把中间说错的那句改掉、再让语气听起来精神一点。如果每一步都要换一个工具,体验是割裂的,而对研发方来说,等于把同一套建模功夫重复做了好几遍。

那为什么不做成一个呢?因为这几件事的约束条件根本不一样。生成是从无到有造出新的声音;内容编辑只能改指定的那一小段,其余必须原封不动;改情绪和口音时,说的字一个都不能变;而降噪和分离则要求只留下指令点名的那部分声音。让同一个模型既敢大改又懂得克制,是很难的。

更麻烦的是怎么判断做得好不好。生成任务好评判——把结果转成文字看念错没有,比对音色像不像,都能自动算分。可编辑任务是开放式的:「让语气再自然一点」到底做到什么程度算成功?这没有现成的标准答案,也没有现成的打分模型。

② 研究问题(要回答什么?)

这项研究要解决的是,能不能用一个模型、一个自然语言指令的入口,把语音生成与各种语音编辑统统接管下来。作者把这个目标拆成三道难关。

值得注意的是作者的定位。他们把这称作语音领域的基础模型——意思是它不为某一个具体任务而生,而是提供一个统一的能力底座,用一句话就能调用其中任意一种能力。这和图像领域那种「你圈一下、它就分割出来」的可提示式模型是同一种思路。

③ 研究方法(怎么做的?)

先说数据。作者把语料整理成五大类任务:语音生成、内容编辑、副语言编辑(改情绪、口音、语速这类不改字的属性)、声学编辑(改音质、混响这类底层属性)、以及增强与分离。所有任务都被统一成同一种格式:一句自然语言指令 + 可选的输入音频 → 一段目标音频。规模是三十亿多条指令与音频的配对,折合一百九十五万小时的有效监督。

这里有个很聪明的数据构造技巧。传统的音色克隆需要你既提供参考录音,又提供这段录音的文字稿,这就多依赖了一套语音识别系统。作者的做法是:对同一个人的多条录音,两两配对,让每条既当过参考、又当过目标,但从不提供参考录音的文字稿。这样训出来的模型,拿到一段随便截下来的音频就能克隆音色,不需要先转写。

再说模型结构。它由三部分拼成,各管一摊:

训练分三步走。

第一步是预训练,先只练生成任务打好基本功,稳定之后再把编辑任务一起加进来联合训练。这期间语言模型和自编码器都是冻结的,只更新生成骨干。

第二步是后训练,也是全文设计最贴合问题的地方。因为编辑和生成的评判方式不同,作者给它们配了完全不同的两条路

第三步是提速。原始模型要迭代很多步才能出结果,太慢。作者把它蒸馏成一个只需四步就能出结果的学生模型。这里又遇到一个具体问题:统一地做蒸馏会让「把两个人的声音分开」这项能力退化,学生有时会输出没分干净的混合音。作者的解释是,没分干净的中间结果落在了老师没见过的范围里,老师反而会把它往「听起来整体自然」的方向拉。解决办法是把分离任务单独拎出来,用另一套目标训练,不参与蒸馏。

④ 结果(发现了什么?)

研究结果显示,这个统一模型在语音生成和指令式语音编辑两条主线上都取得了领先成绩,同时在信号级的修复类任务上保持竞争力。

① 声音压缩与还原
负责压缩还原声音的那个部件,在语音、通用音频、音乐三个领域的全部四项指标上都排第一。以语音的感知质量分为例,它拿到 4.143,而此前最好的对手是 3.633。
② 音色克隆
平均识别错误率 2.65%,音色相似度 0.795,两项都是最好。相比在错误率上最强的对手(3.07%)和在相似度上最强的对手(0.778),两项指标同时被超过——这一点不容易,因为二者通常此消彼长。
③ 四步版本几乎不掉队
蒸馏后的加速版错误率 2.85%、相似度 0.790,与完整版差距很小,但推理速度快了约四点五倍,而且不再需要额外的引导计算。

编辑能力的结果更能说明「统一」的价值。在一个综合编辑评测上,衡量指令完成度的指标达到 48.23%,衡量「没被要求改的部分有没有被破坏」的指标达到 88.11%。相比此前最强的编辑专用模型,这两项分别提升了 4.7110.84 个百分点。

请注意第二项的含义:它衡量的是模型的「克制力」——你让它改情绪,它有没有顺手把音色也改了?提升近十一个百分点,说明统一训练非但没有让模型变得手忙脚乱,反而学会了更精准地只动该动的地方。

还有一个有趣的现象:完整版和四步加速版各有所长。完整版在「平均完成度」和「保持一致性」上更好,而加速版在「一次性满足全部评分细则」这个更严格的指标上反而更高(13.85%,此前最好的是 7.04%)。作者对此的解读是,完整版平均表现更稳,而加速版更常出现「全都对」的情况。

在指令式合成上,中文的描述性风格控制准确率达到 83.37%,比最强对手高出 2.27 个百分点。

⑤ 讨论(这些发现说明什么?)

这项工作值得放在一个更大的脉络里看。

过去几年,几个领域先后经历了同一种转变:从「一个任务训一个专用模型」,变成「一个通用底座 + 一句提示」。图像分割领域有过这样的转折点,自然语言处理领域更早就完成了。语音领域一直缺这样一个东西——它被切成了合成、克隆、编辑、降噪、分离等若干互不往来的子领域,各自有各自的模型、数据集和评测。这篇工作的意义,正在于它拿出了一个跨越这些边界的可提示式底座,并且把代码和权重都开放了出来。

技术上最值得学习的,是后训练阶段那种「因任务制宜」的态度。目前主流做法往往是套用一种通用的对齐流程。但作者指出了一个很朴素的事实:生成任务的好坏可以自动测量,编辑任务的好坏不能。既然如此,硬套同一套方法就是错的。于是他们为编辑收集人类反馈做偏好优化,为生成设计自动奖励做强化学习,两条路并行。这种对问题结构的尊重,比套用现成方法更能解决实际问题。

那个防止「奖励作弊」的设计也很典型。当你把多个目标加权求和成一个分数时,模型总会找到那条最省力的路——牺牲难做的那项,去堆容易做的那项。作者的解法不是调权重,而是改变比较的范围:只在内容全对的候选里比音色。这类结构性的约束,往往比参数调优更可靠。

还有一处细节体现了扎实的工程判断:蒸馏损害分离能力这件事。一般的反应可能是加大分离任务的数据比例或调高权重,但作者先诊断了原因——没分干净的中间结果超出了老师模型的分布范围,导致老师给出的指引方向本身就是错的。基于这个诊断,正确的解法就不是调权重,而是把这类样本从蒸馏流程里整个移出去,改用有明确答案的监督目标。

需要客观说明的是,这是一份技术报告,其定位是系统性的工程整合与规模化验证。它所用的组件——流匹配、双流与单流的混合结构、偏好优化、分组强化学习、分布匹配蒸馏——大多有各自的来源,作者也逐一标注了出处。它的原创性主要体现在统一接口的设计、五类任务的组织方式,以及针对具体失效模式的若干关键改造上,而非某个单点的全新算法。

⑥ 结论(最终结论 + 启示)

这项工作的意义在于,它把语音领域从「一个任务一个模型」推向了「一个模型一个指令」。用户不再需要知道自己要用的是编辑工具还是降噪工具,只需要用日常语言说出想要什么。

支撑这个目标的是三件事:一个能同时读懂文字与声音的理解前端,一个先分流再合流的生成骨干,以及一套按任务性质分开设计的后训练方案——编辑靠人来评判,生成靠指标来优化。

结果也支持这个设计。它不仅在音色克隆上把「念得准」和「像本人」两项同时做到最好,更重要的是在编辑任务上大幅提升了不该改的地方不乱改的能力。而蒸馏出的四步版本,用大约四点五倍的速度提升,换来了很小的质量损失。

作者把代码和模型权重都开放了。对语音研究社区来说,这意味着后续工作不必再从零搭建这一整套流程;而那些针对具体失效模式的处理方式——防止奖励作弊的比较范围设计、把分离任务移出蒸馏流程——即使换到别的领域,也是可以直接借鉴的经验。

🎓 专业 IRMaD 结构解读

I. Introduction(引言)

语音生成系统近年由传统 TTS 演进至零样本音色克隆、指令控制合成与日益灵活的语音编辑。然而在实际使用中,这些能力极少孤立出现:用户可能要求以某种描述风格合成语音、替换话语中的某一段、改变情绪或口音、插入非言语发声、分离某位说话人,或修复退化音频。以各自独立的任务专用模型支撑此类请求,既割裂用户体验,也重复了建模投入。

作者明确指出统一化面临三重挑战:(1) 输出约束根本不同 —— 生成创造新语音,内容编辑仅改动选定区域,副语言与声学编辑必须保持语言内容不变,增强或分离则须仅保留指令指定的场景成分;(2) 条件接口不同 —— 部分任务仅依赖文本,另一些需对指令与源/参考音频联合推理;(3) 监督与评测异质 —— 识别准确率与说话人相似度为生成提供了可扩展信号,而开放式编辑还依赖自然度、编辑强度、语境恰当性以及未指定属性是否被保留的主观判断。

作者据此提出 AuK:以自然语言指令 + 可选音频上下文 → 目标波形为共同接口,覆盖语音生成、低层声学控制、副语言变换、内容编辑与信号增强/分离。全部代码与模型权重开源。

I. Theoretical Framework & Hypotheses(理论框架与假设)

整体架构由三个职责互补的部件构成:MLLM 联合处理文本指令与音频上下文以产生多模态语义条件;预训练 VAE 将音频编码到保留细粒度声学信息的潜空间;FLUX 风格的 Transformer 骨干促进语义与声学条件的交互融合并预测目标声学潜变量。

部件实现关键设计
语义编码器Qwen2.5-Omni(冻结逐层隐状态加权聚合而非固定输出层
声学编解码流增强音频 VAE(冻结非因果编码器 + 因果解码器;语音/音频/音乐联合训练
生成骨干混合流 Transformer(可训练10 层双流 MMDiT + 20 层单流 DiT

语义条件:作者论证固定输出层未必是跨任务的最优条件,因不同深度捕捉互补的语言、声学与跨模态线索。逐层隐状态为 h^(ℓ) = MLLM^(ℓ)(t, E_aud(x_ref))(有参考音频时)或 MLLM^(ℓ)(t)(否则)。聚合为 c_sem = Σ_{ℓ=1}^{L} w_ℓ · LayerNorm(h^(ℓ))w_ℓ无约束可学习标量,LayerNorm 用于跨层平衡尺度。

声学条件:VAE 将 24 kHz 波形映射为 50 Hz 的 64 维潜序列,归一化流在 VAE 训练中正则化潜分布。(μ_ref, log σ_ref) = E_enc(x_ref)z_ref = μ_ref + ε ⊙ σ_ref。声学条件 c_ac = z_ref(有参考音频)或

骨干条件映射s⁽⁰⁾ = P_sem(c_sem)a⁽⁰⁾ = [P_ref(c_ac); P_tgt(z_t)]。前 M 层双流 MMDiT 使用流特定的 Q/K/V 与残差投影,RoPE 按各流位置施加后再拼接注意力张量做联合注意力,从而实现双向语义–声学交互同时保留独立残差通路。后 N 层单流 DiT 拼接两流并预测流速度 v̂_t。两类块均在 RoPE 前施加 RMSNorm 式 QK-Norm,并以零初始化的时间条件 AdaLN 调制注意力与 SwiGLU 前馈网络。

训练目标为整流流匹配:z_t = (1−t)z₀ + t·z₁v_t = z₁ − z₀,损失 L_FM = ‖m ⊙ (v̂_t − v_t)‖²₂ / Σᵢmᵢ(对有效非填充帧做掩码 MSE)。时间采样 t = σ(u)u ~ N(−0.8, 0.8²)偏向较小的 t(更接近高斯噪声端),同时保留全轨迹支撑。

M. Materials & Methods(材料与方法)

R. Results(结果)

VAE 重建(三领域全指标最优)

领域 / 测试集方法PESQ ↑STOI ↑Mel Dist ↓STFT ↓
语音 / Seed-TTS-Eval最优基线 (MiniMax-H3-AudioVAE)3.6330.9680.6951.615
AuK-VAE4.1430.9820.5741.457
音频 / AudioSet最优基线 (Stable-Audio-3-SAME-L)2.9010.7791.0523.264
AuK-VAE3.8330.9000.5711.842
音乐 / MUSDB18-HQ最优基线 (Stable-Audio-3-SAME-L)3.0510.8760.6971.795
AuK-VAE3.8840.9270.5251.721

a / D. Discussion & Conclusion(讨论与结论)

🧠 IRMaD 思维导图

I 引言 R 研究问题/假设 M 方法 R 结果 a 讨论 D 结论
mindmap
  root((统一语音生成与编辑模型))
    I 引言
      语音能力被切成多个专用模型
      真实需求常同时出现
      输出约束彼此冲突
      编辑缺乏自动评价指标
    R 问题
      能否统一到一个指令接口
      如何兼容有无参考音频
      异质监督该如何组织
    M 方法
      三十亿条指令音频配对
      一百九十五万小时监督
      语言模型逐层加权聚合
      音频编解码器三域联训
      前十层双流后二十层单流
      冻结前端只训生成骨干
      编辑用人类偏好优化
      生成用分组强化学习
      音色只在内容全对时比
      分离任务移出蒸馏流程
    R 结果
      重建三领域四指标全第一
      克隆错误率二点六五
      音色相似度零点七九五
      两项通常互斥指标同时最优
      指令完成度提升近五个点
      无关属性保持提升近十一点
      严格全通过率接近翻倍
      四步版本提速约四点五倍
    a 讨论
      语音领域的可提示范式转移
      按可测量性分设后训练
      改比较范围而非调权重
      诊断先于调参
      技术报告重在系统整合
    D 结论
      一个模型一句指令
      克制力比生成力更难
      代码与权重全部开源

图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。