音频生成:在波形、频谱与离散声码之间建模时间结构
从采样率、神经编解码器和多码本token,到自回归/扩散生成、文本与旋律条件、长程音乐结构及主观评测。
- 明确音乐、音效或环境声任务
- 选择采样率、声道和声学表示
- 验证codec重建上限
- 编码文本、旋律或事件条件
- 生成并调度多码本时序
- 解码、响度与接缝处理
- 分开评测音质、内容、结构和多样性
- 做版权/身份审查并版本化发布
1波形是高频连续信号,直接逐样本生成代价巨大表示
音频生成面对的第一个事实是:同样长度的音频比文字包含多得多的“时间步”。语音和音乐都以波形形式存储,而波形是按固定采样率记录的连续数值序列。以 44.1 kHz 单声道为例,每秒有 44,100 个采样点,10 秒的片段就是 441,000 个连续的幅度值;立体声还要再翻一倍,因为左右两个声道各自有一条这样的序列。作为对照,同样 10 秒的文字可能只包含几十个词、几百个 token。生成器必须逐个预测这些采样值,序列长度直接决定了每一步都要付出的算力和推理时间。
问题不只是采样点多。相邻采样之间高度相关:一个 44.1 kHz 的波形里,当前样本与前后样本的幅度几乎总是非常接近,因为声波的振荡周期通常远长于采样间隔。表面上看,这种相关性似乎让预测变得容易,但真正困难的是这些样本还共同承载着相位、音色和瞬态信息。相位决定波峰波谷出现在哪里,音色由谐波结构决定,瞬态则是打击、爆破音或音符起音处那几毫秒的剧烈变化。这些信息分散在大量相邻样本的关系里,而不是任何一个单独样本能表达的。因此,要忠实还原声音,模型不能只“蒙对每个样本的大致幅度”,还必须维持样本之间长距离的、微妙的结构约束。
直接对原始波形建模是最忠实的路线,能够保留全部细节,但代价是序列极长、逐样本生成速度慢。于是出现了把问题规模缩小的两类表示。一类是频谱表示:取一小段窗口内的信号做时频分解,把波形转换成一帧一帧的时频能量分布,帧率远低于采样率,从而大幅缩短序列长度。另一类是神经 codec:用编码器把波形压缩成低帧率的离散码,再由解码器从这些离散码还原波形。编码器负责丢弃难以感知的冗余,解码器负责把保留的信息重新展开成连续信号。
这两类做法都围绕同一个原理:表示的质量决定了生成质量的上限。无论生成器本身有多强,如果中间表示在压缩过程中丢掉了关键信息,或者引入了不可逆的失真,解码后得到的声音再好也不会超过这个表示所能承载的程度。表示是有损的“瓶颈”,生成模型只能在这个瓶颈允许的范围内工作。理解这一点,是理解后续所有关于 codec、量化、失真天花板讨论的前提。
2codec把声学细节压成每秒少量帧和多层码本数值例子
神经 codec 的核心价值,是把一段高频连续波形重排成“每秒少量帧、每帧若干离散码”的结构,从而让生成模型面对的序列长度骤降。可以具体算一笔账。取一段 32 kHz 采样的 10 秒音频,原始波形包含 32,000 × 10 = 320,000 个采样点。假设 codec 把音频压成每秒 50 帧,10 秒就是 500 帧;每一帧再被量化成 4 个码本 token,那么总共只有 50 × 10 × 4 = 2,000 个离散符号。用符号数粗略比较,序列长度从 320,000 缩短到 2,000,缩短了约 160 倍。
这个约 160 倍的缩减不是没有代价的。关键在于“每帧四层 token 必须共同重建声音”。一帧的四个 token 并不是四个独立的、可以各自随便生成的东西,而是从同一帧声学内容中提取出来的、彼此配合的四个离散码。解码时,只有四层 token 共同输入解码器,才能重建出那一小段波形;少了任何一层,或各层之间不匹配,重建结果就会失真。因此,生成器面对的虽然是一串短得多的离散符号,但它必须在每一帧内部同时维护多层的正确组合关系。
这两点共同划出了 codec 的第一重边界——码率与保真度之间的权衡。帧率越低、码本越少,生成成本越低:帧率低意味着时间上的步数少,码本少意味着每帧要预测的 token 少。但压缩得越狠,丢掉的瞬态、高频和空间感就越多。瞬态是起音、爆破等毫秒级变化,帧率太低时这些变化可能整个被抹平在帧内;高频信息受限于码本的表达能力;空间感(立体声宽度、混响、方位)则需要更多码率才能保留。所以,选择 codec 就是在“生成效率”和“还原上限”之间取一个平衡点,而这一点直接决定了后续生成模型能做到多好。
3多码本通常由粗到细量化同一帧机制
一个时间帧为什么需要多个离散 token,而不是只用一个超大词表把整帧一次性量化?答案在于残差向量量化。如果用单个码本表示一整帧的声学向量,要让保真度足够高,码本就必须覆盖极其多样的声学形态,码本规模会迅速膨胀到无法训练。残差量化换了一种思路:用第一层码本抓住这一帧最主要的声学向量,也就是能量的主体和粗略形状;然后计算“实际向量减去第一层重建结果”得到的残差,再用第二层码本去编码这个残差;依此类推,后续码本逐层编码前一层留下的剩余误差。
这种“由粗到细”的分工,把一帧的声学内容拆成了层次分明的东西。粗层决定大结构和音色轮廓——这一帧听起来大致像什么、能量集中在哪个频段、基本音色是什么;细层则补上纹理——那些让声音细腻、真实的高频颗粒和微小起伏。每层可以各自用一个中等规模的词表,比如每层 1,024 项,四层码本就能组合出一个巨大得多的表达空间,却只需要维护四个小词表,训练和预测都变得可行。这正是多层码本比单层超大词表实用的原因:把指数级的组合能力拆成几个可管理的小词表。
多码本也给了生成器在时间维度上的调度自由。生成器可以按时间交错排列各层 token,可以延迟细层使其晚于粗层预测,也可以并行预测多个码本。但这些调度选择必须严格一致,否则会出现两类典型错误。一是训练—推理泄漏:如果某个 token 在生成时被允许看到未来时间步的信息,训练时模型学到的是“有未来可看”的关系,推理时却没有未来,输出就会退化。二是跨码本不一致:如果同一帧的各层 token 生成顺序或条件关系处理不当,粗层说“这是一个中频乐器音”,细层却按另一个假设补纹理,解码后就会出现互相矛盾的噪声。调度策略因此不只是工程细节,它直接决定了模型在训练与推理之间能否保持一致,以及多层 token 能否拼成一段连贯的声音。
4完整示例:生成12秒“雨夜咖啡馆爵士”音景案例推演
把一句“生成 12 秒‘雨夜咖啡馆爵士’音景”的提示变成一个可诊断的流程,需要把笼统的要求拆成模型能够分别处理的几类信息。提示首先被分解为几个维度:场景是室内咖啡馆,事件是雨声和杯碟碰撞声,音乐是慢速爵士,混音关系是音乐近、雨远。这个分解不是可有可无的修辞,它明确了生成器需要同时满足的内容层次——有什么声音、各自的风格、以及它们在空间中的远近关系。
条件进入模型前还要经过编码。文本编码器把提示转换成语义条件向量,作为生成过程的引导。如果用户另外给了一段参考旋律,则要单独编码其节拍和旋律轮廓,而不是把原音频的身份一并复制过来;这里的边界在于:参考提供的是音乐结构信息,而不是要逐字复刻的声学指纹。接着,模型生成低帧率的声码 token——也就是前面说的离散码序列,并通过指导强度来控制“遵循文本”与“保留多样性”之间的平衡:指导强度高,输出更贴紧提示但可能变得单调;指导强度低,多样性上升但可能偏离提示。
得到 token 序列后,codec 解码器把它还原成波形。随后要做响度标准化,让输出的响度落到合适区间,但必须注意不能削掉瞬态——那些杯碟碰撞、雨滴落下的瞬间冲击一旦被压缩器削平,音景就失去了生动的颗粒感。之后是自动化的客观检查:事件检测确认雨声、杯碟和音乐三类内容是否真的出现;节拍与和声分析检查这 12 秒内音乐结构是否成立。再往后是人工 A/B 听测,分别评估音质、提示匹配度、声音层次(音乐近、雨远的空间关系)以及循环接缝是否自然。最后,只有通过版权与相似性检测并记录来源之后,结果才能发布。
整条链路传达一个核心方法:所谓“听起来好”不能被当作一个整体感觉来验收,而要拆成内容证据、声学证据和结构证据分别确认。内容证据回答“该出现的声音是否出现”,声学证据回答“音质和空间层次是否正确”,结构证据回答“12 秒内音乐的时间结构是否成立”。拆开之后,每一步都有明确的检查手段,也就能定位问题到底出在条件理解、生成采样、解码还是后处理。
5原创图:文本与旋律条件共同引导声码生成,再由codec还原波形可视化
当生成结果不符合预期时,一个常见的困难是不知道该怪谁:是条件理解错了,还是声码 token 序列本身生成得不对,还是解码环节把一段本来正确的 token 还原坏了?把整条生成链画成一张图,就是为了让这三个来源变得可区分。
图中的数据流是单向且分层的:文本条件和旋律条件分别编码后,共同进入音频 token 生成器;生成器输出由多码本帧构成的离散序列;这些 token 再经过 codec 解码器还原为波形。随后,评测被拆到不同的出口上——内容与结构主要针对生成器输出的 token 及其对应条件来检查,而音质主要针对解码后的波形来检查。这样的排布隐含了一个判断方法:如果内容或结构错了,问题大概率出在条件编码或 token 生成阶段;如果内容与结构都对、但听感模糊或有杂音,问题则更可能出在 codec 解码或 token 与解码器之间的配合上。
图的意义在于把三个阶段——压缩、时序生成、波形重建——确立为可分别诊断的单元。压缩阶段由 codec 的编码器完成,它的质量上限决定了后面所有环节的天花板;时序生成阶段由 token 模型完成,它负责在时间上把条件展开成连贯的离散序列;波形重建阶段由 codec 的解码器完成,它把离散码重新变成连续信号。三个阶段串成一条因果链,任何一段的缺陷都会向下游传播,但通过在各阶段出口分别评测,可以把故障定位到具体的那一段,而不是把整条链当成一个黑箱。
6自回归与扩散路线在时间、质量和控制上取舍生成范式
音频生成并不只有“像大语言模型那样逐 token 生成”这一条路。不同的建模家族在时间结构、质量和可控性上各有取舍,因此不存在某个家族天然“更好”,只有更适合某类任务的路线。
离散自回归模型的思路最接近语言模型:把声码 token 当作离散符号序列,逐个预测下一个 token。它的优势是天然擅长建模长序列和条件依赖——既然 token 是一个接一个生成的,长距离的时间结构和文本/旋律条件的注入都很直接。代价是逐步采样慢:要生成一分钟音频,就必须串行地预测成千上万个 token,无法并行。此外,多码本的调度也复杂,前面讨论过的训练—推理泄漏和跨码本不一致都是需要小心处理的坑。
连续或潜空间扩散模型走的是另一条路:在连续或潜在空间中,通过多步去噪逐步把噪声变成目标。它的优势是并行迭代、局部音质强——扩散的每一步可以并行处理整个序列,去噪过程对细节纹理的重建往往很细腻。代价是需要很多步去噪,且长程结构仍然难:扩散擅长把握局部一致性,但要让一首歌从头到尾保持和声与主题的连贯,仍是一个未完全解决的问题。
掩码迭代模型则介于两者之间:它对部分被遮蔽的 token 进行并行补全,因此既能并行,又天然支持补全和编辑任务——比如只改一段音频的中间部分。它的难点在于置信调度与全局一致性:一次并行预测多个 token 时,要决定哪些 token 先定下来、哪些继续迭代,同时还要保证整体不被局部的补全带偏。
混合层级模型尝试把这几类组合起来,先用一层模型规划结构,再用另一层模型填充声学细节,即“先结构后声学”。它的风险是阶段误差传播:如果结构层就定错了,声学层再精细也无法挽回,错误会沿着层级向下游放大。
因此,选择哪条路线取决于任务长度、交互速度要求、编辑需求和硬件条件:需要长音频、强条件遵循时偏向自回归;需要快速交互、局部音质和并行时偏向扩散或掩码迭代;需要长程规划时考虑混合层级。模型家族是工具取舍,不是质量结论。
| 路线 | 优势 | 主要边界 |
|---|---|---|
| 离散自回归 | 自然建模长序列与条件 | 逐步采样慢,多码本调度复杂 |
| 连续/潜空间扩散 | 并行迭代、局部音质强 | 多步去噪,长程结构仍难 |
| 掩码迭代 | 可并行补全和编辑 | 置信调度与全局一致性 |
| 混合层级 | 先结构后声学 | 阶段误差传播 |
7音乐需要分钟级重复、变化和和声规划长程结构
一个音乐模型可以做到“局部每两秒都好听”,整首却听起来像随机拼贴。原因在于音乐里有两类尺度完全不同的信息。音色和节奏主要是局部统计:一个音色的频谱结构、一个鼓点的节奏型,在几秒的窗口内就能完整呈现,短窗口模型足以把它们学得很好。但主题的回归、段落结构、张力的建立与终止,这些都跨越更长的时间——它们描述的是“几分钟里发生了什么变化、何时重复、何时解决”,而不是“这一秒听感如何”。
如果模型只能看到短窗口,它就会在两个极端之间摇摆:要么因为缺乏长程记忆而无限重复同样的乐句,要么因为不知道主题是什么而做无目的的变化,让每个片段都“好听”却彼此无关。解决办法是引入层级结构:先生成和声、节拍或段落草图,也就是音乐的宏观骨架,再基于这个骨架生成声学细节。上层规划决定“这里该进入副歌、这里该积累张力”,下层填充才负责具体的音色和节奏。除此之外,也可以用更长的上下文、显式的结构标签,以及滑窗重叠的方式来让模型看到更远的过去。
滑窗续写是延长音频的常用手段,但它有一组必须维护的状态:节拍相位、调性和主题摘要。如果续写下一段窗口时不记得当前的节拍落在哪一拍、不记得当前调性、不记得主题的旋律轮廓,那么接缝处就会出现节拍错位、调性漂移或主题断裂。因此要对接缝做跨窗一致性测试,确认新窗口的开头能无缝接上前一窗口的结尾。延长时长不是把采样过程简单地多跑几次——计算量、记忆容量和结构误差都会随长度累积。多跑几步意味着更多算力,更长历史意味着模型必须记住更多信息,而每一次续写引入的小误差会在迭代中不断放大,最终把一首本该有结构的曲子拖散。
8条件控制要区分“遵循”与“复制”控制边界
给模型一段参考旋律时,最难拿捏的边界是:既要保持旋律的轮廓,又不能把原录音的身份原样复制过来。“遵循”指的是服从旋律的音高与时间结构——哪些音高、以什么节奏出现;“复制”指的是连同录音本身的音色、演奏者特征、背景噪声一起搬过来。两者必须分开处理,否则模型会退化成对参考音频的模仿,而不是在其指引下生成新内容。
区分的关键在于条件通道的分离。文本控制的是高层语义——风格、情绪、场景;旋律和节拍控制的是音高与时间结构——具体是哪些音、什么时值、什么速度;而一段原始音频提示还可能携带音色、演奏者和背景等额外信息,这些正是我们不希望被复制的东西。因此,要把不同的条件放进不同的通道,让“旋律轮廓”走结构通道,而不让“录音身份”借道混进来。工程上常用几种手段:限制参考旋律的长度,只取足以表达轮廓的最小信息;随机化音色,主动打断参考音频的身份特征;以及用两类不同的相似度指标分别检查——用旋律相似度确认音高结构被遵循,用波形或指纹相似度确认录音身份没有被复制。
还有一股始终存在的张力来自指导强度。指导强度过高,模型会死死贴住提示,多样性下降,甚至因为被过度约束而产生失真或直接过拟合到提示本身;强度过低,则会发生语义漂移,输出慢慢偏离了提示的意图。正确的做法不是迷信某个默认强度值,而是针对具体任务画出一条“强度—匹配—音质”曲线:横轴是指导强度,纵轴分别是与提示的匹配程度和音质,找到匹配度足够高、同时音质和多样性尚未崩塌的区间。这个曲线因任务和模型而异,它把一个看似需要调参的工程问题,转成了可以观测、可以决策的取舍问题。
9codec失真会成为生成器永远越不过的天花板表示边界
如果生成器输出的 token 序列完全正确,解码后却仍有“水下声”或金属感,问题往往根本不在生成器,而在 codec 本身。codec 的有损压缩设定了一个不可逾越的天花板:生成器只能在这个天花板以下工作,无法凭空恢复 codec 已经丢掉的信息。
要确认这一点,最直接的办法是先做一次“真实音频 → 编码 → 解码”的上限测试。拿一段真实录音,不走任何生成模型,直接送进 codec 编码再解码。如果这一步的重建结果就已经丢失了高频、瞬态或空间定位,那就说明这些损失发生在压缩环节,而不是生成环节。既然如此,无论生成器多么强大,它都不可能把真实细节“想”回来,最多只能做幻觉式补偿——编造出听起来合理、但实际上与原始内容无关的纹理。水下声通常对应高频被削弱,金属感往往对应瞬态和相位信息受损,这些都可以在纯 codec 重建测试中被定位。
不同内容对码率的敏感性并不相同。打击乐依赖密集的瞬态,人声依赖谐波结构和齿音等高频细节,环境音依赖宽广的空间与噪声分布,它们各自在压缩下失真的方式和阈值都不一样。因此,选择 codec 时不能只看平均指标,而要针对目标内容类型评估。提高码本数量或帧率可以减少失真,但也会让生成序列变长、带宽上升,重新推高生成成本——这正是前面讨论的码率—保真度边界的延续。
一个值得坚持的评测习惯是:把“codec 重建”和“完整生成”分开做听测。codec 重建的听测结果告诉我们天花板在哪里、哪些失真可以归咎于压缩;完整生成的听测结果减去这个天花板,剩下的才是生成模型真正负责的部分。两者分开报告,才能避免把 codec 的缺陷误判为生成器的失败,也才能针对性地决定是换 codec,还是改进生成模型。
10评测必须把音质、内容、结构和多样性分开验证
用一个 Fréchet 距离之类的单一指标,无法回答“音乐好不好听、是否符合提示”。这类分布距离指标衡量的是生成样本集合与真实音频集合在嵌入空间里的整体相似度,它可能因为分布对得上而给出高分,却完全忽略单个样本是否结构连贯、混音是否合理、是否存在人工伪影。因此,评测必须把音质、内容、结构和多样性拆成彼此独立的维度,分别测量。
自动指标各管一段:嵌入分布距离适合评估生成集合与真实分布的贴近程度,文本—音频相似度衡量条件被遵循的程度,事件检测验证“该出现的声音是否出现”,节拍分析检查节奏结构,声学失真指标测量可闻的噪声与失真。它们的共同盲区是结构、混音和伪影——这些恰恰是决定“听起来像不像成品”的因素。所以自动指标不能替代人工盲测。人工盲测时,要分别询问自然度、提示匹配、结构、可用性和偏好,而不是笼统问“好不好听”;样本要随机排序呈现,并报告不同听者之间的差异,因为听感判断高度主观,差异本身也是重要的评测结果。
另一个必须防范的偏差是“只挑最佳样本”。如果评测者可以无限次重试、然后只把最好的那几条拿出来打分,模型就会显得比真实水平好得多。对抗的办法是固定评测协议:使用固定的提示集,随机化种子,限定生成预算和失败率——即不允许无限制重试,并统计有多少次生成是直接失败的。同时要按音乐、音效、长短、稀有事件等维度切片评测,避免在某个容易的类别上表现好就掩盖了在稀有事件或长音频上的短板。只有把维度分开、把抽样纪律固定下来,评测结果才能真正反映模型在各方面的能力边界。
11版权、身份与内容安全属于生成链的一部分治理边界
面对“生成一段像某位在世歌手的演唱”这样的提示,只看音质是远远不够的。这里其实混着好几个性质不同的问题:训练数据是否获得了许可,模型是否记忆了特定作品,输出是否构成了对旋律或录音的近复制,是否模仿了某位艺术家的风格,以及是否复刻了某个真实人物的声音身份。前三个属于版权与作品层面的问题,后两个属于身份与人格权层面的问题,必须分别对待,不能用一个“听起来像不像”把它们抹平。
在数据与版权一侧,需要保留训练数据的来源和许可记录,让每一段用于训练的材料都可追溯。在输出一侧,要对生成结果做音频指纹、旋律相似度和近邻检索检查:指纹检查能发现对特定录音的复制,旋律相似度检查能发现对作曲作品的复用,近邻检索则能发现对训练样本的过度依赖。这几类检查针对的对象不同,缺一不可。
在身份与安全一侧,针对身份模仿、欺诈、仇恨内容或危险音效(比如用于欺骗或伤害的指令性音频),需要设立明确的使用策略和申诉通道,而不是依赖模型“自觉不生成”。水印与来源元数据可以为溯源提供支持,但它们有两个局限:水印可能被重编码、变速、转码等操作破坏,因此不能作为唯一的保障;同时,水印能标记“这是生成的”,却不能替代版权授权本身。发布时应标注生成与编辑历史,让下游用户清楚这段音频经过了多少次生成、修改和加工。归根结底,版权、身份与内容安全不是生成之后才补上的附加项,而是生成链从一开始就必须内置的一部分。
12部署要管理响度、截幅、延迟和随机失败工程
离线跑出来的样本很好听,不代表在线服务就可用。部署引入了一整套离线评测不涉及的约束:实时性、资源、并发和失败处理。采样时长和显存决定了单次请求的响应时间和同时能服务多少请求;并发量升高时,显存和算力会成为瓶颈;用户还可能中途取消请求,服务必须能干净地中断,而不是把算力浪费在已经没人要的结果上。codec 解码如果分块进行,还要小心块与块之间的接缝——分块边界处理不当会引入咔哒声或相位不连续。
输出在交付前要做峰值与响度检查。峰值检查防止削波,也就是信号超过幅度上限被硬截断而产生的刺耳失真;响度检查则既保证听感一致,也防范突然过响对听者造成听力风险。失败处理同样重要:如果生成中途出错,必须返回明确的状态码,而不是把半段音频当作完整结果发给用户,否则下游会以为拿到了成品。
可复现性是诊断问题的基础。每次生成都应保存模型版本、codec 版本、采样参数、提示和随机种子;有了这些,才能在任何时候重新生成出完全相同的音频,从而定位问题。长音频可以先用低码率快速生成预览,用户确认后再做高质量渲染,避免在用户还没确定内容时就付出昂贵的完整渲染成本。缓存能加速重复请求,但必须严格限定在相同授权和相同版本条件的范围内复用,绝不能跨用户共享参考音频——某个用户上传的参考旋律如果被缓存后串到另一个用户的请求里,就是严重的隐私与授权泄漏。
14把因果链连起来综合
把前面的所有环节串起来,音频生成是一条从“明确任务”一路通到“可验证发布”的因果链,每一环的产出都成为下一环的输入,任何一环的缺陷都会向下游传播。
链条的起点是明确任务类型:要生成的是音乐、音效还是环境声。这一步决定了下游几乎所有选择。接着选择采样率、声道数和声学表示——是直接对波形建模,还是用频谱或离散声码,这决定了整个系统的精度上限和序列长度。选定表示后,第一步验证就是确认 codec 重建上限:把真实音频编码再解码,看它已经丢掉了什么,这划定了生成器永远无法越过的天花板。然后才进入条件编码,把文本、旋律或事件条件分别转成各自的引导信号,区分“遵循”与“复制”。条件准备好后,生成并调度多码本时序——这是自回归、扩散、掩码迭代或混合层级各路线的交汇点,也是训练—推理泄漏和跨码本不一致风险的集中地。生成完 token,再做解码、响度标准化与接缝处理,把离散序列还原成连续且可交付的波形。之后评测必须把音质、内容、结构和多样性分开,各自取证。最后做版权与身份审查,并版本化发布,让结果可追溯、可复现。
这条链同时给出一套验证方法,核心原则是“固定什么、观察什么”。在输入层,固定同一批样本、相同的预处理和权限边界,观察输入哈希、切片标签和拒绝原因,确保没有不同样本或越权材料混入。在机制层,一次只改变一个核心变量,其余配置全部锁定,观察关键中间状态和首次偏离预期的位置,从而定位是压缩、时序生成还是波形重建出了问题。在输出层,使用同一套验收规则和资源预算,观察质量、成本、延迟和失败率在不同条件下的分层差异。最后用反证来收尾:保留一个不启用目标机制的对照组,看收益是否跨样本、跨随机种子稳定复现——如果换一批样本或换几个种子收益就消失,说明观察到的改进不可靠。整条链的价值正在于:每一个“听起来怎么样”的问题,都能被归到某个具体环节,并用对应的证据回答。
| 验证层 | 在“音频生成:在波形、频谱与离散声码之间建模时间结构”中固定什么 | 观察什么证据 |
|---|---|---|
| 输入 | 同一批样本、前处理与权限边界 | 输入哈希、切片标签和拒绝原因 |
| 机制 | 仅改变一个核心变量,其余配置锁定 | 关键中间状态及首次偏离预期的位置 |
| 输出 | 同一验收规则与资源预算 | 质量、成本、延迟和失败率的分层差异 |
| 反证 | 保留不启用目标机制的对照组 | 收益是否跨样本与随机种子稳定复现 |
- High Fidelity Neural Audio Compression (EnCodec):神经音频codec与残差量化
- AudioGen:文本引导的自回归音频生成
- Simple and Controllable Music Generation:多码本音乐语言模型
- AudioLDM:潜空间扩散文本到音频