把录音里说错的一个词改过来,让一句话的语气更轻松,或者去掉背景中的狗叫声,同时保留原本的人声和环境声——这些看似简单的要求,正是音频编辑需要解决的问题。

随着音频生成模型的发展,用文字描述一段声音并让模型生成出来,已经有了不少可行方案。但面对一段已有的录音,模型还需要知道改什么、在哪里改,以及哪些内容应该保留。生成能力的提升,为音频编辑带来了新的可能,也让这一领域出现了越来越多不同的任务定义与技术路线。

围绕这些问题,浙江大学的研究者撰写了综述《Audio Editing in the Era of Foundation Models: A Survey》,系统梳理基础模型时代的音频编辑研究,覆盖语音、音乐和通用音频三个领域。该综述已被 AACL-IJCNLP 2026 接收。

我们从任务分类、基础模型、训练与推理方法、数据及评测资源几个方面展开。相比单纯梳理不同模型,我们更关注一个贯穿音频编辑的问题:模型在完成目标修改后,原本不该变化的内容究竟保留得怎么样?围绕这一问题,论文进一步整理了现有的模型、数据集、数据工具与评测方法。

论文地址:https://arxiv.org/abs/2606.23139

GitHub:https://github.com/MM-Speech/AudioEditSurvey

项目主页:https://david-pigeon.github.io/audioeditsurvey_project/


⏩概 览

传统音频编辑通常依赖数字音频工作站和信号处理工具。用户需要定位片段、调整参数,并反复试听修改结果。基础模型正在改变这一工作方式:编辑条件可以是一段文字、一段参考音频,也可以是指定的时间区域,模型据此完成局部修改或整体属性调整。

不过,音频编辑对“保留”的要求,和对“修改”的要求同样重要。修改一句话中的日期,不应该顺带改变说话人的音色;替换背景里的一个声音事件,也不应该破坏前景人声。对于音乐,局部修改还需要兼顾节奏、旋律和整体结构。

这也是本文组织相关研究的出发点。我们没有简单按照模型或论文类别罗列工作,而是先从究竟在编辑什么入手,将现有任务统一到声学、语义和实例三个层次中。在此基础上,再比较不同技术路线如何完成目标修改、如何限制修改范围,以及现有的数据和评测能否真正衡量“该改的改了、不该改的没动”。这样的组织方式也使语音、音乐和通用音频中的不同编辑任务能够放在同一个框架下进行比较。


⏩音频编辑的任务分类

同样是“修改一段声音”,调整音量、改写台词和替换说话人,所涉及的信息层次并不相同。论文根据主要编辑对象,将现有任务归纳为声学编辑、语义编辑和实例编辑三类。

图 1:音频编辑任务分类,涵盖声学、语义和实例三个层次。

1、声学编辑:调整声音的声学属性

声学编辑关注音量、噪声、混响和频谱等属性,包括响度与音量编辑、降噪与修复、混响编辑,以及音频均衡。例如,提高一段录音的音量、减弱房间回声,或者让声音听起来更明亮,都属于这一范畴。

这类任务通常不改变音频传达的语义内容和声源身份。以语音降噪为例,模型需要去掉噪声,同时保留说话内容、音色与发音细节;如果背景变干净了,人声却出现明显失真,编辑仍然不算成功。

2、语义编辑:修改内容、表达与风格

语义编辑面向音频中更高层次、可解释的信息,主要包括语言内容编辑、表达编辑和风格编辑。

语言内容编辑可以把录音中的“周一”改成“周五”,并保持前后语音衔接自然。表达编辑关注情绪、韵律、语速等因素,例如让同一句话说得更高兴,或加入耳语、笑声等表达特征。风格编辑则涉及更整体的呈现方式,例如让讲话更正式,或调整音乐的风格特征。

这些任务的难点在于,不同属性往往彼此关联。改变情绪时,语速和音高可能需要随之变化,但说话人的身份和原有内容仍应尽量保持稳定。模型需要区分哪些变化是编辑目标的一部分,哪些属于额外改动。

3、实例编辑:操作音频场景中的具体声源

实例编辑关注一段音频中的具体对象,如说话人、声音事件、乐器、人声轨道或背景声,涵盖替换、删除与提取、插入,以及叠加等操作。

例如,把狗叫替换成汽车鸣笛,从混合录音中提取指定说话人的声音,在场景中加入门铃声,或为现有音频叠加人群环境声。与修改整体声学属性相比,这类任务更依赖对目标声源的准确定位,以及对其他声源的保留。

三类任务之间并不存在绝对清晰的边界。例如,去除无结构的背景噪声通常属于声学编辑,而移除一个可辨识的背景声源则更接近实例编辑。实际需求也可能同时涉及多个层次,因此这里的分类强调的是主要编辑对象,而不是试图把所有操作划分成彼此互斥的类别。


⏩支撑音频编辑的基础模型

早期神经音频编辑方法多围绕特定任务设计,通过局部重建、上下文建模和属性控制实现编辑。随着生成模型的发展,基于音频编解码器的语言模型,以及扩散与流匹配模型,逐渐成为支撑音频编辑的重要技术路线。

1、基于音频编解码器的语言模型

这类方法先将连续音频编码为离散 token 序列,再通过续写、填充或选择性重新生成来完成编辑。音频序列中的时间结构,为局部片段修改提供了较明确的操作对象。

例如,VoiceCraft 将语音编辑建模为音频 token 序列中的片段填充;SpeechX 则以离散 token 为共同表示,支持编辑、提取和转换等多种语音任务。后续研究进一步关注多片段编辑、背景保留,以及减少对非目标区域的改动。

这一路线适合利用上下文进行语音内容修改,但效果依赖文本与音频的对齐,以及音频 token 对原始信息的保留能力。面对长音频、重叠声源或复杂音乐结构时,局部生成错误还可能影响后续内容。

2、扩散与流匹配模型

扩散和流匹配模型通常在梅尔频谱或音频潜在空间等连续表示上完成生成,并通过原始音频、文本、掩码或参考信号约束编辑过程。

在语音领域,FluentSpeech、DiffEditor 等方法关注局部重建和编辑边界的自然衔接。在通用音频领域,AUDIT、PPAE、AudioMorphix分别探索了指令驱动、事件定位和参考音频引导等编辑方式。音乐领域的MelodyFlow则将流匹配与潜在空间反演用于音乐编辑。

连续生成过程为音色、声学纹理和局部细节的修改提供了较大的灵活性。不过,编辑区域与非目标区域往往共享相互关联的表示,局部修改仍可能波及其余内容。因此,生成质量之外,如何施加准确的保留约束也是这一方向的关键。

3、自然语言接口与智能体编辑

除了生成模型本身,综述还讨论了用户如何表达需求,以及系统如何将需求转化为可执行的编辑操作。文本指令、参考音频、时间区域和视觉线索,都可以成为编辑条件。

近期的统一模型进一步将指令理解与音频生成结合起来。AuK 以自然语言指令和音频上下文为输入,结合语言模型与流匹配生成,支持语音内容、表达方式和声学属性的编辑;Audio-Omni 则将多模态大语言模型与扩散 Transformer 结合,覆盖语音、音乐和通用音频的生成与编辑。

对于包含多个步骤的请求,WavCraft、MusicAgent、AudioAgent 等系统利用大语言模型理解指令、拆解任务,并调用专门的音频模型或处理工具。Loop Copilot 则进一步探索了多轮交互中的音乐编辑。

这类系统承担的是规划与工具协调的角色,其效果既取决于单个工具的能力,也取决于调用顺序是否合理,以及连续操作后能否保留用户不想改变的内容。


⏩核心方法:需要训练与免训练的音频编辑

模型架构决定了音频如何表示和生成,学习与推理方法则决定了模型如何获得编辑能力。论文从这一角度,将现有工作整理为需要训练的编辑方法和免训练编辑方法两条路线。

1、需要训练的编辑方法

这类方法通过配对数据、伪配对数据或指令监督学习编辑行为。根据监督形式和条件信息,论文进一步归纳了三种方式。

最直接的一类是任务专用训练。这类方法围绕明确的编辑功能展开,例如文本替换、韵律修正或声源分离。模型通常利用转写文本、掩码、对齐信息或声源标签,学习目标区域的重建与非目标内容的保留。这类方法在任务边界清晰时较为可靠,但其适用范围也受到训练任务和数据分布的限制。

如果编辑目标很难通过固定标签完整描述,也可以引入参考音频或属性条件。用户可以提供一段音频作为音色、口音或制作风格的参考,也可以直接指定情绪、说话风格等属性。相比手动设置大量参数,这种方式更容易表达听感上的目标,但也要求模型区分目标属性和其他信息,避免在转移风格时一并改变内容或身份。

自然语言本身也可以成为监督信号。指令训练通常使用“编辑指令—输入音频—目标音频”三元组,让模型学习从语言描述到具体编辑操作的映射。AUDIT 等工作探索了增加、删除和替换等操作,后续研究进一步扩展到更自由的指令、组合操作与交互式编辑。自然语言使控制方式更加灵活,同时也对训练数据的覆盖范围和指令准确性提出了更高要求。

图 2:需要训练的音频编辑方法,包括目标条件、数据构建与编辑训练三个环节。

2、免训练编辑方法

免训练编辑直接利用已有生成模型,不更新模型参数,而是在推理阶段控制生成过程。这里的“免训练”并不意味着模型本身没有经过训练,也不意味着无需迭代采样或推理时优化。论文主要讨论扩散等非自回归模型中的三类机制。

一种常见思路是先“找回”原音频在生成模型中的位置。基于反演的编辑会先将原始音频映射到模型的潜在表示、噪声或生成轨迹,再修改条件并重新生成。这样可以利用预训练模型的生成能力进行编辑,但如果反演不能准确重建原音频,非目标内容也可能发生变化。

另一种思路是直接干预模型内部的信息交互。注意力修改通过调整或复用模型中的注意力信息,控制文本条件与声音事件之间的对应关系。交叉注意力可以帮助定位和修改目标事件,自注意力的复用则有助于保留原有结构。这类方法的效果取决于注意力信息能否准确反映听觉事件和音乐结构。

如果需要修改的区域本身是已知的,还可以直接用掩码限制编辑范围。掩码可以作用于时间片段、时频区域或潜在表示,明确哪些部分允许变化、哪些部分需要保留。它适合局部修复、片段填充和声源级操作,但掩码边界不准确时,也容易出现修改不完整、衔接不自然或误改其他内容的问题。

三类机制可以组合使用。例如,先通过反演建立原音频的重建路径,再结合注意力与掩码约束编辑范围。它们共同面对的难点,是在满足新条件的同时,尽量减少对原始内容的不必要改动。

图 3:免训练音频编辑方法,通过反演、注意力修改与掩码引导控制编辑和保留过程。


⏩训练资源与评估标准

1、数据集与数据构建工具

音频编辑需要的数据,不只是音频和对应的文字描述。对于一个具体编辑请求,理想的样本还应说明目标在哪里、哪些区域需要保留,以及正确的编辑结果是什么。

综述整理了语音、音乐和通用音频领域的公开资源。其中,语音资源可以支持内容修改、说话人保留与长上下文编辑;音乐数据中的分轨、乐谱、歌词和描述信息,则可以用于构建乐器、旋律与风格编辑任务。对于通用音频,事件标签、文本描述及带噪录音也为声音事件操作和声学修复提供了基础。

需要注意的是,这些资源中相当一部分并非直接面向音频编辑的数据集。有音频描述,不代表有对应的编辑指令;有声源分轨,也不代表已有完整的编辑输入与输出。因此,如何将现有资源转化为可靠的编辑监督,也是数据建设中的重要环节。

表 2:音频编辑相关公开数据集,比较数据规模、配对信息、时间标注与描述信息等属性。

构建编辑数据时,通常还需要解决三个问题:目标在哪里、音频里有什么,以及编辑后的结果从哪里来。对应地,可以借助时间定位、语义标注和配对样本构建三类工具。MFA、WhisperX 等可以辅助确定词级时间边界;识别、检测与音频描述模型可以补充语义信息;语音合成、声音转换、声源分离和重新混音等工具,则可以进一步构造编辑前后的配对样本。

这些工具降低了数据构建成本,但自动生成的指令、边界和目标音频仍需要检查。否则,模型可能在学习编辑操作的同时,也学到数据构建过程中引入的错误。

2、如何判断一次编辑是否成功

一段音频听起来很自然,不代表编辑已经成功。模型可能没有完成要求的修改,也可能虽然改对了目标,却顺带改变了说话人、背景声或音乐节奏。

因此,一次完整的编辑评估至少需要回答四个问题:

评估维度需要回答的问题代表性评估方式
指令遵循是否完成了用户要求的修改?语音内容的 WER/CER、音频与文本的 CLAP 相似度、任务相关属性评估
内容保留与局部性非目标内容是否得到保留?是否存在漏改或多改?说话人相似度、非目标区域的波形、频谱或嵌入比较
时间与结构一致性编辑处是否衔接自然?时间和音乐结构是否协调?边界误差、词级时间一致性、旋律与节奏指标
音频质量与自然度是否存在失真、伪影或明显不自然的声音?人工听测、MOS 类质量估计、适用场景下的 PESQ、STOI、SI-SDR 或 FAD

这些指标各自反映不同侧面,不能相互替代。例如,文本与音频相似度较高,并不能证明非目标区域没有被修改;说话人相似度较高,也不能证明目标文字已经改对。

SpeechEditBench、MMAE 等基准已经开始尝试更系统地衡量编辑能力,但仅靠单一自动指标仍然不够。更可靠的评测需要同时考察目标修改、非目标保留与感知质量,并用人工听测对自动评估结果进行校准。

其中,SpeechEditBench 面向双语语音编辑,包含单项与组合操作,分别衡量目标修改是否成功、非目标语言内容是否保留,以及二者是否同时满足。MMAE 则覆盖语音、音乐、声音事件及其混合场景,并纳入多轮编辑,通过为每个样本制定细粒度评分标准,检查指令遵循和上下文一致性。


⏩关键挑战与未来方向

真正困难的并不是让模型生成新的声音,而是让它只改应该改的部分。真实录音中的语音、音乐、背景声与混响往往混合在同一段波形中,声源边界并不清晰。模型既要准确找到目标,还要判断哪些属性可以随之变化、哪些内容必须保持不动。面向具体声源的表示,以及时间区域、事件边界、说话人标签等结构化条件,可能是提高编辑精度的重要方向。

当编辑从单次操作走向真实的多轮交互,可靠性会变得更加重要。在干净音频和明确指令上表现良好的方法,遇到多人重叠、长音频或模糊请求时,未必还能稳定工作。更麻烦的是,多轮编辑中的小偏差会逐步累积,最终影响原本没有问题的内容。因此,指令定位、长上下文建模,以及编辑后的检查和修正机制,都需要进一步完善。

现有评测的另一个问题,是很多指标原本并不是为“编辑”设计的。音频生成、识别和理解领域已经积累了丰富的评估工具,但它们很难单独回答“该改的是否改对了、其余内容是否保住了”。更适合音频编辑的基准,需要明确标注编辑目标、操作范围和需要保留的内容,才能让不同方法在真正一致的条件下进行比较。

音频编辑真正走向实际应用,需要的不只是更强的生成能力,还需要让每一次修改都足够准确、可控。当用户只想改动其中一小部分时,模型也应该知道其余特征最好什么都不要做。这正是本文反复讨论的核心问题。