文章链接:https://arxiv.org/pdf/2405.15863
代码链接:https://github.com/ivcylc/qa-mdtHuggingface
链接:https://huggingface.co/spaces/jadechoghari/OpenMusicDemo
链接:https://qa-mdt.github.io/ (chatgpt * 30, musiccaps * 30)
亮点直击
提出了一种质量感知训练范式,使模型在训练过程中能够感知数据集的质量,从而在音乐性(美学角度)和音频质量方面实现卓越的音乐生成效果。 创新性地将masked扩散Transformer引入到音乐信号中,展示了其在建模音乐潜在空间上的独特效果,以及其在质量控制感知方面的卓越能力,从而进一步提升了生成音乐的质量和音乐性。 解决了大型音乐数据集中文本与音频低相关性的问题,有效提高了文本对齐度和生成的多样性。
背景
当前音乐生成(音效生成)领域的问题为质量低,具体来说分为三个方面:
大部分的开源数据集音质低(FMA,AudioSet,MSD),旋律杂乱 音乐性(美学角度)差 文本对齐度低,大多数的音频处于少标签,弱标签,错标签。其中, 第1点可以由下图蓝色分布CLAP分数表征,2,3点可以由数据集的平均MOS分布表征(颜色由 分割)

创新方法及思路
质量信息注入
两种注入方法:
利用text encoder对分级后的 low quality, medium quality, high quality 质量文本进行cross attn嵌入 【粗粒度,适配unet架构和transformer类架构】 参考U-ViT内 时间信息和label信息的融入方式,以量化(阈值由 决定)后转换为quality embedding, 以token 形式进行控制注入,【细粒度,并且只适配transformer类架构】

质量感知型 masked扩散Transformer
优化:
对频谱切片而言,此类结构的收敛速度慢。消融数据集中,20w步时依然不能很好控制收敛,推测来源于时域/频域相关性弱。故在预训练阶段加入掩码,加速训练速度和频谱关联性。微调阶段以高质量数据进一步强化模型(5W步就有收敛迹象)。 相比于U-Net,transformer based架构对text encoder的质量信息感知能力增强,并且U-ViT 式 token 质量融入策略显著有效进一步提升质量并降低客观指标 图像中切块未考虑 overlap,探究了overlap策略在合成中的作用(大幅降低FAD,但在主观听感上有trade off)
优化音乐标注描述
解决:首次在音乐生成领域使用预训练标注模型(LP-Musiccaps)进行大规模标注优化:
考虑到标注模型的不充分训练导致错标,以CLAP文本-音频分数+阈值筛选低分数据 考虑到原始标注中有些词(例如说American,R&B等标注器不一定能标注出的词)。使用CLAP分数过滤出生成的与原始的文本相似度低低数据,利用语言模型 融合原始标注中有用信息。
实验





主观评测结果
PO:产品运营 PMP:专业音乐制作人 VE:视频编辑人 BEGINNERS:不懂音乐的小白
