在 NLP 领域,大模型(LLMs)凭借其强大的理解和推理能力,正在重塑行业格局。另一方面,多模态大模型,尤其是以语音交互为核心的模型也开始崛起,技术发展迅猛,前景广阔。以 GPT-4o 为例,语音与大模型的端到端结合展示出了高实时性与强表现力,进而吸引了大量科研学者及用户的注意。
现有方法通常依赖于大规模训练数据(数十万甚至百万小时)实现先进性能。尽管语音大模型可以通过扩大数据量和模型参数的方式解决,但是文本和语音之间的核心问题尚未被充分探讨。
表示空间差异:语音使用额外的语音编码端进行建模,而文本表示由大模型产生,两者在表示空间上并不一致。 序列长度差异:语音以帧为单位表示,而大模型以子词为单位进行建模,这造成语音序列通常几十倍长于文本序列。


论文:https://arxiv.org/pdf/2502.12900
Github:https://github.com/FreedomIntelligence/Soundwave
Huggingface:https://huggingface.co/FreedomIntelligence/Soundwave

该阶段主要解决语音和文本表示空间的差异,通过设计对齐适配器(Alignment adapter)和使用 CTC 损失实现对齐。对齐适配器包含线性层与单层 Transformer encoder 层,它将音频序列转换到大模型能理解的表示空间,确保音频和文本能够在表示空间中找到“共同语言”。
这一阶段主要通过压缩适配器(Shrinking adapter),动态压缩调整语音序列长度,使其与文本匹配,并通过注意力机制提取声学信息。该方法首先根据 CTC 预测的峰值来选择语义特征,然后利用这些特征从原始序列中查询并收集辅助信息(如副语言信息等)。最后,将这两类特征进行融合以实现序列长度的缩减。此过程可以参考图三。

在微调阶段,模型仅调整 LoRA 参数,利用文本和语音指令数据来提升任务处理能力。模型通过三种不同的问答格式、十余种不同的语音任务以及多样化的指令格式进行学习,增强其指令遵循和语音理解能力。
实验设置
实验结果





不仅如此,该团队在 ASR 任务上对不同压缩策略进行了对比,发现压缩适配器能够在仅 2.5% 压缩率的情况下保持稳定性能,同时显著加快推理速度。相比 Adapter(×3)和 Adapter(×4)(Adapter(×N)采用与Qwen2-Audio相同的架构,但具有不同的压缩率),该团队的方法分别提升了约 15% 和 25% 的首 Token 延迟(TTFT,Time to First Token),并且几乎不增加计算开销,证明其轻量且高效。然而,在缺少辅助信息的情况下,压缩会导致性能下降,这表明辅助信息在补充缺失特征、确保大模型完整理解方面起到了关键作用。

Soundwave 同时具备强大的问答(QA)功能,能精准理解语音输入,并迅速生成合理答案。如图六所示,用户提出经济市场相关问题,模型准确把握因果关系并作出恰当回应,展现出卓越的分析与推理能力。无论是财经、科技还是日常生活领域,Soundwave都能提供高效、精准的智能问答支持。
该团队提出了Soundwave模型,其借助高效的语音-文本对齐解决方案,突破了传统语音大模型对大规模标注数据的依赖。该团队通过创新性的三阶段训练策略,分别解决了语音与文本的表示空间差距和序列长度不一致性问题,使得模型能够更高效地学习语音理解和对齐能力。实验结果表明,Soundwave 在一万小时训练数据的情况下,在多个语音任务上的表现超越了使用大规模数据训练的 Qwen2-Audio ,并在多个zero-shot任务上展现了良好的泛化能力。
Soundwave 作为高效的语音大模型,在医疗可用于语音病历转录和远程会诊记录,在教育赋能课堂字幕、语言学习辅助,在智能交互促进语音助手、智能家居和客服系统优化。未来,Soundwave 将持续优化语音理解能力,推动语音 AI 在更多场景落地。
