来源丨AIGC Studio
近日,美团开源了一款名为 LongCat-Next 的原生全模态模型,该模型能够接受文本、语音、图像的输入,并生成相应的文本、语音、图像输出。

LongCat-Next不仅简化了多模态建模的复杂性,还在图像理解与生成、纯文本处理、语音ASR(自动语音识别)与TTS(文本转语音)等方面展现出了卓越的性能。


介 绍

LongCat-Next是一个原生多模态模型,它采用单一的自回归目标函数处理文本、视觉和音频,且在语言范式之外,归纳偏置极小。作为一个规模达到 A3B 级的工业级基础模型,它在视觉、创造和表达方面表现出色,并在众多多模态基准测试中取得了优异成绩。尤其值得一提的是,它利用语义完备的离散表示,突破了离散视觉建模在理解任务上长期存在的性能瓶颈,并为视觉理解和生成提供了一个统一的解决方案。这一成功表明,离散标记可以普遍地表示多模态信号,并能被深度内化到单一的离散嵌入空间中。LongCat-Next模型的主要贡献在于:

  • 原生全模态设计:提出了一套全新的离散原生自回归范式,将所有模态(文本、视觉、音频)全部转化为统一的离散Token,共享同一个自回归预测目标(NTP)。
  • 高效的模态转换器:引入了dNaViT(离散原生视觉Transformer)和音频tokenizer,实现了图像和语音的高效压缩与重建。
  • 统一语义空间:通过t-SNE可视化分析,证明了LongCat-Next模型将视觉和音频视为以语言为中心的自回归范式的内在扩展,形成了真正的统一语义空间。
  • 优异的模型性能:在图像理解与生成、纯文本处理、语音ASR与TTS等方面,LongCat-Next模型均展现出了卓越的性能。

方法概述

LongCat-Next模型采用了一套全新的离散原生自回归范式,将所有模态数据转化为统一的离散Token序列。这一范式通过分词器-反分词器对,利用LLM(大型语言模型)的现有训练基础设施进行训练,简化了多模态建模的复杂性。

模态转换器设计

  • 视觉转换器(dNaViT):dNaViT是一个在任意分辨率下视觉理解和生成的统一tokenizer。它通过Semantic-and-Aligned Encoder (SAE) + Residual Vector Quantization (RVQ)实现任意分辨率支持,并在保持语义完整的前提下实现高效压缩。
  • 音频tokenizer:音频tokenizer将连续语音转化为离散token,同时保留语义和声学信息。它通过Whisper编码器进行音频特征提取,然后以下采样和RVQ量化的方式生成离散token。

原生多模态训练

LongCat-Next模型的原生多模态训练包括预对齐(Pre-align)、预训练(Pre-train)、中间训练(Mid-training)和监督微调(SFT)等阶段。在训练过程中,美团还提出了V型流水线并行(VHalf-based Pipeline Parallelism)技术,以解决异构模块间跨阶段通信开销大的问题。

实验评估

  • 图像理解与生成:LongCat-Next模型在OCR(光学字符识别)方面表现出色,细粒度内容识别准确。在视觉理解任务中,模型能够精准定位并找到核心点,但对于空间变化和复杂逻辑推理的效果有待提升。在图像生成任务中,模型能够生成大字报和简单图像,但对于复杂指令生成的图像质量有待提高。
  • 纯文本处理:LongCat-Next模型在纯文本处理任务中也展现出了优异的性能,与同等级模型相比毫不逊色。
  • 语音ASR与TTS:在语音ASR和TTS任务中,LongCat-Next模型同样表现出了卓越的性能,准确率和自然度均达到了较高水平。
效果展示

视觉理解


视觉生成