GitHubDaily

美团终于放大招,LongCat-Next 开源了!

过去两年,多模态模型越来越强大,能看图、能画图、能语音对话。

但把这些模型的底层拆开来看,会发现大部分都是将语言模型作为主干,视觉和语音作为外挂。

各模块之间目标不一致,互相拉扯,整体效果反而上不去。

直到最近,美团龙猫团队给出了不一样的解法,并重磅开源一个原生全模态模型:LongCat-Next。

img

它的思路说起来很直接:把图像、语音也变成跟文字一样的东西,然后用同一套「猜下一个是什么」的逻辑,把三种信号统一处理。

从此看图、生图、对话,对模型来说都是同一件事,带来的提升非常明显,直接看数据。

在文档理解测试当中超过 GPT5-minimal 和 Qwen3-VL,图像文字生成大幅领先 FLUX.1-dev 模型,更在语音推理测试中,拿下第一。

img

看完这些基准测试的得分后,下面我们直接来看几个使用该模型得到的效果。

实际表现如何?

拍张照片,公式全给你整理好

在光线暗淡环境下,拍摄上传一张数学练习题,页面密密麻麻全是数学公式。

LongCat-Next 能逐行扫描还原,输出整洁的文档格式,连复杂的数学公式符号都没漏掉。

img

一句话描述,直接生成国潮 T 恤

输入一段中文描述:国潮风 T 恤,白色正面印一条威风凛凛的中国龙,龙口火焰里藏着「乘风破浪」四个字,红金黑三色搭配。

生成出来的效果,细节还原度相当高,衣服上面的中英文清晰可读。

img

开口就是地方口音,听不出是 AI 生成的

使用 LongCat-Next 生成的语音,这个更有意思。

不仅能生成标准的普通话,还能是地方口音。语气、情感、停顿的节奏,听起来极其拟人化,完全不像机器在念稿子。

究竟是如何实现的?

LongCat-Next 核心其实很简单:把文字、图像、语音都变成同一种「积木块」,再用同一套规则处理。

就像把中文、英文、日文都转成同一套字母,翻译问题直接变成查字典。

对模型来说,一个字、一小块图像、一小段声音,都是同一种东西。

imgLongCat-Next 架构概览,该架构基于DiNA范式设计

大家通常以为,把看图和生图塞进同一个模型,两边会互相拖累。

但实验数据显示,理解损失只多了 0.006,生成损失反而低了 0.02。

原因在于,看图学到的「图像语义」和生图需要的「语义还原」本质上是同一件事的两个方向,放在一起训练反而互相强化。

imgDiNA 框架下的视觉理解与生成交互

最难啃的其实还是图像这一关。

文字天生是一块一块的,语音也早有成熟方案,偏偏图像信息量极大,如果压缩多了会丢细节,不压缩又没法统一处理。

LongCat-Next 先让图像「说人话」。通过海量图文配对训练,模型看到一张图,脑子里浮现的不是像素,而是「这张图在说什么」。

更关键的是,编码器内部的残差结构天然把底层视觉细节一路带到深层,不需要任何额外的像素级训练,理解和重建就能同时做好。

得益于此,一个同时处理三种模态的模型,在纯视觉测试里反而压过了专门做视觉的模型。

在文档理解测试 OmniDocBench-EN 中得分 0.152,超过 Qwen3-VL(0.183)。

img离散原生分辨率视觉 Transformer(dNaViT)设计概览

再完成压缩闭环。

团队首创了一套图像版「分词器」,把一张图拆成一系列有意义的「视觉小块」。

原尺寸处理不缩放不裁剪,分 8 层逐级压缩,得益于整体架构设计,压缩比高达 28 倍,还原时先稳住布局再补纹理。

图片文字渲染测试 LongText-EN 得分 93.15,专门做文生图的 FLUX.1-dev 只有 60.7。

imgdNaViT 的分词器与解分词器训练流程

语音部分如出一辙。

提取声音特征后同样分层压缩,语义内容和声学特征同时保留。

语音合成测试 SeedTTS 中文错误率低至 1.90,语音推理测试 ReasoningQA 得分 87.52 全场第一,还支持实时边说边出和先想好再说两种生成模式。

img音频从输入到离散 Token 的完整处理流程

文字、图像、语音,三条线全部收进同一套框架,这套看似简单的统一,正是 LongCat-Next 与其他多模态模型最根本的不同。

写在最后

在我看来,多模态的下一个战场,可能不是「能不能做到」,而是「底座够不够统一」。

看一张图、说一句话、读一段文字,今天这三件事在大多数模型里还是分开处理的。

但当把它们原生融合到模型的底座里,如今很多产品都可能被重新做一遍。

这不只是架构上的改变,更重要的是,语言模型那套已经跑通的训练方法和优化经验,从此也能用在图像和语音上。

迈向底座统一这条路,不只美团一家在走,但能在工业级规模上把离散原生多模态真正跑通的,目前还不多。

今天,美团算是提前迈出了这一步。

  • GitHub:https://github.com/meituan-longcat/LongCat-Next

  • 模型下载:https://huggingface.co/meituan-longcat/LongCat-Next

今天的分享到此结束,感谢大家抽空阅读,我们下期再见,Respect!