极低的训练成本,7B的小身材,换来的却是能力的绝杀,而且是理解、生成双杀。从基准测试来看,Janus-Pro-7B的表现令人印象深刻。在多模态理解基准MMBench上,它获得了79.2分的成绩,超越了此前的最佳水平,包括Janus(69.4分)、TokenFlow(68.9分)和MetaMorph(75.2分)。在图像生成评测上,Janus-Pro-7B在GenEval基准测试中达到0.80分,大幅领先于DALL-E 3(0.67分)和Stable Diffusion 3 Medium(0.74分)。从实际使用上看,DeepSeek的Janus-Pro多模态理解和图像生成能力确实可圈可点。在多模态理解方面,论文展示了三个范例,首先是地标识别能力。模型能准确识别杭州西湖的三潭印月景区,不仅能描述眼前的景象,还能理解其深层的文化内涵和历史意义。其次是文本理解能力。面对一块写有"Serving Soul since Twenty Twelve"的黑板,模型不仅准确识别了主要文字,还注意到了周边的细节信息。第三是上下文理解能力。在解读Tom and Jerry主题蛋糕时,模型展现出对动画角色设定、造型特点的深入理解,并能准确描述蛋糕上的设计元素。而在图像生成方面,模型展示了八个不同场景的生成效果,涵盖了现实与想象两个维度。这些生成案例虽然输出分辨率仅为384×384,但每一幅画面都展现出细致的细节和准确的语义理解。
大一统模型的范式转变
Deep Seek的Janus-Pro-7B通过这些测试数据首次证明了"理解"和"生成"这两个分离的任务可以在一个统一框架下达到各自的最优状态。有趣的是,虽然传统统一模型声称受人脑启发,但却忽视了人脑最基本的解剖学特性 - 功能分区与整合的辩证关系。在漫长的进化历程中,人脑形成了高度专业化的左右半球分工。左脑主导语言处理、逻辑分析和序列思维,右脑则专注于空间感知、艺术创造和整体认知。这种分工并非简单的功能隔离,而是通过胼胝体这一关键结构实现信息的深度整合,最终形成统一而完整的认知体验。在此背景下,Janus Pro的架构设计仿佛就是在向人脑学习。其图像理解编码器专注于语义理解和特征提取,类似于左脑的分析功能;图像生成编码器负责创造性的图像生成,映射了右脑的艺术创造能力;而Transformer则扮演了类似胼胝体的角色,将两路信息进行深度统合。更加相信胼胝体,相信Transformer的统合力,也许才是大一统模型进一步发展的关键思路。推荐阅读