文心5.0:百度这次真憋了个全模态大招。。。
今天刷到一个事,有点意思:沉寂了好一阵子的百度,今天在百度世界大会上放了个大招——文心5.0(EB5)。
先上干货。官方这次把总参数堆到 2.4 万亿,用的是超稀疏 MoE 架构,一次只激活不到 3% 的专家。更关键的是,它从训练第一天起,就把文本、图像、音频、视频扔进同一套自回归架构里,做原生全模态统一建模,而不是那种“各模态先各练各的,最后再拼盘”。
体验上最直观的,是视频理解这块。以前很多模型看视频,本质上是在“看字幕”,画面只当背景板;文心5.0 会看镜头里谁在动、表情怎么样、音乐在哪儿开始变紧张,再综合台词给你写一段类剪辑师的分析。让它找“这段视频最紧张的 10 秒”,它能直接标出从第几秒到第几秒;再给它一段单独的 BGM,它还能说出这段音乐有没有被用在视频里。
公开数据里,文心5.0 在四十多项测试中,对标 Gemini-2.5-Pro、GPT-5-High 这些模型,多模态理解、创意写作、智能体规划这些方向都能打成互有胜负那种水平。 再叠加 2.4 万亿这个规模,说一句“回到牌桌中心”不过分。国内这边,阿里有 1 万亿的 Qwen3-Max,DeepSeek 把推理玩成了国民级话题,现在百度扔出一个原生全模态的文心5.0,大模型大战已经从“谁会写文案”,卷到“谁更懂现实世界本来就是图文声像搅在一起的”。
但我更关心的是,普通人能从这代模型里捞到什么实惠。想象一个场景:短视频博主把整条素材扔给它,让文心5.0 自动找高能片段、写标题、配封面;做运营的直接给它一段直播回放,让它剪一个 30 秒、适合小红书的版本,理论上它都能一条链路走完,而不是在好几个工具之间来回倒腾。
至于文心5.0 能不能帮百度打一场翻身仗,我也不好说。大模型这事,现在从“堆参数”进入“拼落地”的阶段了:谁能把原生全模态做成人人都用得上的剪辑师、策划、助教,谁才有机会笑到最后。剩下的,就交给时间和用户的吐槽吧。
-END-
我为大家打造了一份RPA教程,完全免费:songshuhezi.com/rpa.html