MacTalk

那个能打的百度,今天回来了。

刚刚,百度发布了最新一代模型:文心大模型 4.5 和 X1。其中 4.5 是基础大模型,X1 是深度思考大模型。
X1 具备更强的理解、规划、反思、进化能力,并且支持多模态,还能够自主调用工具。文心 4.5 通过多个模态联合建模,实现了更强的多模态能力,并且在去幻觉、逻辑推理、代码等方面能力显著提升。
说实话,我期待百度的这代模型已久,原本以为这个月只会发布 4.5,没想到深度思考模型 X1 也顺带一起来了。
今年 DeepSeek R1 发布之后,很多人说怎么国内的 AI 翘楚百度慢了。我写过一篇文章讲过自己的想法,现在我们正处在一个大模型快速发展的时代,场上的选手你追我赶,其实没有谁能够一直保持领先的态势。
就像前两天 Anthropic 的 CPO 说的那样:“新的模型在不断地发布,大家都可能会经历领先-落后-又领先的循环。”确实是这样的规律。我们需要理解这种新的常态,别把阶段性的成果当成终局。
此刻,百度发布的基础大模型文心 4.5 和深度思考模型 X1,无论从我的具体测试效果来看,还是基于 Benchmark 的客观数据看,它们都已经成为行业内最好的中文大模型。并且,C 端用户可以免费使用。API 调用的价格也只有 R1 的一半。
图片
这又是一次行业的里程碑。
文心 4.5 是基础模型,最近好像大家说推理模型比较多,但其实,基础模型能力不过关的话,好的推理模型就是无稽之谈。从这个角度,我们也能够理解为什么百度这次同步发布了新一代的基础模型和推理模型。
文心 4.5 是一个原生的多模态基础大模型。多模态我们现在听得比较多,但从技术上看,很多产品都是通过拼接多个模型的方式实现了多模态能力,相当于每个模态都有一个模型,最终工程上再做整合。GPT-4 就是这种方式,效果马马虎虎。
后来 GPT-4o 发布,你记得吧,当时大家对它的多模态能力给出了很高的评价。而 GPT-4o 就是一个原生的多模型基础大模型,Gemini 2.0 也是。原生多模态大模型指的是在一个模型之内,完成对不同模态内容的统一。就像我们人一样,听说读写,本身就是一体多面的能力。
文心 X1 则是一款能力更全面的深度思考模型,虽然文心 4.5 的能力已经非常惊艳,但我测试下来,感觉 X1 在复杂图片理解及推理任务上效果还会更好,并且,X1 的文笔也非常不错。
百度的大模型我一直在用。年前我曾写过一篇文章,聊到了他们的 RAG 技术。如果研究大模型的话,你会知道 RAG 是个基本功,百度在这块有相当深厚的积累,自研了一套兼顾搜索和大模型的增强检索系统,以此来降低大模型的幻觉。
事实上,百度大模型的优势之一是幻觉很少。这次发布的 4.5 和 X1 更是如此。我曾经测评行业的几款大模型,问他们董宇辉目前的粉丝数。其他几款模型都直接引用了另外一篇老旧文章中的数据,而文心则是去董宇辉的抖音页面拿了最新的数据。
我们直接上测评吧,今天我话太多了。
上周一,我曾经发过一篇 Notion 创始人的访谈。那篇文章我是用 DeepSeek R1 翻译的。刚刚我扔进去同样的段落和提示词,发现文心 X1 的表现更好。DeepSeek R1 翻译文章时,有个毛病,总喜欢大范围地修改表达,哪怕我指令里明确说了原汁原味的翻译,它也不听。所以,那天有用户猜测我是用 DeepSeek 翻译的,因为语言风格太像了。
下面是文心 X1 的翻译,我认为这个会更符合预期的效果。你要是感兴趣,可以去我 Notion 那篇文章中找下对应的段落对比看看。
Image
如果翻译看不出来,我们继续看看文字续写。我仍然对比下 DeepSeek R1。下面是除夕那天时,我让 DeepSeek R1 续写的话,你感受下:
Image
咱们继续试试文心 X1,看看它的结果。为了保持测评的准确性,我同样让 X1 也生成了两次。你可以看到,X1 续写的会更有场景感一些。说明下,文字的东西,很难直接区分出来好坏,只是我个人此刻觉得,X1 更符合我的续写预期。我不喜欢流光溢彩般的描述,感觉太花里胡哨了。X1 的续写刚刚好。
Image
还有,我发现 X1 的输入框中,多了一个“调用工具”的入口。其他的推理模型,下方只有“联网搜索”的选项。那调用工具是什么意思?我做个尝试啊。刚刚,我在朋友圈,看到朋友发的一张桃花盛开的照片,然后请 X1 理解图片之后,给我写个朋友圈文案:
Image
下面是它的思考过程,我用红框圈了出来。有几个亮点,第一,它调用了图片理解工具来识别图片内容,并根据我的意图,做了详细的步骤规划。第二,它居然还知道要确保文风符合朋友圈的社交语境,所以文字应该亲切自然。
Image
下面是最终的生成结果。尤其是第二段,我特别喜欢。
Image
查了下官方的解释,多工具调用是文心 X1 的特色之一。目前,上线的工具包括高级搜索、文档问答、图片理解、AI绘图、代码解释器、网页链接读取、TreeMind 树图、百度学术检索、商业信息查询、加盟信息查询。
但有意思的是,我并不需要选择具体的工具。也就是说,百度已经做到了可以根据用户的指令,智能地选择对应的工具。我继续尝试下。同样,还是前面除夕的案例,我的提示词是:“此刻,屋内其乐融融,屋外烟花....帮我续写下这句话,并生成一张对应的图片”。咱们看看 X1 能否调用相关的工具:
Image
看到了吧?是不是特别惊喜。X1 拆分了任务,并且主动找到了 AI 绘图工具,帮我画了一张中式四合院的场景图片。
Image
前面我提到,百度这次发布的两个模型,都在多模态方面有很强的能力。我继续上难度,给它扔一张几年前我去罗马尼亚时随手拍的照片,看看它能找到这是哪里不。
如下图,我没有截取完整,你可以看到,X1 可以对我照片中的建筑进行详细分析。虽然最后没有具体定位到罗马尼亚,但整体已经定位出来大概的区域了。
Image
接下来,再上一个大招。日常生活中,我们经常会在社交媒体上看到一张截图,却不知道它源于哪部电影。之前,我的方法是去评论区问,现在,彻底不需要了。我刚刚截了一张电影的剧情图片,然后问 X1,请它告诉我来源。下面你能看到,文心准确地给出了判断。
Image
刚刚,我同事小盖兴奋地在群里说出了他的感受。
Image
是的,那个能打的百度回来了。还记得两年前的 3 月 16 日,百度正式发布文心一言,那时,百度是上市公司中第一个推出类 ChatGPT 应用的公司。
今天,它再次为行业带来了更强大、更便宜的新一代模型。现在提前免费了,很快还会开源。我不想用大词来定义这次的文心 4.5 和 X1,意义不大。模型这东西,目前我们都能够直接感知到,好就是好,不好就是不好,测试几个场景就能看出门道。
至少文心 X1 在此刻彻底打动了我。几天前,Google 开放 Gemini 2.0 Flash 的原生图像生成能力,赢得了不少夸赞。
今天,又是百度的鲜花着锦时刻,我看到大周末的朋友圈里很多人在转发。百度和谷歌都是老牌的技术公司,接下来,或许要轮到他们表演了。搜索公司在这块的积累,蛮多的。

不过,对于我们这样的应用团队而言,看到好的模型发布,最先应该想到的是:怎么依托更强的模型能力,做出来用户需要的好应用。