xAI 正式发布 Grok 4.1,目前最具情感智能的模型
马斯克那边的 xAI 又丢出来一个新版本——Grok 4.1。
我当时还愣了半秒,心想:啊?这家伙不是前阵子还被人吐槽幻觉多得离谱吗?怎么突然就说自己“显著降低幻觉”了?
然后我继续往下看,哎越看越觉得有点戏剧性。
Grok 4.1 这次不是一个版本,是两个:Grok 4.1 和 Grok 4.1 Thinking。名字一看就知道,Thinking 这个是那种…怎么说呢…慢慢想、慢慢憋、能推理半天的那个。
就像是你跟朋友聊天,普通版 Grok 是那种“你问我答”,Thinking 就像突然切换成“让我想三秒…嗯…如果从概率上考虑……”那种模式。
最离谱的是,俩版本都免费用。看到这里我真的忍不住笑出来——马斯克这人真有意思,免费吧又搞个 SuperGrok,让你觉得“免费已经不错,但付费更爽”。典型商人心理拿捏得死死的。
但重点不是这个,是他们去参加了 LMArena 的 Text Arena 测试。这个测试是开源的,也不能说绝对权威吧,但至少比较公平。结果一看——Grok 4.1 Thinking 直接冲第一,1510 分;普通 Grok 4.1 第二,1437 分。后面才是 Gemini 2.5 Pro、Claude Sonnet 4.5。
我看到这儿的时候,心里的 OS 真的就一句:“马斯克你是不是偷偷憋大招了?”
不过你也知道,模型这种东西吧,测试归测试,真实体验归真实体验。有时候排行榜排得天花乱坠,结果你聊天一问,它还是照样胡说八道,还说得一本正经。所以我当时也没敢立刻激情“封神”,但是心里确实好奇了一下:嘿,这次不会真整好了吧?
然后我看到最后一段,说现在如果你用 X(也就是以前的推特),点进去切换一下,就能用 Grok 4.1 Beta,限时免费那种。有配额,但日常聊天足够用了。我那一下子就有点心痒痒的,想着要不回头试试?
不过我又突然想到,现在所有 AI 公司都在疯狂卷“降低幻觉”。以前卷什么?卷写诗卷数学卷答题卷生成速度。现在倒好,集体开始卷“别胡说八道”。你看 OpenAI 最近发论文说幻觉的根源是什么,Anthropic 那边也疯狂优化推理链条,谷歌 Gemini 也天天更新逻辑能力…现在再加上 Grok 搞一个“显著降低幻觉”,整个行业像在说:我们卷了这么久,终于卷回正题了。
想想其实也挺好笑的——智能越强,大家越担心它乱说话,现在把主要精力都花在“让它别瞎说”上。
但不管怎样,我还是挺期待 Grok 4.1 的真实表现的。尤其是 Thinking 版本,感觉像那种你问它一个问题,它要在那里“嗯…让我想想…”然后给你一个扎实回答的那种。我最怕的就是它又突然给我来一段什么马斯克式脑洞,比如你问它天气,它突然给你扯到殖民火星,哈哈哈。
我现在还在纠结要不要把主力从 Claude 或 Qwen 换过去,你要是试了 Grok 4.1 一定要跟我说说感觉,不然我怕我用几天又被整破防。
你觉得这次 Grok 是真升级了,还是又一波营销?我现在…半信半疑的那种。
-END-
我为大家打造了一份RPA教程,完全免费:songshuhezi.com/rpa.html