Grok 4实测:马斯克这次AI真干了硬活,性能直接爆了!
这次要聊的主角是马斯克家的 Grok 4,说实话,我原本是抱着“看看热闹”的心态点开直播的,结果看完后,我只能说:这个真的爆了!
这不止是马斯克嘴硬说“世界上最聪明的AI”,而是真干了点硬活,尤其是开发者关心的“代码能力”和“推理能力”,简直是奔着SOTA去的。
下面来看看,我是怎么理解这个Grok 4到底强在哪,它跟GPT-4、Claude、Gemini这些大佬们的正面对比,又有啥看头。
1)开场就猛:Humanity's Last Exam 直接封神!
这个“人类最后的考试”(Humanity’s Last Exam,简称HLE)说白了就是一场极限拉扯,主打“跨学科PhD水平”的综合测试。
Grok 4拿下了 **45%,比 Gemini 2.5 Pro 的 21% 高一倍多!这啥概念?在这种考试里,Claude 4 Opus都没到40%**,Grok 4几乎把现有所有SOTA都拍了一遍。
当然,这个分数后面也有争议,说不清是不是调了题,但光就这个数字,已经是目前已知最高分了,不管你服不服,性能是实打实放在那儿的。
2)两个版本,开发者专属的 Grok 4 Code 真香!
Grok 4 一共出了两个版本:
通用版 Grok 4:偏向写作、翻译、日常办公,用起来跟 GPT-4 类似,但支持函数调用、结构化输出、逻辑推理,属于“思路清晰+信息准确”的类型。 程序员专属的 Grok 4 Code:这个是我重点关注的。代码生成、调试、构建应用、文档生成、上下文保持,功能简直像是集成了 VSCode Copilot + Notion AI + Replit Ghostwriter。
官方数据也不客气,直接说自己编程能力已经并列世界第一,在 SWE-bench 上打平 Claude,逻辑准确率和结构推理能力全面碾压 GPT-4。
更离谱的是:内置代码解释器 + 函数调用 + JSON结构输出 + 多模态识图解释 + 即将开放的图像/视频生成接口!
这一整套下来,你说这不爆谁爆?
3)思考能力新范式:“第一性原理”推理真不是吹的
Grok 4提出了个新概念:First Principles Reasoning(第一性原理推理)
我一开始还以为是个营销术语,结果实际用下来,发现这货在多步骤逻辑题、数理推理题里的表现比 GPT-4 强多了。
比如你问它一道复杂的函数链嵌套逻辑题,它不但能答对,而且中间的推理过程写得特别完整清晰,感觉就像真的是个 PhD 物理出身的人在一步一步拆解。
以前GPT-4经常“跳步骤”或“瞎扯结论”,Grok 4明显有在规避这问题,从结构化推理角度已经有质变。
4)多模态能力:目前是“文本+图像解释”,未来一锅端!
虽然现在还不支持图像生成和视频生成,但从路线图上看,几个月内将加入图像生成+视频生成+语音生成。
目前版本已经可以做到:
支持文本到文本 支持图片上传并进行描述和修改 支持函数调用+结构化输出
比如你给它一张复杂的图表,它能解析出你要的数据趋势。这个功能在金融、医疗、科研这些场景真的太实用了。
而且未来将拓展到视频编辑、语音唱歌、ASMR互动... 还给你整了个会唱歌的Eve虚拟助手,这...是不是有点走偏了?不过技术上真的有点牛!
5)性能对比:各大模型挨个爆踩
来看几个关键对比数据:
| Grok 4 | 45% | 88% | 73 | ||
而且速度也不差,75 token/s 虽然不如 o3 的188,但比 Claude Opus 的66快多了。
性能、准确率、推理能力、工具链支持、价格都处在第一梯队,在一些场景甚至优于GPT-4、Claude 4!
6)价格怎么说?依然不便宜
Grok 4 的定价和 Grok 3 一致:
15 每百万输入/输出 tokens 对标 Claude 4 Sonnet,略高于 Gemini 和 o3
同时推出了一个“SuperGrok Heavy”订阅计划,月费 $300,给你 Grok 4 Heavy 工具增强版的访问权限。
说实话,这个价位确实高,但对于公司或重度用户来说,性能值那个价。
7)争议点也有,但目前瑕不掩瑜
当然也不是没有问题:
HLE 45%这个分数到底怎么测的?外界说法不一,有人怀疑是工具加成或者题库问题。 Grok 3曾经“翻车”过,所以很多人对Grok 4持观望态度。 多模态功能目前还没全部开放,有点“PPT先行”的味道。
但话说回来,大模型发展到今天,谁没有争议?关键是要看产品线的持续演进和开发者社区的活跃度。
特别是程序员朋友们,Grok 4 Code这个版本强烈推荐!
有问题欢迎交流,我们下篇再见~
-END-
我为大家打造了一份RPA教程,完全免费:https://www.songshuhezi.com/rpa.html