Howie和小能熊

llm 差异比人与人差异还大,如何选择正确的大模型?(2026年2月版)

Image

sonnet 4.6 今天早上发布了:比 opus 4.5 更强大,但价格便宜很多(和 sonnet 4.5 一样)。

Image

anthropic 官网更新了sonnet 4.6 的 benchmark 表格,标记了sota,一张图就能了解当下前沿 llm 的能力格局。

这张图片值得阅读 5678 遍,读完就理解如何在日常任务中选择三家顶级模型了。🤣

  • 底部 4 行benchmark,包括 MMMLU、GPQA,对应传统的文科和理科能力,都是gemini 3 pro 和 gpt 5.2 占据了 sota。

  • 其他的 benchmark 都是 agentic 能力相关,sota 全被 claude 占领了。

因为最近狂用三大 llm,恰逢 sonnet 4.6 发布,就顺手总结一下我目前的模型选择偏好/策略。熟读以下内容 5678 遍,就可以一步选中最适合特定任务的特定模型,帮你减少大量的时间浪费!

模型选择规则(2026.02版)

  • 如果是教育、学习类场景,尤其涉及视觉推理(几何题),首选 gemini 3 pro;它展示了 google 在教育上的多年愿景和投入,是最好的教育/学习大模型;

  • 如果是 agentic 任务,涉及多步骤推理、长上下文推理执行,就首选 claude 和 gpt-5.2。claude 更好,一般任务选 claude sonnet,复杂任务选 claude opus。我昨天一口气处理了 1800 多个知识视频,就是用 opus。

  • 如果是文科任务,涉及语言质量、需要一定的语言品味,优先 opus,其次 gemini 3 pro。gpt 没法用。🤣

  • 信息搜索类,三者都差不多,gpt>gemini > claude。一般我同时用三个 llm 对话,交叉验证,三轮重复,巩固内化。

所有模型使用,搭配 typeless。例如,昨天用的一个 prompt,逻辑不复杂,但信息很多,快 500 字。打字就摩擦更大,typeless 口喷毫不费力,非常愉悦。用来快速搭建 prompt,体验很好。

llm的电脑操作能力

关于sonnet 4.6,我关注到的另一件事:llm在操作电脑这件事上,确实已经接近人类水平了。

Image

OSWorld benchmark,测试的就是 llm 像人类一样操作电脑的能力,例如 office 套件、浏览网页、填写网页表单。

人类的基准水平是72.36%。现在,sonnet 4.6 和opus 4.6 都超过了这条人类线。

仅此一例,可见 llm发展飞速:一年前的今天,最好的模型也就 十几%。距离人类水平“遥不可及”。

ps. gemini 3 pro 没有公布分数。gpt-5.2 是38%。(见下图)

Image

notion ai 已上线 sonnet 4.6

很多人可能还没到愿意给3大前沿llm都开20美金会员的程度。那么,可以通过notion ai来使用sonnet 4.6、opus 4.5。

Image

notion ai 很好用很强大,可以把 notion 作为重要的 ai 基础设施,专门解决 context engineering 问题,来维护你的 personal context。

如果你还没有战略性重视 notion 在 ai 时代的 context  基础设施价值,可以考虑实际体验体验。

我最近连着 3 次直播都是讲基于 notion ai 去搭建 ai 学习系统。可能后面还要讲 3 次专题🤣

就是好用到这个地步。

我的ai学习系统专题

如果你觉得自己的ai实战还没到出神入化的地步,在“跟ai要价值”这件事上还没有做到每年十万百万价值创造的程度,你可以考虑看一下我最近三期的ai专题直播。

Image

考虑到我整个 2026 年应该都聚焦“ai 系统”的实战落地,每期直播 49.9,单买52 期的话价格不便宜,你可以考虑参加我的 ai 社群,哈哈

👇点击“阅读原文”,即可加入~

Image