Howie和小能熊

根本不存在“最强AI”:把3个顶级LLM组成内阁,你只负责当王。

短短半年前(gemini 2.5 pro 和sonnet 4.5发布前),如果你问“用哪个 ai 好”(除coding 场景外的普通 ai 用户),那答案非常简单:

chatgpt 断崖式领先,

如果你不是专门研究 llm 的,而且时间和金钱不是无限的话,

只用 chatgpt 就够了。

但现在,llm行业格局完全变了。

2025年之前,llm 领域是 OpenAI 断崖式领先,“按着各家打”,基本不需要用 chatgpt 以外的 AI。

Image

2025年,llm 进入了我称之为“llm 大分化”的阶段:不存在某个在各种任务类型上都全面领先的“顶级 ai”,不存在“六边形全能战士”,而是顶级 llm 们各有所长,能力配置上“犬牙交错、参差不齐”(jagged)。

对于个人ai 用户来说,结论很简单:

我们进入了一个“多模型阶段”。我们的llm 使用方式也需要跟着进步。

karpathy的“llm议会”

Image

上周六,Karpathy 做了一个“周末玩票式”项目:把多个前沿大模型(专家 llm)拉到一个“议会”里,让它们先各自回答,再互评打分,最后由“主席llm”综合输出。

Image

我之前多次分享、强力推荐大家采纳“llm 三人行”/“llm 专家团”这种 llm 使用范式,而现在,karpathy 的“LLM 议会”,把全人工流程的“llm 专家团”提升到了另一个高度!

结合我的测试实例“身无分文,如何年入百万?”,具体看一下 LLM 议会的流程和制度:

第一步 多个“专家 LLM”分别答题(Initial Answers)|用户提问后,请多个模型各自独立回答。karpathy 默认的选择是这 4 个 llm:GPT-5.1、Gemini 3 Pro、Claude Sonnet 4.5、Grok 4。

分别答题,用多 tab 并列展示
分别答题,用多 tab 并列展示

第二步 匿名打分和排名(Review & Ranking)|每个模型都能看到其他模型的答案,但答案被匿名处理,按照人类学术团体的 peer review 形式进行盲审盲评,每个专家 llm 按准确性和洞察力两个维度给其他所有回答分别打分和排序。

分别评审
分别评审
按评分排序
按评分排序

第三步 主席 LLM 总结发言(Chairman Synthesis)| 最后,“议会主席”(gemini 3.0 pro)会拿到所有专家 llm 的回答和打分结果,进行最后的综合,输出最终分析结果。

Image

karpathy 在周末玩票 vibe coding 出来的这个 app 很好,只要配置一个 openrouter key 就可以立刻跑起来,用过github 和terminal 的话,大概花 5 分钟就可以。而且,现在有atlas 浏览器了,指哪打哪,没有任何认知门槛。

文科生也好,小孩也罢,识字就会
文科生也好,小孩也罢,识字就会

美中不足的是:太费钱了。这几个llm 会员我都有啊,完全可以有一个chrome extension,用会员的额度来做这件事,而不要单独用 api 烧钱!🤣

howie 的 “llm专家团”

在早上测试karpathy的这个app之前,我自己已经实践了100多天的“llm专家团”。多llm并行使用,这个idea很简单,但是推广普及主要归功于nvidia老板、地球首富黄仁勋。

我的最佳实践是:使用arc 浏览器的分屏视图(split view),把 3大前沿 LLM(gpt-5.1、gemini 3.0 pro 和 sonnet 4.5)(gpt-5.1 有事同时使用 chat 和 thinking 两个模型)并排展示,并行使用。

llm 专家团实例
llm 专家团实例

看了下我的logseq,发现我自己是从今年8月5号开始一直重度实践“llm 专家团”这种用法的。

Image

相对于 karpathy 的 llm 自动评审方案,我的第二和第三步是自己人脑执行的:不是让llm 来评价和综合其他 llm 的回答,而是用自己的脑子来阅读、评价、判断和综合。

在上面的测试案例中,我自己的判断是gemini 3.0 pro 的回答更好(依据是作为思想实验的启发性)。而ai 的判断是 gpt-5.1 更好(更多聚焦于问题本身)。

100天重度实践“llm 专家团”后,我对当前 llm的 主观评价:

gemini 3.0 pro > gpt-5.1 > claude sonnet 4.5 > grok 4.1

karpathy 的主观评价也是如此:gpt-5.1 很好,但 gemini 3.0 pro 更好;claude 过于简洁,grok 和 claude 争倒数第一!🤣

在 gemini 3.0 之前,gemini 2.5 pro 则介于 gpt 和 claude 之前。但 gemini 3.0 提升真的太大!

llm使用新范式

ai工具不是另一个工具,ai不是抖音。

使用ai,一方面要花钱(没有人愿意雇佣学渣给自己当外脑吧?),更重要的是ai对使用者的注意力和认知能力要求较高。

真正能挖掘出ai红利的人,需要对 ai 有深入的观察和认识。反正,我明确表达一个观点:

因为 llm 能力大分化,ChatGPT 不再断层式领先,所以推荐使用 “llm 专家团”这个 ai 使用新范式。

2025年末的脑力劳动者,不需要单打独斗,而是可以和多个顶级 llm 协作,进入一种“集体智能”的新阶段。

one more thing

这些主题,在我的ai主题讲座里几个月前就有更详细更深入的讨论和分析。加入我的ai社群,更早、更快、更好地用ai!

Image

核心价值:ai 主题讲座

Image

定期直播 一般为周四/五晚8-10点,一年内在26-52次之间(=至少两周直播一场,争取每周交流分享一次);

专题直播 每次2小时,讲透一个专题: 主打“知无不言言无不尽”,把howie的ai洞察、实践、经验无保留完全交付!

直播类型

  • 专题讲座类:ai新工具,或ai时代的学习方法/知识管理/写作/阅读等;
  • 总结回顾类:月度/季度/年度ai总结;
  • 答疑连麦类:定期开答疑、连麦专场;

🎁 社群权益

Image
  • prompt 资料库:howie 自己使用的prompt等ai资料,通过资料库分享给社群成员!
Image
  • ai 知识库:社群成员可无限期回看ai讲座(非社群成员48小时内回看),独享ai讲座文字稿全文 + ai知识库,让ai化身howie分身来回答你的任何ai问题;

  • 社群成员专属微信群:和howie在群里直接聊ai;

  • 圈子小程序(AI学习圈),可以直接向howie 一对一提问,有问必答。

我的“做中学·ai社群”首次招募,物美价廉,物超所值。何时加入?就在今天!👉

3人拼团,只需365;

Image

还额外赠送定价129元、豆瓣打分9.3分的《内驱式学习》作者签名版 1本!数量有限,先到先得!

Image

点击“阅读原文”,直达社群。