七牛云

大模型 Council 评比,GPT-5.2/Gemini 3 Pro 出题,DeepSeek-V3.2/GLM-4.6 等参评

AI 大神卡帕西发布一个趣味编程项目 —— “大模型议会”(LLM Council)。

Image

该项目让多个委员模型互相评分、排序,最终由 Chairman 模型给出一个统一评估答案。他选用了 4 个顶级海外模型作比较,

并得出虽然模型内部自评不一定与人类主观一致,但类似的多模型集成或许将成为一个巨大的可探索空间,甚至可能成为未来 LLM 产品的一个突破点的判断。

本文后面进一步详细介绍,另邀请(改用)四大国产模型 DeepSeek-V3.2, GLM-4.6, Minimax-M2, Kimi-K2-Thinking 作为委员参与评比的结果。

此外,也邀请(改用)Qwen3-235B-A22B 作为 Chairman 模型,并特邀最新的 GPT-5.2 ,次新的 Gemini 3 Pro Preview 及 Baidu AI Search 作为出题提问的嘉宾模型提供评测问题。

一、项目介绍

具体来说,卡帕西的这个 LLM 议会系统,主要可分为三步流程:

Step 1:让多个模型同时回答一个问题

首先使用中间层同时调用多个大模型,如:

  • GPT-5.1

  • Gemini 3 Pro Preview

  • Claude Sonnet 4.5

  • Grok-4

然后在同一问题下逐个收集它们的回复,并以标签视图的形式展示,以便用户进行检查。

Step 2:所有模型进行匿名互评

这时,每个 LLM 都会收到其他 LLM 的回复。为避免偏袒,对它们的身份都做了匿名化处理。

然后要求模型根据准确性和洞察力对其他模型的回答质量进行评估,需要给出评分和详细理由。

Step 3:Chairman 模型汇总最终回答

LLM 委员会将指定一名 Chairman,将所有模型的回复汇总,并形成一个最终的答案,再转交给用户。

于是通过这个过程,就能直接对比不同模型,在处理同一个问题时的风格差异,而且能够直观地看到模型之间互相评价的过程。

过程说明

该项目将传统的阅读流程重塑为与 LLM 协作的流程,通常阅读一篇文章内容也分为三个阶段:

  1. 先人工自己通读一次,获得整体感知和直觉理解。

  2. 然后将内容交给大模型处理,让它理解重难点、提取结构、总结内容等。

  3. 对文章细节进行深度追问,例如“为什么作者这里会这样写?”

最终就是将写作对象从人类读者转变为 LLM 读者,让 LLM 作为中介理解内容,再个性化翻译给不同的读者听。

令人出乎意料的是,模型几乎很少出现明显的偏见,它们通常会愿意承认自己的答案不如另一个模型好。

二、环境准备

克隆仓库

git clone https://github.com/karpathy/llm-council.git# 先安装uv https://docs.astral.sh/uv/# Backendcd llm-counciluv sync # Frontendcd frontendnpm installcd ..

编辑`backend/config.py` 修改 KEY、参赛模型列表、Chairman、URL

# 修改为七牛云AI大模型API KEYOPENROUTER_API_KEY = "sk-..."# 修改委员模型COUNCIL_MODELS = [    "deepseek/deepseek-v3.2-251201",    "z-ai/glm-4.6",    "minimax/minimax-m2",    "moonshotai/kimi-k2-thinking",]# 修改Chairman模型CHAIRMAN_MODEL = "qwen3-235b-a22b-instruct-2507"# 修改API URLOPENROUTER_API_URL = "https://api.qnaigc.com/v1/chat/completions"# 注意也修改下 backend/council.py 中的 "title generation" 以防止归纳对话标题失败,如改为 gpt-oss 模型# query_model("gpt-oss-120b"

启动服务

./start.sh

根据提示打开本地网页,如 http://localhost:5173/

三、问题收集

Image

四、评选结果

初步结论

  • 嘉宾模型出题刁钻,特别是逻辑推理型题目,常仅部分模型能作答

  • Chairman 模型(Qwen3-235B)面对多条难题,虽然部分评测模型已作出回答,Chairman 也常无法履行评估(信息过载?)

  • DeepSeek-V3.2 答出问题最多,表现第一

  • Minimax-M2 答出问题数量及表现第二

  • GLM-4.6 答出问题数量及表现并列第二

注: 

  • 以上项目评测问题、过程及结果,仅供娱乐,不作为您在具体业务场景选择模型的参考依据。

  • Baidu AI Search是指百度搜索AI模式。 Baidu Search API已上架,欢迎体验。

Image

参考链接

  • https://mp.weixin.qq.com/s/708TeU-5681giZBvqkxHNw

  • github/karpathy/llm-council

  • twitter karpathy status

对 GPT-5.2 、Gemini 3 Pro 与 DeepSeek-V3.2 等几大国产顶级模型之间的问答互搏是否意犹未尽?欢迎注册七牛云账号,获取 API 和 Token,自行搭建评测系统。下方扫码添加小助手,第一时间掌握 AI 圈的最新最新动态。

Image

点击「阅读原文」,立即参与活动领取百亿 Token~


朋友们都在看

图片

【七牛动态】七牛云上新DeepSeek-V3.2…

【七牛动态】视频剪辑Agent助力电商爆单…

【七牛动态】Code New Era 圆桌论坛…