大模型 Council 评比,GPT-5.2/Gemini 3 Pro 出题,DeepSeek-V3.2/GLM-4.6 等参评
AI 大神卡帕西发布一个趣味编程项目 —— “大模型议会”(LLM Council)。
该项目让多个委员模型互相评分、排序,最终由 Chairman 模型给出一个统一评估答案。他选用了 4 个顶级海外模型作比较,
并得出虽然模型内部自评不一定与人类主观一致,但类似的多模型集成或许将成为一个巨大的可探索空间,甚至可能成为未来 LLM 产品的一个突破点的判断。
本文后面进一步详细介绍,另邀请(改用)四大国产模型 DeepSeek-V3.2, GLM-4.6, Minimax-M2, Kimi-K2-Thinking 作为委员参与评比的结果。
此外,也邀请(改用)Qwen3-235B-A22B 作为 Chairman 模型,并特邀最新的 GPT-5.2 ,次新的 Gemini 3 Pro Preview 及 Baidu AI Search 作为出题提问的嘉宾模型提供评测问题。
一、项目介绍
具体来说,卡帕西的这个 LLM 议会系统,主要可分为三步流程:
Step 1:让多个模型同时回答一个问题
首先使用中间层同时调用多个大模型,如:
GPT-5.1
Gemini 3 Pro Preview
Claude Sonnet 4.5
Grok-4
然后在同一问题下逐个收集它们的回复,并以标签视图的形式展示,以便用户进行检查。
Step 2:所有模型进行匿名互评
这时,每个 LLM 都会收到其他 LLM 的回复。为避免偏袒,对它们的身份都做了匿名化处理。
然后要求模型根据准确性和洞察力对其他模型的回答质量进行评估,需要给出评分和详细理由。
Step 3:Chairman 模型汇总最终回答
LLM 委员会将指定一名 Chairman,将所有模型的回复汇总,并形成一个最终的答案,再转交给用户。
于是通过这个过程,就能直接对比不同模型,在处理同一个问题时的风格差异,而且能够直观地看到模型之间互相评价的过程。
过程说明
该项目将传统的阅读流程重塑为与 LLM 协作的流程,通常阅读一篇文章内容也分为三个阶段:
先人工自己通读一次,获得整体感知和直觉理解。
然后将内容交给大模型处理,让它理解重难点、提取结构、总结内容等。
对文章细节进行深度追问,例如“为什么作者这里会这样写?”
最终就是将写作对象从人类读者转变为 LLM 读者,让 LLM 作为中介理解内容,再个性化翻译给不同的读者听。
令人出乎意料的是,模型几乎很少出现明显的偏见,它们通常会愿意承认自己的答案不如另一个模型好。
二、环境准备
克隆仓库
git clone https://github.com/karpathy/llm-council.git# 先安装uv https://docs.astral.sh/uv/# Backendcd llm-counciluv sync# Frontendcd frontendnpm installcd ..
编辑`backend/config.py` 修改 KEY、参赛模型列表、Chairman、URL
# 修改为七牛云AI大模型API KEYOPENROUTER_API_KEY = "sk-..."# 修改委员模型COUNCIL_MODELS = ["deepseek/deepseek-v3.2-251201","z-ai/glm-4.6","minimax/minimax-m2","moonshotai/kimi-k2-thinking",]# 修改Chairman模型CHAIRMAN_MODEL = "qwen3-235b-a22b-instruct-2507"# 修改API URLOPENROUTER_API_URL = "https://api.qnaigc.com/v1/chat/completions"# 注意也修改下 backend/council.py 中的 "title generation" 以防止归纳对话标题失败,如改为 gpt-oss 模型# query_model("gpt-oss-120b"
启动服务
./start.sh根据提示打开本地网页,如 http://localhost:5173/
三、问题收集
四、评选结果
初步结论
嘉宾模型出题刁钻,特别是逻辑推理型题目,常仅部分模型能作答
Chairman 模型(Qwen3-235B)面对多条难题,虽然部分评测模型已作出回答,Chairman 也常无法履行评估(信息过载?)
DeepSeek-V3.2 答出问题最多,表现第一
Minimax-M2 答出问题数量及表现第二
GLM-4.6 答出问题数量及表现并列第二
注:
以上项目评测问题、过程及结果,仅供娱乐,不作为您在具体业务场景选择模型的参考依据。
Baidu AI Search是指百度搜索AI模式。 Baidu Search API已上架,欢迎体验。
参考链接
https://mp.weixin.qq.com/s/708TeU-5681giZBvqkxHNw
github/karpathy/llm-council
twitter karpathy status
对 GPT-5.2 、Gemini 3 Pro 与 DeepSeek-V3.2 等几大国产顶级模型之间的问答互搏是否意犹未尽?欢迎注册七牛云账号,获取 API 和 Token,自行搭建评测系统。下方扫码添加小助手,第一时间掌握 AI 圈的最新最新动态。
点击「阅读原文」,立即参与活动领取百亿 Token~
朋友们都在看