local-deepthink 的另类范式:AI 不需要快,思考才重要
我们总在追求更强的模型,却很少认真思考:是不是换一种思考方式,反而能更聪明地生成答案?
看了一个反直觉的项目,叫 local-deepthink,它基于本地就能部署的小模型构建了一种 慢节奏的多智能体协作的思考系统。
设计思路有点意思,简单聊聊。
1/
当下主流 AI 模型的范式,是中心化的超大规模服务。提个问题,它立刻给你答案,看起来很聪明,但真要让它推理几轮、反思自己、改进策略,它就会变得肤浅、幻觉频出,当然基于大模型的 DeepResearch 也能有效解决这个问题。
回到模型上本身,这类模型最擅长的是预测下一个词,但我们有时候更需要挖掘一个好的思路。
2/
local-deepthink 提出了一种完全不同的范式:它主张把 AI 之间互相协作,用慢思考来换取思维涌现和认知深度,还有个智力民主(作者认为在本地运行其他人的模型可以达到民主)。
这个系统里有一个自创的框架叫 QNN(Qualitative Neural Network),你可以把它理解成一种人工智能社会,里面每个小 Agent 是一个神经元,大家分工合作、互相批判、共同进化。(作者认为QNN这个与简单 Agent 系统不同,通过不断提高标准来学习,但实际上我认为就是一个复杂的多智能体系统,思路非常值得借鉴。)
3/
它的整个流程主要是分三步:
A. 前向传播:把复杂问题分解成若干子问题,分配给不同智能体处理,每一层都对上一层的结果加工重构。
B. 反思传播:系统评估上轮输出、自动生成更难的问题、动态修改智能体提示(prompt),形成一个自我升级回路。
C. 收获传播:把所有过程变成 RAG 知识库,还能在 GUI 里反查每个智能体的决策、最后自动写成报告导出。
有点那个循环演化的 AI 认知系统的味道了。
4/
为什么要强调本地运行?
众所周知,DeepResearch 在长周期的多轮协作和持续反思下,靠大模型的 API 支撑简直是一场的经济灾难。
所以它干脆用 Ollama + Qwen3-3B 模型跑在笔电上,即使是 32GB RAM 的纯 CPU 机器,也能慢慢挖掘思想,生成几个小时甚至几天的深度报告。典型的时间换空间的玩法,我还没有试,对这么小的模型出报告有点存疑。你想想一个 IQ 80 的人思考一辈子能不能得出来狭义相对论。
5/
技术上,这套系统用了 LangGraph + FastAPI + Ollama:用 LangGraph 构建 agent 协作图,用自然语言传递信息形成定性反向传播机制,有意思的是每次迭代不仅改输出,还能修改思考方式本身。
并且所有的反思日志,都可以追踪,这也正是他们通向下一步的关键。
6/
这个项目最野的地方在于它的长期目标:用这些 QNN 日志训练出一个全新的模型 WLM(World Language Model),这个与local 的民主化有点相悖,不知道未来数据从哪里来。
这个 WLM 的目标是自带协作和批判,预期是未来我们可能不再需要写 prompt 来控制模型行为,而是模型自己能根据上下文,动态决定何时该分解思考,何时该生成质疑,何时该写总结。
有点想知道 local-deepthink怎么为 WLM 铺路。
7/
当然,它也有很多未解问题,比如 QNN 在复杂任务下能不能稳定的收敛?大量智能体带来的认知增益和边际回报是否能取得平衡?比如怎么提升反思质量、避免陷入死循环?
8/
不是所有的 AI 都需要快。慢工出细活,那些真正有意义的思考和创新,往往需要一个演化的过程,而不是一击即中。
local-deepthink 值得学习,在多智能体的设计上有很多值得借鉴和学习的地方。
🔗 项目地址:https://github.com/iblameandrew/local-deepthink
💻 推荐配置:MacBook Pro / 32GB RAM / Python 环境