凡人小北

local-deepthink 的另类范式:AI 不需要快,思考才重要

我们总在追求更强的模型,却很少认真思考:是不是换一种思考方式,反而能更聪明地生成答案?

看了一个反直觉的项目,叫 local-deepthink,它基于本地就能部署的小模型构建了一种 慢节奏的多智能体协作的思考系统。

设计思路有点意思,简单聊聊。

1/

当下主流 AI 模型的范式,是中心化的超大规模服务。提个问题,它立刻给你答案,看起来很聪明,但真要让它推理几轮、反思自己、改进策略,它就会变得肤浅、幻觉频出,当然基于大模型的 DeepResearch 也能有效解决这个问题。

回到模型上本身,这类模型最擅长的是预测下一个词,但我们有时候更需要挖掘一个好的思路。

2/

local-deepthink 提出了一种完全不同的范式:它主张把 AI 之间互相协作,用慢思考来换取思维涌现和认知深度,还有个智力民主(作者认为在本地运行其他人的模型可以达到民主)。

这个系统里有一个自创的框架叫 QNN(Qualitative Neural Network),你可以把它理解成一种人工智能社会,里面每个小 Agent 是一个神经元,大家分工合作、互相批判、共同进化。(作者认为QNN这个与简单 Agent 系统不同,通过不断提高标准来学习,但实际上我认为就是一个复杂的多智能体系统,思路非常值得借鉴。)

3/

它的整个流程主要是分三步:

A. 前向传播:把复杂问题分解成若干子问题,分配给不同智能体处理,每一层都对上一层的结果加工重构。

B. 反思传播:系统评估上轮输出、自动生成更难的问题、动态修改智能体提示(prompt),形成一个自我升级回路。

C. 收获传播:把所有过程变成 RAG 知识库,还能在 GUI 里反查每个智能体的决策、最后自动写成报告导出。

有点那个循环演化的 AI 认知系统的味道了。

4/

为什么要强调本地运行?

众所周知,DeepResearch 在长周期的多轮协作和持续反思下,靠大模型的 API 支撑简直是一场的经济灾难。

所以它干脆用 Ollama + Qwen3-3B 模型跑在笔电上,即使是 32GB RAM 的纯 CPU 机器,也能慢慢挖掘思想,生成几个小时甚至几天的深度报告。典型的时间换空间的玩法,我还没有试,对这么小的模型出报告有点存疑。你想想一个 IQ 80 的人思考一辈子能不能得出来狭义相对论。

5/

技术上,这套系统用了 LangGraph + FastAPI + Ollama:用 LangGraph 构建 agent 协作图,用自然语言传递信息形成定性反向传播机制,有意思的是每次迭代不仅改输出,还能修改思考方式本身。

并且所有的反思日志,都可以追踪,这也正是他们通向下一步的关键。

6/

这个项目最野的地方在于它的长期目标:用这些 QNN 日志训练出一个全新的模型 WLM(World Language Model),这个与local 的民主化有点相悖,不知道未来数据从哪里来。

这个 WLM 的目标是自带协作和批判,预期是未来我们可能不再需要写 prompt 来控制模型行为,而是模型自己能根据上下文,动态决定何时该分解思考,何时该生成质疑,何时该写总结。

有点想知道 local-deepthink怎么为 WLM 铺路。

7/

当然,它也有很多未解问题,比如 QNN 在复杂任务下能不能稳定的收敛?大量智能体带来的认知增益和边际回报是否能取得平衡?比如怎么提升反思质量、避免陷入死循环?

8/

不是所有的 AI 都需要快。慢工出细活,那些真正有意义的思考和创新,往往需要一个演化的过程,而不是一击即中。

local-deepthink 值得学习,在多智能体的设计上有很多值得借鉴和学习的地方。


🔗 项目地址:https://github.com/iblameandrew/local-deepthink

💻 推荐配置:MacBook Pro / 32GB RAM / Python 环境