让数字大脑自己「长脑子」
让数字大脑自己「长脑子」
LEARNED.md:你的知识系统,如何从工具进化成伙伴
作者:一只阿木木 | 数字大脑摆渡人 🌊
前五篇,我们建好了架构,写好了规则,学会了提取,做了体检。
你的
/wiki里有了几十甚至上百个节点, 系统在稳定地运转,Lint 让它保持健康。这一篇,我们要讲这个系列里最前沿的内容——
当你的系统开始自己更新自己的规则,它就不再只是一个工具了。
它变成了一个正在成长的认知伙伴。
一个让我停下来发呆的早晨
我记得那天是周四,清晨六点多。
我打开 /schema 目录,照例看一眼系统状态。
然后我看到了一条昨晚出现的记录——时间戳显示是 11:47 PM,是我睡着之后。
那是 AI 自己写进 LEARNED.md 的一条规律:
[2026-05-14] Ingest 优化 | 主观素材的置信度处理当素材来源包含大量第一人称表述(「我认为」「在我看来」「我的经验是」)时, 其中的声明性观点应自动标注为confidence: low, 即便该作者是公认的权威。 适用场景:个人博客、播客访谈、演讲稿。 不适用:同行评审论文、数据报告、官方文档。
我没有教它这条规则。
它是在处理前一天晚上我扔进去的一篇播客转录稿时,自己发现的。
发现了,然后写了下来,留给下一次自己用。
那一刻,我坐在那里发呆了大概五分钟。
不是因为这条规律本身有多复杂——其实挺简单。
而是因为:这个系统,第一次在没有我在场的情况下,更新了自己。
这,就是今天这篇文章要讲的事。
第一部分:Karpathy 指向了一个还没有完全解决的方向
在讲 LEARNED.md 之前,我需要先带你看一条 Karpathy 在 2025 年发的推文。
这条推文,比他的 LLM Wiki Gist 更早,也更深——
他写道:我们缺少(至少一个)LLM 学习的主要范式。不确定叫什么,也许叫系统提示学习(system prompt learning)?预训练用于知识。微调(SL/RL)用于习惯行为。
然后他说了一句让我久久不能释怀的话——
这两者都涉及参数变化,但很多人类学习感觉更像是系统提示的变化。你遇到一个问题,想出了什么,然后以相当明确的方式「记住」下次该怎么做。
他用了一个极其生动的比喻:
这感觉更像是给自己做笔记——不是存储随机的用户事实,而是通用的、全局性的问题解决知识和策略。LLMs 简直就像《记忆碎片》里的那个人,只不过我们还没有给它们便签本。
停在这里想一想。
《记忆碎片》——那部电影里的主角,患有短期记忆丧失症,每隔一段时间就会忘记最近发生的一切。他唯一的应对方式是:把重要的信息纹在身上,或者写在便利贴上,贴在墙上、车上、手背上。
Karpathy 说:我们的 LLM,就是那个没有便利贴的《记忆碎片》主角。
聪明,有能力,但每次对话都从零开始。它踩过的坑,发现过的规律,积累的经验——全部消失。下一次,重新踩一遍。
而 LEARNED.md,就是我们给系统造的那一张便利贴。
不,不只是一张。
是一本持续生长的经验手册。
第二部分:三种学习范式——你的系统目前停在哪一层?
在我解释 LEARNED.md 怎么工作之前,让我先帮你建立一个完整的认知框架。
Karpathy 实际上描述了 LLM 的三种学习范式:
范式 1:预训练(Pretraining)
「预训练用于知识。」
这是模型在出厂之前,通过海量文本学习的过程。它让模型知道「什么是 RAG」「什么是 Karpathy」「什么是编译模式」。
这部分,你改变不了。 这是模型制造商的工作。
范式 2:微调(Finetuning)
「微调(SL/RL)用于习惯行为。」
这是通过大量的监督学习或强化学习,让模型形成特定的行为习惯——比如「回答时先思考再输出」「代码里不要出现硬编码」。
这部分,个人用户基本改变不了。 需要大量数据和算力。
范式 3:系统提示学习(System Prompt Learning)
系统提示学习(SPL)是 LLM 通过动态编辑系统提示来自主开发和优化问题解决策略的方式,而不是依赖预训练获取知识或微调来改变行为。
这部分,是你今天就能开始做的。
这不需要改变模型参数,不需要大量数据,不需要技术背景。
你只需要:在每次操作后,让系统把「发现的有效策略」记录进一个文件,然后下次操作时自动加载这个文件。
这个文件,就是 LEARNED.md。
让我用一张图来展示三种范式的差异:
text
┌────────────────────────────────────────────────────────────────┐
│ LLM 的三种学习范式 │
│ │
│ 范式 1:预训练 范式 2:微调 范式 3:SPL │
│ │
│ 学习内容:知识 学习内容:习惯 学习内容:策略 │
│ 学习方式:海量文本 学习方式:监督/强化 学习方式:经验记录 │
│ 发生时间:出厂前 发生时间:出厂后特训 发生时间:每次使用时 │
│ 更改主体:模型厂商 更改主体:训练团队 更改主体:你自己 │
│ 存储位置:模型参数 存储位置:模型参数 存储位置:LEARNED.md │
│ 你能控制:❌ 你能控制:❌ 你能控制:✅ │
│ │
│ 「知道什么」 「习惯怎么做」 「遇到这种情况, │
│ 下次这样处理」 │
└────────────────────────────────────────────────────────────────┘
你的 CLAUDE.md,是你一开始写好的「静态规则」——范式 2 的平替。
你的 LEARNED.md,是系统从运行经验中自动积累的「动态策略」——范式 3 的个人实现。
第三部分:CLAUDE.md 的天花板
在讲 LEARNED.md 之前,我需要先帮你看清楚 CLAUDE.md 的一个根本性局限。
回顾一下我们在第三篇建立的 CLAUDE.md——
它是你预先写好的规则手册。它非常重要,没有它系统无法稳定运作。
但它有一个问题:
它是静态的。
你在某一天的认知水平决定了它的内容。它不会随着你的系统变得更聪明而自动进化。
你和 LLM 随时间共同演化这份 schema。
注意这个关键词:共同演化(co-evolve)。
Karpathy 没有说「你写好,AI 遵守」。他说的是共同演化——意味着这是一个双向的、动态的过程。
但在实践中,大多数人的 CLAUDE.md 是单向的:你写,AI 遵守,周而复始。
系统的经验,没有流回它的规则里。
这就是 LEARNED.md 要解决的问题。
第四部分:LEARNED.md 的工作原理
让我用一个非常直觉的比喻来解释。
想象一个刚入职的厨师(AI)和一本《厨师操作手册》(CLAUDE.md)。
手册里写的是厨房的基本规范:食材怎么处理、菜品怎么命名、遇到冲突怎么报告。这些规范是厨师长(你)在他入职前写好的,来自你过去积累的最优实践。
厨师每天按手册工作,表现良好。
但随着时间推移,他在工作中发现了手册里没有覆盖的情况:
某类食材(播客转录稿)在特定处理方式下效果比手册规定的好 30% 某类菜品(个人洞察页)如果加上特定格式,之后被引用的频率高很多 当两个客人(两个概念)同时点相似的菜时,按某种顺序处理比另一种顺序快很多
这些是手册里没有的内容。
在旧的系统里:这些发现消失了。下周遇到同样情况,重新摸索一遍。
在新的系统里(有 LEARNED.md):厨师把这些发现写进了一本《个人经验补充手册》,每次开工前都会翻看。手册里的规范在进化,效率在持续提升。
这个系统不只是在积累知识,它在积累判断力。
这就是 LEARNED.md 的本质:让系统的经验,永久地影响系统未来的行为。
第五部分:LEARNED.md 的三层结构
在我给你完整实现之前,先帮你理解 LEARNED.md 里面应该记录什么样的内容。
它不是随机的笔记,也不是日记。它是有结构的经验条目,分三个层次:
第一层:操作优化规律(Operational Patterns)
记录什么: 发现某种操作方式,比 CLAUDE.md 中规定的默认方式效果更好。
触发时机: Ingest 完成后,AI 发现自己用了一种非标准的处理方式,效果明显更好。
示例条目:
Markdown
## [2026-05-14] Ingest 优化 | 播客素材的分段处理规律描述:
对于超过 8000 字的播客转录稿,分段 Ingest(每段 2000-3000 字)
比一次性 Ingest 产出更高质量的实体提取结果。
触发场景:
素材类型为 podcast,且文字总量超过 8000 字
具体做法:
1. 先扫描全文识别「主题转换点」(通常是主持人换话题的地方)
2. 按主题块分段
3. 每段独立 Ingest,最后统一检查交叉引用
验证次数:3 次(均优于一次性处理)
置信度:medium(样本量尚小)
来源操作:[2026-05-10 Ingest | Lex Fridman 访谈]、[2026-05-12 Ingest | Tim Ferriss 访谈]
第二层:用户行为规律(User Behavior Patterns)
记录什么: 从用户的提问方式、阅读习惯、关注领域里,总结出的行为模式。
触发时机: 多次 Query 后,AI 发现了用户的某种稳定模式。
示例条目:
Markdown
## [2026-05-18] 用户行为 | 深度探索信号规律描述:
当用户对同一个概念在 7 天内提问超过 3 次,
说明该概念的 wiki 页面对用户来说「还不够用」。
这不是页面质量差,而是用户在这个主题上有更深的探索需求。
触发场景:
Query 日志中,同一概念被查询 ≥ 3 次 / 7 天
具体做法:
在第三次查询时,主动提示:
「我注意到你在这个主题上做了多次深度查询。
建议:1)是否有新素材可以投入补充这个主题?
2)是否值得建立一个独立的综合分析页?」
验证次数:2 次
置信度:medium
第三层:知识结构规律(Knowledge Structure Patterns)
记录什么: 关于知识库如何组织、页面如何连接、什么情况下应该拆分或合并的洞察。
触发时机: Lint 审计后,AI 发现了某种反复出现的结构性问题,或者某种结构效果特别好。
示例条目:
Markdown
## [2026-05-20] 知识结构 | 高连接度 Hub 页面的维护策略规律描述:
当一个概念页面的入链数量超过 15 个时,
该页面会成为知识网络的「关键枢纽(Hub)」。
Hub 页面的质量问题会以放大效应影响整个网络。
触发场景:
Lint 审计中发现任何入链数 > 15 的页面
具体做法:
1. Hub 页面的 Lint 优先级提升为最高
2. Hub 页面的置信度要求提升为:需要 ≥ 5 个来源才能标注 high
3. 每次有新素材涉及 Hub 概念,必须执行「Hub 一致性检查」:
确认新素材不与 Hub 页面的核心定义产生矛盾
验证次数:1 次(新规律,待验证)
置信度:low
注意置信度标注——这不只是对 wiki 内容有效,对 LEARNED.md 里的规律条目同样适用。
一条新发现的规律,在被验证 3 次以上之前,不应该获得 high 置信度。
规律和知识一样,也需要被审计,也需要随着更多证据而演进。
第六部分:完整实现方案
好,理论全部讲完了。现在给你可以直接落地的完整实现。
分三个部分:LEARNED.md 的基础模板、加进 CLAUDE.md 的自学习触发模块、以及周度规律「毕业审查」的 Prompt。
Part A:LEARNED.md 基础模板
将以下内容保存为 /schema/LEARNED.md:
Markdown
# LEARNED.md — 系统经验进化手册
# 版本:自动维护
# 规则:本文件由 AI 在每次操作后自动追加,人工定期审查
# 创建时间:[你创建的日期]---
## 使用说明
本文件记录系统在运行过程中自主发现的、超越 CLAUDE.md 基础规范的优化规律。
分类:
[O] Operational — 操作优化规律(Ingest / Lint / Query 流程改进)
[U] User — 用户行为规律(用户偏好、探索习惯)
[K] Knowledge — 知识结构规律(wiki 组织、页面关系)
置信度:
low = 发现 1-2 次,待验证
medium = 验证 3-5 次,较可靠
high = 验证 6 次以上,可升级进 CLAUDE.md
毕业机制:
当某条规律的置信度达到 high,将其标注为 [READY TO GRADUATE]。
在下次人工审查时,决定是否将其正式写入 CLAUDE.md。
写入后,将该条目从 LEARNED.md 移入 /wiki/log.md 存档。
---
## 活跃规律库
<!-- 系统在每次操作后追加新规律至此处 -->
<!-- 人工在每周审查时处理 [READY TO GRADUATE] 条目 -->
---
## 已毕业规律(存档)
<!-- 已升级进 CLAUDE.md 的规律存档于此,不删除,作为演化历史记录 -->
Part B:在 CLAUDE.md 中加入自学习触发模块
在你第三篇建立的 CLAUDE.md 末尾,追加以下模块:
Markdown
---## 11. 自学习机制(LEARNED.md 自动更新)
### 触发条件
以下情况发生时,执行「反思步骤」:
- 每次 Ingest 操作完成后
- 每次 Lint 审计完成后
- 当某次 Query 产生了你判断「特别有洞察价值」的综合回答后
- 当你在操作中遇到了 CLAUDE.md 没有覆盖的边缘情况时
### 反思步骤(Reflection Step)
每次触发后,执行以下自我审视:
Step 1:操作回顾
这次操作中,我做了什么「超越 CLAUDE.md 规范」的事情?
这些偏离是被迫的(规范不够用)还是主动优化的(发现更好的方式)?
Step 2:规律提取
如果我发现了某种可复用的模式,它属于以下哪类?
[O] 操作流程上的改进
[U] 用户行为上的规律
[K] 知识结构上的洞察
Step 3:条目写入
如果发现了有价值的规律,追加至 /schema/LEARNED.md 的「活跃规律库」。
条目格式:
## [YYYY-MM-DD] [O/U/K] [分类标题] | [规律标题]
规律描述:[一句话说清楚这是什么规律]
触发场景:[什么情况下这条规律生效]
具体做法:[下次遇到这种情况应该怎么处理]
验证次数:[这次是第 N 次验证此规律]
置信度:low / medium / high
来源操作:[本次操作的简要描述]
Step 4:置信度更新
如果本次操作验证了 LEARNED.md 中已有的某条规律,
找到该条目,将「验证次数」+1,
如果验证次数达到 6 次,将置信度更新为 high,
并在条目末尾标注 [READY TO GRADUATE]。
### 约束
- 只记录真正有复用价值的规律,不记录一次性的特殊情况
- 每次 Ingest 最多追加 2 条新规律(避免系统过度膨胀)
- 自我质疑:「这条规律在不同素材类型上也适用吗?」
如果只对某一种素材适用,在条目中明确标注适用范围
Part C:周度「规律毕业审查」Prompt
每周一次,花 15 分钟,把以下 Prompt 发给 Claude Code:
text
你正在执行「LEARNED.md 周度毕业审查」。目标文件:/schema/LEARNED.md
请按以下步骤操作:
Step 1:读取全文
完整阅读 LEARNED.md 中的所有活跃规律。
Step 2:识别毕业候选
找出所有满足以下条件的规律:
- 置信度为 high,且标注了 [READY TO GRADUATE]
- 或者:验证次数 ≥ 6,但还没被标注为 [READY TO GRADUATE](补充标注)
Step 3:毕业建议报告
对每个毕业候选,给我一份建议报告:
【毕业候选 N】
规律标题:[标题]
核心内容:[30 字以内的摘要]
建议写入位置:CLAUDE.md 的第 [N] 节,[具体段落]
建议写入方式:[完整的规范文本,可直接粘贴进 CLAUDE.md]
风险提示:[如有,说明这条规律在什么情况下可能失效]
Step 4:过时规律识别
检查活跃规律库中,是否有超过 90 天没有被新操作验证的 low 或 medium 规律。
这些规律可能已经不适用了,或者是偶然发现的噪声。
输出:建议归档(移入存档区)的规律列表,及理由。
Step 5:矛盾检查
检查 LEARNED.md 中的活跃规律之间是否存在互相矛盾的情况。
矛盾的规律不能同时升级进 CLAUDE.md——需要人工判断保留哪个。
Step 6:输出决策清单
整理为一份简洁的「等待你决策」清单:
需要你决定的事情:
□ [毕业候选 1] — 是否写入 CLAUDE.md?建议:是
□ [毕业候选 2] — 是否写入 CLAUDE.md?建议:是
□ [过时规律 1] — 是否归档?建议:是
□ [矛盾规律对] — 保留哪一个?建议:[说明]
你不需要做的事情:
本次没有需要手动修改的文件,
确认决策后,由我来执行所有文件操作。
第七部分:社区最前沿实践——有人比 Karpathy 走得更远
在这个系列里,我一直努力讲真正正在发生的事情,不夸大,不编造。
所以我要带你看两个社区案例——它们证明了 LEARNED.md 的理念不是我的空想,而是有人在生产环境中真实验证过的。
案例 1:Exo 系统(Aaron Fulkerson)
有人构建了三个正式的学习循环:每日观察被捕获——他注意到的关于系统如何工作的事情、客户对话中的模式、他犯的错误、来自阅读的洞察。每周回顾扫描积累的观察,发现跨会话的模式,并提出「毕业」建议。毕业意味着一个模式有了足够的证据,可以成为 CLAUDE.md 中的永久规则、技能文件的改进,或者共享知识库中的新条目。这个系统不只是在积累知识,它在积累判断力。
这和我提出的 LEARNED.md + 毕业机制是完全一致的思路——只是他走得更远,三层学习循环(日/周/月)让系统的自进化有了更精细的节奏。
案例 2:SPL 开源实现(optillm)
有团队实现了 Karpathy 的「第三范式」。系统提示学习(SPL)使 LLM 能够从经验中自动学习问题解决策略,而不是依赖静态提示。 它的工作方式是:LLM 构建一个有效策略数据库,为每个问题选择最佳策略,并根据成功率随时间精炼它们。在数学基准测试上的结果:Arena Hard 从 29% → 37.6%(+8.6%),AIME24 从 23.33% → 30%(+6.67%)。所有策略都是人类可读的,系统在你频繁使用的问题类型上会越来越好。
这个案例说明了什么?
系统提示学习是真实有效的。 不是玄学,不是概念——而是在公开基准测试上有可测量改进的机制。
你的 LEARNED.md 是这个机制的个人实现版本。
第八部分:LEARNED.md 的演化轨迹——你能看到什么
当你跑起这套机制,随着时间推移,LEARNED.md 会经历几个可预期的演化阶段:
第 1-4 周:探索期(条目稀少,规律偏操作)
text
/schema/LEARNED.md
活跃规律:3-5 条
主要类型:[O] 操作优化规律
特征:都是「某类素材用这种处理方式更好」的具体技巧
毕业候选:0这个阶段的感受:
「好像在记一些很平凡的小技巧,没什么大不了的」
这是正常的。不要期望第一个月就出现什么惊天大洞察。
第 5-12 周:模式期(条目增多,用户规律开始出现)
text
/schema/LEARNED.md
活跃规律:12-20 条
主要类型:[O] 操作优化 + [U] 用户行为规律开始出现
特征:系统开始识别你的提问习惯和探索偏好
毕业候选:2-3 条(最早的操作规律开始达到 high)这个阶段的感受:
「系统开始有点「认识」我了,回答比三个月前更贴合我的思维方式」
第 3-6 个月:收敛期(规律开始「毕业」,CLAUDE.md 进入第二代)
text
/schema/LEARNED.md
活跃规律:25-35 条(新增的开始和「毕业」的持平)
主要类型:三层规律均有
特征:最重要的规律已经写进 CLAUDE.md,系统进入「第二代」
毕业进 CLAUDE.md 的规律:5-8 条这个阶段的感受:
「我的 CLAUDE.md 和刚开始用的时候完全不一样了。
现在这个版本,是我和系统共同写出来的——
里面有些规则我当时压根没想到,是系统教会我的。」
6 个月以后:成熟期(schema 高度个性化,系统拥有记忆)
text
/schema/LEARNED.md
活跃规律:30-50 条(动态平衡)
存档规律:10-20 条(已毕业的历史记录)
CLAUDE.md 版本:v3.x 或更高这个阶段的感受:
「有时候我看着 CLAUDE.md 里的某条规范,
完全不记得是我当初写的还是系统学到的。
它就是我们共同积累的那套智慧,没有边界了。」
这就是 Karpathy 说的「共同演化」。
你和 LLM 随时间共同演化这份 schema。
不是你在单方面指挥系统,是你们在相互学习。
第九部分:你需要警惕的两个陷阱
讲了这么多 LEARNED.md 的价值,我也需要诚实地说明它的风险。
陷阱 1:规律过度泛化
AI 在发现规律时,有时候会从一个非常具体的个案中,提取出一个过于宽泛的结论。
比如:
它发现了「这次 Ingest 播客素材时分段处理效果更好」, 然后写进了「所有长素材都应该分段处理」。
这是一个过度泛化的例子。分段处理对播客有效,对书籍章节不一定。
如何防范:
在 CLAUDE.md 的自学习触发模块里,加入这条约束(我在上面的模板里已经包含了):
「自我质疑:这条规律在不同素材类型上也适用吗? 如果只对某一种素材适用,在条目中明确标注适用范围。」
陷阱 2:规律「固化偏见」
如果你的阅读素材有明显的信息茧房倾向,LEARNED.md 会把这种偏向固化进系统的行为规律里。
比如:你长期只读某个立场的媒体,系统会「学会」在提取声明时自动倾向于这个立场,然后把这种倾向写进规律,影响未来所有的 Ingest。
如何防范:
在毕业审查时,专门有一个步骤:「风险提示」——要求 AI 说明每条毕业候选规律在什么情况下可能失效,或者可能导致偏差。
这不能完全防止偏见,但能让偏见可见,而不是悄悄固化。
这两个风险,都没有完美的解法。
这是 Karpathy 在描述系统提示学习时,也没有完全解决的问题——
他提到:这个范式在数据效率上更强大,因为知识引导的「复盘」阶段是一个比标量奖励信号高得多的反馈维度。
但高维度的反馈,也意味着高维度的潜在错误。
你的人工判断,仍然是系统里最不可缺少的一个环节。
AI 提出规律,你来决定要不要接受它。
第十部分:你的系统,正在变成什么?
我想在这篇文章结束前,带你退后一步,看一个更大的画面。
从第一篇到今天,你的系统完成了一段完整的进化:
text
第一篇:你意识到「整理笔记」是错误方向
↓
第二篇:你理解了「编译」vs「搜索」的根本差异
↓
第三篇:你建立了 CLAUDE.md,系统有了「纪律」
↓
第四篇:你学会了「实体提取」,系统有了「眼睛」
↓
第五篇:你建立了 Lint 体检,系统有了「免疫系统」
↓
第六篇(今天):你建立了 LEARNED.md,系统有了「学习能力」现在:你拥有了一个
→ 能自动编译知识的系统
→ 能保持健康运转的系统
→ 能从自身经验中持续学习和进化的系统
这不再是一个「工具」了。
工具是被动的,你用它,它不会因此变得更适合你。
传统上,每次与 AI 的交互中,所有做出的决策、发现的模式、积累的洞察,往往是短暂的,在会话结束时消失。但想象一个系统,每次交互都自动被编译进一个结构化的、持续进化的知识库。
你建立的这个系统,恰恰是那个「不会消失」的系统。
它会因为你用它而变得更了解你。 它会因为处理你的素材而积累你领域的判断力。 它的规则,会因为你的使用经验而持续进化。
这,是 AI 时代真正意义上的「第二大脑」——
不是一个更好看的笔记软件, 不是一个更聪明的搜索引擎, 而是一个和你一起成长的认知伙伴。
尾声:给自己的系统,写第一条规律
读完这篇文章,我希望你做一件事:
今天,给你的系统写第一条 LEARNED.md 条目。
不需要等系统真的自己发现了什么。
先由你来写。
打开 /schema/LEARNED.md,追加一条你自己在用系统这段时间里,手动发现的最重要的一个操作规律。
格式就用我给你的模板,哪怕只有几行。
然后,在 CLAUDE.md 的自学习触发模块里,加上这句话:
"在每次 Ingest 完成后,阅读 /schema/LEARNED.md, 按照反思步骤检查是否有新规律值得追加。"
就这两步。
你的系统,就从今天开始,拥有了自己成长的能力。
六个月后,当你打开 LEARNED.md,看到里面有三十几条规律——
有你自己写的,有 AI 发现的,有些你已经不记得当时为什么写,但它们就在那里,每天悄悄地在系统背后工作——
那时候,你会真正理解「数字大脑」这四个字的分量。
扫码加入行动营👇获取更多Obsidian + AI数字大脑实践
关注【一只阿木木】。去做,才是真的学。🌊