一只阿木木

90天,23个结晶判断,3次关键失败:拆解我的AI知识库进化档案

90天,23个结晶判断,3次关键失败:拆解我的AI知识库进化档案

先说结论:
这90天里,我没有变得更高效。
我没有写出更多内容。
我甚至没有减少对AI的依赖。

但我第一次系统性地知道了三件事:

  1. 我真正相信什么
  2. 我为什么相信它
  3. 在什么情况下,我的判断不成立

这三件事,比“多产出十篇文章”更重要。

一、为什么我要做这次90天复盘

如果你前面已经看完这个系列,你会发现我一直在反复强调一件事:

AI最大的风险,不是替你写,
而是替你判断。

这个判断不是抽象担忧,而是我在日常工作里反复遇到的真实问题:

  • 我能快速生成一篇看起来不错的文章,但别人追问一句“所以你真正怎么看”,我回答得不够稳。
  • 我能列出很多观点,但它们之间经常彼此冲突,只是我以前没发现。
  • 我能借助AI说得更完整,但未必说得更像“我”。

所以这90天,我没有把“深思引擎”当成内容生产系统来测试,而是把它当成一个更苛刻的东西来测试:

它到底能不能帮我形成更稳定、更可追溯、更经得起反驳的判断。

不是“想法”,是“判断”。

不是“灵感”,是“立场”。

不是“我好像觉得”,而是“我现在愿意这样说,并接受被追问”。

二、90天后,系统里真实留下了什么

先不给任何感受,先给数据。

90天原始数据

在这90天里,系统里新增了:

  • 127 条捕获内容(进入 /inbox/
    )
  • 41 条进入生长期(进入 /thoughts/
    )
  • 31 条进入成熟期
  • 23 条最终结晶为判断档案(进入 /judgments/
    )

如果只看转化率,大概是这样:

  • 捕获 → 生长:32.3%
  • 生长 → 成熟:75.6%
  • 成熟 → 结晶:74.2%
  • 捕获 → 结晶:18.1%

也就是说:

100个想法里,最后只有18个左右,值得成为真正的判断。

很多人看到这个数字,第一反应可能是:转化率太低了。

但我的看法恰恰相反:

82%的想法没有结晶,恰恰证明这套系统是正常工作的。
它不是在帮我保存一切,而是在帮我淘汰大多数不够扎实的东西。

以前我会误以为“一个想法只要看起来不错,就应该保留下来”。
现在我知道:大多数想法不配变成判断。

这句话很重要。

三、这90天里,最有价值的不是“多”,而是“可追溯”

以前我的笔记系统最大的问题,不是没有内容,而是没有分层。

所有东西都堆在一起:

  • 随手一句感叹
  • 一篇文章的核心观点
  • 一个长期相信的原则
  • 一个当下情绪化的判断

它们都以“笔记”的形式存在,所以看起来都很重要。

但90天后,我开始非常明确地区分三件事:

1. 原始想法不等于判断

一个想法可以很锋利,但仍然是未验证的。

比如我一开始写下:

“AI会让人的判断力退化。”

这是一句看起来很对的话。
但它只是一句高概括度的直觉表述。

经过追问后,我才把它变成更接近判断的话:

“判断力退化,不是因为用了AI,而是因为把‘判断环节’外包给了AI。”

再往后,进入判断档案时,它被写成:

“AI不会自动削弱判断力,持续外包判断的人才会。”

这三句话不是同一个东西。

第一句是情绪化判断。
第二句是机制化判断。
第三句才是可以被保存、被引用、被辩论的判断。

2. 判断必须有反驳记录

这是我以前最缺的部分。

我过去写很多观点,但很少记录:

  • 这个观点最强的反驳是什么?
  • 我有没有认真处理过那个反驳?
  • 如果反驳成立,我愿不愿意改?

90天后,凡是进入 /judgments/ 的内容,至少都要回答三个问题:

  1. 它最有力的证据是什么?
  2. 它最强的反驳是什么?
  3. 它在哪些情况下不成立?

这三个问题,让“观点”第一次有了结构。

3. 判断必须有边界

这是我这90天学到的最重要的能力之一。

以前我很容易说:

  • “深度比效率重要”
  • “AI让人思考变浅”
  • “真正的价值在判断力”

这些句子听起来都很像正确的话。
问题是,它们太容易被说成“总是如此”。

而任何一个总是正确的句子,通常都不是高质量判断。

高质量判断一定带边界。

比如现在我会这样写:

判断:在高不确定性任务中,判断力比执行速度更重要。
边界:在标准化、重复性、反馈周期极短的任务里,速度往往更重要。

这一下,判断才从“漂亮的话”变成“可用的话”。

四、三个最能代表这90天的判断档案

我不打算列出23个判断档案,那会变成资料堆砌。
我只挑3个最能代表这90天变化的。

1、判断档案 #07

速度是执行的价值,判断是思考的价值——混淆两者,是AI时代最常见的认知错误

这条判断是怎么来的

它最初来自一个很简单的观察:

我发现很多人在讨论AI时,总会把两个问题混在一起:

  • AI能不能让我更快?
  • AI能不能让我更对?

“更快”和“更对”不是一个问题。
但现实中,它们经常被混为一谈。

于是我一开始写了一句很粗糙的话:

“大家都把效率误当成价值。”

这句话太空。

后来经过几轮追问,我才慢慢逼近真正想表达的东西:

  • 执行环节里,速度本身就是价值
  • 但在判断环节里,速度未必是价值
  • 很多人拿“执行速度”的标准,去评价“思考质量”
  • 这就是AI讨论里最普遍的错位

最终它结晶成现在的版本:

速度是执行的价值,判断是思考的价值——混淆两者,是AI时代最常见的认知错误。

支撑它的证据

我在判断档案里留下的证据主要有三类:

证据1:真实工作观察
很多人用AI写、搜、总结之后,完成速度极高,但一进入开放讨论,就暴露出判断并未同步升级。

证据2:内容生产中的错位
一篇内容生产得快,不代表立场更清晰。
相反,很多“高效率产出”的内容,本质只是更快地组织共识。

证据3:决策场景中的验证
在高不确定任务里,能否区分变量、识别噪声、处理矛盾,比“1小时内给答案”更重要。

最强反驳

最强反驳其实非常有力:

“判断和速度并不冲突。更快形成判断,本身也是高级能力。”

这句反驳一开始差点推翻我。

后来我对它的回应是:

对,速度和判断不冲突。
但问题不在于“判断得快”,而在于用执行速度代替判断质量。

也就是说,我修正后的边界是:

  • 不是反对速度
  • 而是反对把速度当成判断正确性的替代指标

它真正改变了我什么

以前我评估一件事时,很容易问:

“有没有更高效的方法?”

现在我会先问:

“这件事到底属于执行问题,还是判断问题?”

如果是执行问题,我很愿意追求自动化和速度。
如果是判断问题,我反而会故意放慢。

这个区分,直接改变了我对AI工具的使用方式。

2、判断档案 #14

一个你说不清楚的想法,不是深刻,是未完成

这是这90天里转化最快的一条判断。

从萌芽到结晶,只用了12天。

为什么这条判断来得这么快

因为它几乎是我每天都会撞上的问题。

很多时候,我写下一个句子,会本能觉得:

“这个很深。”

但只要开始追问:

  • 你到底在说什么?
  • 具体是什么意思?
  • 有例子吗?
  • 边界是什么?
  • 最强反驳是什么?

这个“很深”的句子,常常在第二轮就塌了。

比如我曾写过一句:

“AI时代,人的价值在于不可替代的独特性。”

看起来很对吧。

但一旦追问:

  • 什么叫独特性?
  • 独特性如何转化为现实价值?
  • 哪种独特性是市场真正付费的?
  • 独特但没用,算价值吗?

你会发现,这句话根本不是一个完成的判断。
它只是一个未展开的姿态。

于是这条元判断形成了:

一个你说不清楚的想法,不是深刻,是未完成。

它为什么对我影响这么大

因为它直接改变了我的写作起点。

以前我经常从一种“感觉对”的状态开始写。
现在我越来越多从一句能说清楚、能经得起追问的话开始写。

这带来一个很直接的变化:

我开始允许很多“看起来不错”的想法,死在写作之前。

以前我会觉得可惜。
现在我觉得这是节省时间。

因为写清楚一个未完成的想法,比放弃它更浪费时间。

最强反驳

这条判断也有一个很强的反驳:

“有些真正深刻的东西,本来就很难说清楚。”

这是对的。

所以我后来给它加了边界条件:

  • 对于日常判断、观点表达、内容写作,这条判断成立
  • 对于某些尚在探索中的复杂经验、审美体验、模糊直觉,它不完全成立

也就是说:

不是一切说不清楚的东西都浅,
但你准备拿出来主张的东西,如果还说不清楚,它就还不该被主张。

这条边界,让这条判断变得更稳了。

3、 判断档案 #21

工具选择题的答案,不在工具,在你对时间的态度

这是23条判断里,成长最慢的一条。
从萌芽到结晶,花了61天。

中间还两次从成熟退回生长。

它最早是怎么出现的

最初我在反复比较各种知识管理和AI工具时,总觉得问题是:

  • 应该选Obsidian还是Notion?
  • 应该用Claude还是ChatGPT?
  • 应该要不要数据库、MCP、自动化流程?

后来我逐渐意识到:
很多“工具争论”其实是假问题。

因为真正决定你怎么用工具的,往往不是工具本身,而是你对时间的态度。

举例说:

如果你相信:

“最重要的是把当下效率最大化。”

那你会偏好:

  • 自动化
  • 模板化
  • 快速生成
  • 少摩擦
  • 少停顿

但如果你相信:

“有些价值,只能在慢思考里形成。”

那你会偏好:

  • 留痕
  • 追问
  • 手动链接
  • 结构化判断
  • 保留摩擦

于是我慢慢把它结晶成:

工具选择题的答案,不在工具,在你对时间的态度。

为什么它走得最慢

因为这条判断太容易被说成“价值观鸡汤”。

我要避免它变成一句漂亮但无用的话。

所以我逼自己处理了两个反驳。

最强反驳1

“很多时候真的是工具能力决定体验,不是时间态度决定。”

这个反驳成立。

回应是:

对,工具能力当然重要。
但在多数高频选择里,真正让人坚持或放弃某个工具的,不是功能表,而是它是否匹配你的时间观。

比如:

  • 你能不能忍受慢
  • 你要不要长期沉淀
  • 你愿不愿意为了更清晰牺牲一点即时效率

最强反驳2

“时间态度本身也会被现实约束,比如工作压力、平台节奏、收入需求。”

这个反驳也成立。

所以这条判断最终的边界条件是:

  • 当你有一定自主空间时,这条判断很强
  • 当你处于强外部约束环境(比如高频交付、短周期业绩)时,工具能力会更直接地影响结果

也正因为加上了这个边界,它才终于能结晶。

五、这90天里,我犯过的3个关键错误

如果只讲成果,这篇文章就不值钱了。

真正有价值的,是那些让我差点把系统带偏的失败。

实践踩坑经验1:一开始的CLAUDE.md写得太复杂

最早版本的CLAUDE.md非常长。

我试图把一切都规定清楚:

  • 用户是谁
  • AI该怎么说话
  • 每个阶段怎么处理
  • 哪些词可以用
  • 哪些词不能用
  • 哪些情况下该追问,哪些情况下该停

结果是:Claude反而抓不住重点。

它有时候执行“语气规范”,但忘了“永远不要先给答案”。

有时候记住了“每次只问一个问题”,却忘了“不要总结”。

我后来才意识到:

CLAUDE.md不是说明书,
它更像宪法。

它应该写原则,不该写细节流程。

流程属于Skill。
原则才属于CLAUDE.md。

后来我把CLAUDE.md大幅压缩,保留最核心的几条:

  • 你是思维磨刀石,不是代言人
  • 永远不要主动给答案
  • 每次只问一个问题
  • 不要总结,不要鼓励
  • 判断必须经过证据、反驳、边界三个环节

一压缩,系统反而稳定了。

实践踩坑经验2:我太着急把想法结晶成判断

这是第二个大错。

刚开始的前30天,我特别想看到 /judgments/ 文件夹变多。
于是只要一个想法稍微清晰一点,我就想执行 /crystallize。

结果是什么?

系统里出现了一批看起来像判断、其实只是偏好的东西。

例如:

  • “我更相信长期主义”
  • “深度工作比效率更重要”
  • “真正有价值的是原创性”

这些话不能说错,但它们还没有完成真正的检验。

后来我做了一件很关键的事:

给 /crystallize 加了严格前置检查。

只要还在“萌芽”,不能结晶。
如果还说不清最强反驳,也不能结晶。
如果一句话说不明白,继续回去 /think。

这会让系统“产出变慢”,但判断质量明显变高。

这也是我后来真正认同的一件事:

一个系统如果总在鼓励你“快点结晶”,
它大概率在鼓励你更快地把偏见固化。

实践踩坑经验3:冲突检测一度让我更焦虑,而不是更清晰

/clash 是一个很强的Skill,但它也有副作用。

有一周,我让系统一次性扫描出了7个认知冲突。

包括:

  • 我一边强调“深度重要”,一边又在别处说“速度是竞争力”
  • 我一边说“AI别替你判断”,一边又在几个场景下高度依赖AI推荐
  • 我一边批评内容流水线,一边又在设计内容系统

这些冲突当然真实。
问题在于:一次性暴露太多冲突,不会让人更清晰,只会让人怀疑自己是不是根本没有立场。

后来我改了规则:

  • 每次 /clash 最多展示2-3个最高优先级冲突
  • 处理完一个,再看下一个
  • 不追求“冲突清零”,只追求“高优先级冲突被解释”

这次修改让我学到一件事:

一个好的认知系统,不是把问题一次性全亮出来。
而是按人真正能处理的速度,把问题一层层暴露出来。

六、这套系统真正改变了什么,没改变的是什么

这是最需要回答的部分。

没改变的

1. 我的输出速度没有明显提升

甚至在某些阶段,写作变慢了。

因为我不再允许自己直接从一个“感觉对”的句子出发写整篇文章。
我会先问:

  • 这是想法,还是判断?
  • 它有反驳记录吗?
  • 它能撑住被追问吗?

这会拖慢开始速度。

但它减少了后期推翻重写的次数。

2. 我没有减少对AI的使用

恰恰相反,我用AI更频繁了。

只是使用方式变了。

以前是:

  • 帮我写
  • 帮我扩
  • 帮我总结
  • 帮我生成

现在更多是:

  • 追问我
  • 挑战我
  • 找冲突
  • 帮我检查边界

不是用得更少,而是用得更“逆着本能”。

3. 我没有彻底摆脱工具焦虑

老实说,也没有。

我依然会关注:

  • 新的Agent能力
  • 新的技能系统
  • 新的Obsidian工作流
  • 新的本地模型方案

但和以前不同的是:

我不再幻想“下一个工具会替我解决判断问题”。

这个幻想淡了很多。

真正改变的

1. 我开始能说出“这是我的判断”

以前很多时候,我说的是:

  • “我感觉……”
  • “可能是……”
  • “好像是……”
  • “大概吧……”

现在我更能说:

  • “我目前的判断是……”
  • “这个判断成立的前提是……”
  • “我接受的最强反驳是……”
  • “如果出现X,我会改这个判断”

这不是语气变化,这是认知结构变化。

2. 我开始区分“听起来对”和“我真正相信”

这可能是90天里最根本的收获。

很多公共叙事都“听起来对”:

  • 长期主义
  • 复利
  • 第一性原理
  • 用户价值
  • 做自己
  • AI时代要有判断力

这些词都很容易被认同。
但认同不等于相信。

相信意味着:

  • 你愿意拿它做决策依据
  • 你愿意接受它被反驳
  • 你愿意承受它带来的代价

90天后,我更少说“我同意”,更多问“我真的相信吗”。

3. 我的写作起点变了

过去写文章,我常常从主题出发:

  • AI时代怎么做知识管理?
  • 为什么判断力更重要?
  • 工具应该怎么选?

现在我更多从判断出发:

  • 我这次真正想主张的是什么?
  • 这个主张成立的证据是什么?
  • 我最怕别人怎么反驳我?
  • 我准备怎么回应?

于是写作不再是“组织材料”,而更像“展开判断”。

这会让文章更慢,但也更像自己。

七、 before / after

为了不让这篇文章停留在抽象层面,我给一个 before / after。

Before

别人问我:

“你怎么看AI会不会让人失去思考能力?”

我通常会这样回答:

“我觉得会有这个风险吧。因为现在很多人太依赖AI了。
但也不一定,要看怎么用。
总之,关键还是人自己要保持思考。”

你会发现这段话的问题:

  • 没有真正判断
  • 没有机制解释
  • 没有边界
  • 没有可追问性
  • 本质是“听起来都对”

After

现在我更可能这样回答:

“我目前的判断是:
AI不会自动削弱思考能力,但会放大一个人的默认使用方式。
如果你把AI当成资料和视角来源,它可能增强思考;
如果你把它当成结论生成器,长期会削弱你的判断环节。
所以问题不在AI本身,而在你是否持续外包判断。”

这段回答不是因为我更会表达了。

而是因为它背后真的有一个判断档案。

里面有:

  • 核心论断
  • 支撑证据
  • 最强反驳
  • 边界条件

这就是区别。

八、这90天之后,我对“第二大脑”有了一个不太讨喜的结论

如果要我用一句话概括这90天最大的认知变化,那就是:

大多数知识管理系统,解决的是存储问题;
但真正决定你认知质量的,是判断问题。

更进一步说:

一个不能帮你形成判断的第二大脑,最后很容易变成第二个仓库。

仓库当然有价值。
但仓库不等于认知系统。

你可以有一万条笔记,仍然说不清自己真正相信什么。
你也可以只有二十条判断档案,却拥有一个远比一万条笔记更可依赖的认知核心。

这就是我现在对“沉淀”这个词的理解变化:

以前我以为沉淀是“越积越多”。
现在我更相信,沉淀是“越留下来的,越能代表你”。

不是总量,而是密度。

不是收藏,而是结晶。

九、如果你现在要开始,第一步不是搭系统

很多人读到这里,可能会问:

“所以我要不要也立刻搭一个Obsidian + Claude + Skills系统?”

我的回答反而是:

可以,但那不是第一步。

第一步不是搭系统。
第一步是先接受一件事:

你现在脑子里大量“看起来不错”的想法,
其实并没有成熟到值得被你长期相信。

这件事有点刺耳。
但一旦接受了,你就会真正需要这套系统。

因为系统的意义,不是替你证明“我很会想”。
而是持续提醒你:

  • 很多想法还不够好
  • 很多判断还不够稳
  • 很多立场还需要被反驳
  • 很多你以为自己相信的东西,其实只是熟悉

只要你愿意接受这个前提,工具才开始有意义。

十、最后:我现在的Judgments文件夹里,有什么

如果今天你打开我的 /judgments/ 文件夹,你不会看到“宏大知识体系”。

你会看到一些很朴素、但我愿意负责的话,比如:

  • 速度是执行的价值,判断是思考的价值
  • 一个你说不清楚的想法,不是深刻,是未完成
  • 工具选择题的答案,不在工具,在你对时间的态度
  • AI不会自动削弱判断力,持续外包判断的人才会
  • 不是所有摩擦都该消除,有些摩擦就是思考本身
  • 没有边界条件的判断,不是判断,是口号

这些判断并不壮观。
但它们比“我收藏了多少资料”更重要。

因为当别人问我“你怎么看”,我终于不必先去搜。
我可以先回到这些我已经认真想过、被反驳过、仍然愿意保留的东西。

这就是这90天最大的收获。

不是更多信息。
不是更强效率。
不是更聪明的AI。

而是:

我终于开始拥有一套能代表我自己的判断。

写在最后

如果你准备开始,不需要一次做很多。

今天只做一件事就够了:

打开Claude。
说出你最近最常挂在嘴边的一句话。
然后让它追问你:

“你真正的意思是什么?”
“最强的反驳是什么?”
“它在什么情况下不成立?”

如果你能认真答完这三个问题,
你已经比绝大多数“在用AI思考”的人,更接近真正的判断力了。

我是【一只阿木木】,AI 知识系统架构师,坐标杭州。
用 Obsidian + claude + skills + PARA + LLM Wiki 范式,帮普通人搭建由 AI 自动编译、自我进化的个人知识系统。
我相信:在 AI 时代,每个普通人都该拥有一个自动生长的知识系统

扫码加入行动营👇获取更多Obsidian + AI数字大脑实践

Image

关注【一只阿木木】,去做,才是真的学。🌊