90天,23个结晶判断,3次关键失败:拆解我的AI知识库进化档案
90天,23个结晶判断,3次关键失败:拆解我的AI知识库进化档案
先说结论:
这90天里,我没有变得更高效。
我没有写出更多内容。
我甚至没有减少对AI的依赖。但我第一次系统性地知道了三件事:
- 我真正相信什么
- 我为什么相信它
- 在什么情况下,我的判断不成立
这三件事,比“多产出十篇文章”更重要。
一、为什么我要做这次90天复盘
如果你前面已经看完这个系列,你会发现我一直在反复强调一件事:
AI最大的风险,不是替你写,
而是替你判断。
这个判断不是抽象担忧,而是我在日常工作里反复遇到的真实问题:
我能快速生成一篇看起来不错的文章,但别人追问一句“所以你真正怎么看”,我回答得不够稳。 我能列出很多观点,但它们之间经常彼此冲突,只是我以前没发现。 我能借助AI说得更完整,但未必说得更像“我”。
所以这90天,我没有把“深思引擎”当成内容生产系统来测试,而是把它当成一个更苛刻的东西来测试:
它到底能不能帮我形成更稳定、更可追溯、更经得起反驳的判断。
不是“想法”,是“判断”。
不是“灵感”,是“立场”。
不是“我好像觉得”,而是“我现在愿意这样说,并接受被追问”。
二、90天后,系统里真实留下了什么
先不给任何感受,先给数据。
90天原始数据
在这90天里,系统里新增了:
- 127 条捕获内容(进入
/inbox/) - 41 条进入生长期(进入
/thoughts/) - 31 条进入成熟期
- 23 条最终结晶为判断档案(进入
/judgments/)
如果只看转化率,大概是这样:
捕获 → 生长:32.3% 生长 → 成熟:75.6% 成熟 → 结晶:74.2% 捕获 → 结晶:18.1%
也就是说:
100个想法里,最后只有18个左右,值得成为真正的判断。
很多人看到这个数字,第一反应可能是:转化率太低了。
但我的看法恰恰相反:
82%的想法没有结晶,恰恰证明这套系统是正常工作的。
它不是在帮我保存一切,而是在帮我淘汰大多数不够扎实的东西。
以前我会误以为“一个想法只要看起来不错,就应该保留下来”。
现在我知道:大多数想法不配变成判断。
这句话很重要。
三、这90天里,最有价值的不是“多”,而是“可追溯”
以前我的笔记系统最大的问题,不是没有内容,而是没有分层。
所有东西都堆在一起:
随手一句感叹 一篇文章的核心观点 一个长期相信的原则 一个当下情绪化的判断
它们都以“笔记”的形式存在,所以看起来都很重要。
但90天后,我开始非常明确地区分三件事:
1. 原始想法不等于判断
一个想法可以很锋利,但仍然是未验证的。
比如我一开始写下:
“AI会让人的判断力退化。”
这是一句看起来很对的话。
但它只是一句高概括度的直觉表述。
经过追问后,我才把它变成更接近判断的话:
“判断力退化,不是因为用了AI,而是因为把‘判断环节’外包给了AI。”
再往后,进入判断档案时,它被写成:
“AI不会自动削弱判断力,持续外包判断的人才会。”
这三句话不是同一个东西。
第一句是情绪化判断。
第二句是机制化判断。
第三句才是可以被保存、被引用、被辩论的判断。
2. 判断必须有反驳记录
这是我以前最缺的部分。
我过去写很多观点,但很少记录:
这个观点最强的反驳是什么? 我有没有认真处理过那个反驳? 如果反驳成立,我愿不愿意改?
90天后,凡是进入 /judgments/ 的内容,至少都要回答三个问题:
它最有力的证据是什么? 它最强的反驳是什么? 它在哪些情况下不成立?
这三个问题,让“观点”第一次有了结构。
3. 判断必须有边界
这是我这90天学到的最重要的能力之一。
以前我很容易说:
“深度比效率重要” “AI让人思考变浅” “真正的价值在判断力”
这些句子听起来都很像正确的话。
问题是,它们太容易被说成“总是如此”。
而任何一个总是正确的句子,通常都不是高质量判断。
高质量判断一定带边界。
比如现在我会这样写:
判断:在高不确定性任务中,判断力比执行速度更重要。
边界:在标准化、重复性、反馈周期极短的任务里,速度往往更重要。
这一下,判断才从“漂亮的话”变成“可用的话”。
四、三个最能代表这90天的判断档案
我不打算列出23个判断档案,那会变成资料堆砌。
我只挑3个最能代表这90天变化的。
1、判断档案 #07
速度是执行的价值,判断是思考的价值——混淆两者,是AI时代最常见的认知错误
这条判断是怎么来的
它最初来自一个很简单的观察:
我发现很多人在讨论AI时,总会把两个问题混在一起:
AI能不能让我更快? AI能不能让我更对?
“更快”和“更对”不是一个问题。
但现实中,它们经常被混为一谈。
于是我一开始写了一句很粗糙的话:
“大家都把效率误当成价值。”
这句话太空。
后来经过几轮追问,我才慢慢逼近真正想表达的东西:
执行环节里,速度本身就是价值 但在判断环节里,速度未必是价值 很多人拿“执行速度”的标准,去评价“思考质量” 这就是AI讨论里最普遍的错位
最终它结晶成现在的版本:
速度是执行的价值,判断是思考的价值——混淆两者,是AI时代最常见的认知错误。
支撑它的证据
我在判断档案里留下的证据主要有三类:
证据1:真实工作观察
很多人用AI写、搜、总结之后,完成速度极高,但一进入开放讨论,就暴露出判断并未同步升级。
证据2:内容生产中的错位
一篇内容生产得快,不代表立场更清晰。
相反,很多“高效率产出”的内容,本质只是更快地组织共识。
证据3:决策场景中的验证
在高不确定任务里,能否区分变量、识别噪声、处理矛盾,比“1小时内给答案”更重要。
最强反驳
最强反驳其实非常有力:
“判断和速度并不冲突。更快形成判断,本身也是高级能力。”
这句反驳一开始差点推翻我。
后来我对它的回应是:
对,速度和判断不冲突。
但问题不在于“判断得快”,而在于用执行速度代替判断质量。
也就是说,我修正后的边界是:
- 不是反对速度
- 而是反对把速度当成判断正确性的替代指标
它真正改变了我什么
以前我评估一件事时,很容易问:
“有没有更高效的方法?”
现在我会先问:
“这件事到底属于执行问题,还是判断问题?”
如果是执行问题,我很愿意追求自动化和速度。
如果是判断问题,我反而会故意放慢。
这个区分,直接改变了我对AI工具的使用方式。
2、判断档案 #14
一个你说不清楚的想法,不是深刻,是未完成
这是这90天里转化最快的一条判断。
从萌芽到结晶,只用了12天。
为什么这条判断来得这么快
因为它几乎是我每天都会撞上的问题。
很多时候,我写下一个句子,会本能觉得:
“这个很深。”
但只要开始追问:
你到底在说什么? 具体是什么意思? 有例子吗? 边界是什么? 最强反驳是什么?
这个“很深”的句子,常常在第二轮就塌了。
比如我曾写过一句:
“AI时代,人的价值在于不可替代的独特性。”
看起来很对吧。
但一旦追问:
什么叫独特性? 独特性如何转化为现实价值? 哪种独特性是市场真正付费的? 独特但没用,算价值吗?
你会发现,这句话根本不是一个完成的判断。
它只是一个未展开的姿态。
于是这条元判断形成了:
一个你说不清楚的想法,不是深刻,是未完成。
它为什么对我影响这么大
因为它直接改变了我的写作起点。
以前我经常从一种“感觉对”的状态开始写。
现在我越来越多从一句能说清楚、能经得起追问的话开始写。
这带来一个很直接的变化:
我开始允许很多“看起来不错”的想法,死在写作之前。
以前我会觉得可惜。
现在我觉得这是节省时间。
因为写清楚一个未完成的想法,比放弃它更浪费时间。
最强反驳
这条判断也有一个很强的反驳:
“有些真正深刻的东西,本来就很难说清楚。”
这是对的。
所以我后来给它加了边界条件:
对于日常判断、观点表达、内容写作,这条判断成立 对于某些尚在探索中的复杂经验、审美体验、模糊直觉,它不完全成立
也就是说:
不是一切说不清楚的东西都浅,
但你准备拿出来主张的东西,如果还说不清楚,它就还不该被主张。
这条边界,让这条判断变得更稳了。
3、 判断档案 #21
工具选择题的答案,不在工具,在你对时间的态度
这是23条判断里,成长最慢的一条。
从萌芽到结晶,花了61天。
中间还两次从成熟退回生长。
它最早是怎么出现的
最初我在反复比较各种知识管理和AI工具时,总觉得问题是:
应该选Obsidian还是Notion? 应该用Claude还是ChatGPT? 应该要不要数据库、MCP、自动化流程?
后来我逐渐意识到:
很多“工具争论”其实是假问题。
因为真正决定你怎么用工具的,往往不是工具本身,而是你对时间的态度。
举例说:
如果你相信:
“最重要的是把当下效率最大化。”
那你会偏好:
自动化 模板化 快速生成 少摩擦 少停顿
但如果你相信:
“有些价值,只能在慢思考里形成。”
那你会偏好:
留痕 追问 手动链接 结构化判断 保留摩擦
于是我慢慢把它结晶成:
工具选择题的答案,不在工具,在你对时间的态度。
为什么它走得最慢
因为这条判断太容易被说成“价值观鸡汤”。
我要避免它变成一句漂亮但无用的话。
所以我逼自己处理了两个反驳。
最强反驳1
“很多时候真的是工具能力决定体验,不是时间态度决定。”
这个反驳成立。
回应是:
对,工具能力当然重要。
但在多数高频选择里,真正让人坚持或放弃某个工具的,不是功能表,而是它是否匹配你的时间观。
比如:
你能不能忍受慢 你要不要长期沉淀 你愿不愿意为了更清晰牺牲一点即时效率
最强反驳2
“时间态度本身也会被现实约束,比如工作压力、平台节奏、收入需求。”
这个反驳也成立。
所以这条判断最终的边界条件是:
当你有一定自主空间时,这条判断很强 当你处于强外部约束环境(比如高频交付、短周期业绩)时,工具能力会更直接地影响结果
也正因为加上了这个边界,它才终于能结晶。
五、这90天里,我犯过的3个关键错误
如果只讲成果,这篇文章就不值钱了。
真正有价值的,是那些让我差点把系统带偏的失败。
实践踩坑经验1:一开始的CLAUDE.md写得太复杂
最早版本的CLAUDE.md非常长。
我试图把一切都规定清楚:
用户是谁 AI该怎么说话 每个阶段怎么处理 哪些词可以用 哪些词不能用 哪些情况下该追问,哪些情况下该停
结果是:Claude反而抓不住重点。
它有时候执行“语气规范”,但忘了“永远不要先给答案”。
有时候记住了“每次只问一个问题”,却忘了“不要总结”。
我后来才意识到:
CLAUDE.md不是说明书,
它更像宪法。
它应该写原则,不该写细节流程。
流程属于Skill。
原则才属于CLAUDE.md。
后来我把CLAUDE.md大幅压缩,保留最核心的几条:
你是思维磨刀石,不是代言人 永远不要主动给答案 每次只问一个问题 不要总结,不要鼓励 判断必须经过证据、反驳、边界三个环节
一压缩,系统反而稳定了。
实践踩坑经验2:我太着急把想法结晶成判断
这是第二个大错。
刚开始的前30天,我特别想看到 /judgments/ 文件夹变多。
于是只要一个想法稍微清晰一点,我就想执行 /crystallize。
结果是什么?
系统里出现了一批看起来像判断、其实只是偏好的东西。
例如:
“我更相信长期主义” “深度工作比效率更重要” “真正有价值的是原创性”
这些话不能说错,但它们还没有完成真正的检验。
后来我做了一件很关键的事:
给
/crystallize加了严格前置检查。
只要还在“萌芽”,不能结晶。
如果还说不清最强反驳,也不能结晶。
如果一句话说不明白,继续回去 /think。
这会让系统“产出变慢”,但判断质量明显变高。
这也是我后来真正认同的一件事:
一个系统如果总在鼓励你“快点结晶”,
它大概率在鼓励你更快地把偏见固化。
实践踩坑经验3:冲突检测一度让我更焦虑,而不是更清晰
/clash 是一个很强的Skill,但它也有副作用。
有一周,我让系统一次性扫描出了7个认知冲突。
包括:
我一边强调“深度重要”,一边又在别处说“速度是竞争力” 我一边说“AI别替你判断”,一边又在几个场景下高度依赖AI推荐 我一边批评内容流水线,一边又在设计内容系统
这些冲突当然真实。
问题在于:一次性暴露太多冲突,不会让人更清晰,只会让人怀疑自己是不是根本没有立场。
后来我改了规则:
每次 /clash最多展示2-3个最高优先级冲突处理完一个,再看下一个 不追求“冲突清零”,只追求“高优先级冲突被解释”
这次修改让我学到一件事:
一个好的认知系统,不是把问题一次性全亮出来。
而是按人真正能处理的速度,把问题一层层暴露出来。
六、这套系统真正改变了什么,没改变的是什么
这是最需要回答的部分。
没改变的
1. 我的输出速度没有明显提升
甚至在某些阶段,写作变慢了。
因为我不再允许自己直接从一个“感觉对”的句子出发写整篇文章。
我会先问:
这是想法,还是判断? 它有反驳记录吗? 它能撑住被追问吗?
这会拖慢开始速度。
但它减少了后期推翻重写的次数。
2. 我没有减少对AI的使用
恰恰相反,我用AI更频繁了。
只是使用方式变了。
以前是:
帮我写 帮我扩 帮我总结 帮我生成
现在更多是:
追问我 挑战我 找冲突 帮我检查边界
不是用得更少,而是用得更“逆着本能”。
3. 我没有彻底摆脱工具焦虑
老实说,也没有。
我依然会关注:
新的Agent能力 新的技能系统 新的Obsidian工作流 新的本地模型方案
但和以前不同的是:
我不再幻想“下一个工具会替我解决判断问题”。
这个幻想淡了很多。
真正改变的
1. 我开始能说出“这是我的判断”
以前很多时候,我说的是:
“我感觉……” “可能是……” “好像是……” “大概吧……”
现在我更能说:
“我目前的判断是……” “这个判断成立的前提是……” “我接受的最强反驳是……” “如果出现X,我会改这个判断”
这不是语气变化,这是认知结构变化。
2. 我开始区分“听起来对”和“我真正相信”
这可能是90天里最根本的收获。
很多公共叙事都“听起来对”:
长期主义 复利 第一性原理 用户价值 做自己 AI时代要有判断力
这些词都很容易被认同。
但认同不等于相信。
相信意味着:
你愿意拿它做决策依据 你愿意接受它被反驳 你愿意承受它带来的代价
90天后,我更少说“我同意”,更多问“我真的相信吗”。
3. 我的写作起点变了
过去写文章,我常常从主题出发:
AI时代怎么做知识管理? 为什么判断力更重要? 工具应该怎么选?
现在我更多从判断出发:
我这次真正想主张的是什么? 这个主张成立的证据是什么? 我最怕别人怎么反驳我? 我准备怎么回应?
于是写作不再是“组织材料”,而更像“展开判断”。
这会让文章更慢,但也更像自己。
七、 before / after
为了不让这篇文章停留在抽象层面,我给一个 before / after。
Before
别人问我:
“你怎么看AI会不会让人失去思考能力?”
我通常会这样回答:
“我觉得会有这个风险吧。因为现在很多人太依赖AI了。
但也不一定,要看怎么用。
总之,关键还是人自己要保持思考。”
你会发现这段话的问题:
没有真正判断 没有机制解释 没有边界 没有可追问性 本质是“听起来都对”
After
现在我更可能这样回答:
“我目前的判断是:
AI不会自动削弱思考能力,但会放大一个人的默认使用方式。
如果你把AI当成资料和视角来源,它可能增强思考;
如果你把它当成结论生成器,长期会削弱你的判断环节。
所以问题不在AI本身,而在你是否持续外包判断。”
这段回答不是因为我更会表达了。
而是因为它背后真的有一个判断档案。
里面有:
核心论断 支撑证据 最强反驳 边界条件
这就是区别。
八、这90天之后,我对“第二大脑”有了一个不太讨喜的结论
如果要我用一句话概括这90天最大的认知变化,那就是:
大多数知识管理系统,解决的是存储问题;
但真正决定你认知质量的,是判断问题。
更进一步说:
一个不能帮你形成判断的第二大脑,最后很容易变成第二个仓库。
仓库当然有价值。
但仓库不等于认知系统。
你可以有一万条笔记,仍然说不清自己真正相信什么。
你也可以只有二十条判断档案,却拥有一个远比一万条笔记更可依赖的认知核心。
这就是我现在对“沉淀”这个词的理解变化:
以前我以为沉淀是“越积越多”。
现在我更相信,沉淀是“越留下来的,越能代表你”。
不是总量,而是密度。
不是收藏,而是结晶。
九、如果你现在要开始,第一步不是搭系统
很多人读到这里,可能会问:
“所以我要不要也立刻搭一个Obsidian + Claude + Skills系统?”
我的回答反而是:
可以,但那不是第一步。
第一步不是搭系统。
第一步是先接受一件事:
你现在脑子里大量“看起来不错”的想法,
其实并没有成熟到值得被你长期相信。
这件事有点刺耳。
但一旦接受了,你就会真正需要这套系统。
因为系统的意义,不是替你证明“我很会想”。
而是持续提醒你:
很多想法还不够好 很多判断还不够稳 很多立场还需要被反驳 很多你以为自己相信的东西,其实只是熟悉
只要你愿意接受这个前提,工具才开始有意义。
十、最后:我现在的Judgments文件夹里,有什么
如果今天你打开我的 /judgments/ 文件夹,你不会看到“宏大知识体系”。
你会看到一些很朴素、但我愿意负责的话,比如:
速度是执行的价值,判断是思考的价值 一个你说不清楚的想法,不是深刻,是未完成 工具选择题的答案,不在工具,在你对时间的态度 AI不会自动削弱判断力,持续外包判断的人才会 不是所有摩擦都该消除,有些摩擦就是思考本身 没有边界条件的判断,不是判断,是口号
这些判断并不壮观。
但它们比“我收藏了多少资料”更重要。
因为当别人问我“你怎么看”,我终于不必先去搜。
我可以先回到这些我已经认真想过、被反驳过、仍然愿意保留的东西。
这就是这90天最大的收获。
不是更多信息。
不是更强效率。
不是更聪明的AI。
而是:
我终于开始拥有一套能代表我自己的判断。
写在最后
如果你准备开始,不需要一次做很多。
今天只做一件事就够了:
打开Claude。
说出你最近最常挂在嘴边的一句话。
然后让它追问你:
“你真正的意思是什么?”
“最强的反驳是什么?”
“它在什么情况下不成立?”
如果你能认真答完这三个问题,
你已经比绝大多数“在用AI思考”的人,更接近真正的判断力了。
扫码加入行动营👇获取更多Obsidian + AI数字大脑实践
关注【一只阿木木】,去做,才是真的学。🌊