我把知识管理做成一条“内容流水线”:Hermes→Obsidian→LLM Wiki 一张总图讲透(附可复用架构模板)
我把知识管理做成一条“内容流水线”:Hermes→Obsidian→LLM Wiki 一张总图讲透(附可复用架构模板)
我后来才明白:知识管理失败,往往不是你记得不够多,而是你让“任何东西”都能进库。
而 AI 写作失败,也不是模型不够强,而是你给它的输入不可追溯、不可审计、不可复用——它只能“写得像”,却很难“写得对、写得稳”。
下面这篇文章,我会用深度研究 + 框架 + 贯穿案例把整套系统讲透:Hermes × Obsidian × LLM Wiki 为什么能复利、复利发生在哪里、你该如何把它跑成一个闭环。
01. 痛点先讲透:为什么你收藏越多,越不敢打开?
如果你有过这种体验,你就会知道“信息太多”不是问题,“未来自己要还的整理债”才是问题。
在 Scott Young 采访 Tiago Forte 的《Building A Second Brain》播客全文稿里,Scott 描述过一个非常典型的场景:他疯狂 web clip,最后“存了百万条”,甚至害怕打开笔记软件,因为里面“太多了”,他知道自己也不会再看,只是在“把东西送进虚空”。
Tiago 在同一段对话里补了一刀:当你“什么都收集”,结果可能等同于“什么都没收集”,因为你保存了,但知识不可被访问、不可被使用。
这就是我做这套系统的起点:
我不想再做“收藏者”,我想做“能把素材变成输出的人”。
02. 我这篇文章的承诺(可量化,但不编数据)
我不在这里报“效率提升 300%”这种漂亮数字。相反,我只给你一套可审计指标,你跑一周就能自己验证收益。
从今天开始,你只需要记录 6 个指标(每篇系列都会复用它们):
Capture→Asset(分钟):一条素材从捕获到变成“可引用卡片”的用时 Asset→Ship(分钟):从卡片到输出(段落/大纲/提案)的用时 引用覆盖率(%):文章段落里“带证据回链”的比例 Inbox 老化率(%):进入 Inbox 超过 7 天未处理占比 复用次数(次):同一张卡被多少个项目页/文章引用 检索命中率(%):你问一个问题,LLM Wiki 能返回“可用引用”的比例
这套指标的好处是:不依赖热点、不依赖某个工具版本、只依赖你的流程是否跑通。
03. 为什么我坚持“可追溯”?(研究依据:AI 幻觉不是小问题)
如果你把 AI 当成写作加速器,最大的风险不是“它偶尔写错”,而是它会在你没意识到的时候,把错误写得很流畅、很像真的。
一篇 arXiv 综述论文明确指出:LLM 可能因为训练数据偏差、提示词歧义等原因产生不可靠内容;而这在医疗记录总结、金融分析等敏感任务里尤其危险。该综述系统性整理了32+ 种幻觉缓解技术,并把 RAG(检索增强生成)等列为重要方法之一,还讨论了这些方法的挑战与局限。
更早的 RAG 经典论文也点出了一个关键现实:纯参数模型虽然在参数里“存了知识”,但在知识密集任务上,访问与精确操控知识的能力仍受限;同时,“为决策提供来源(provenance)”与“更新世界知识”仍是开放问题。RAG 的方向,是把可检索的外部知识作为一种“非参数记忆”接入生成过程。
所以我给自己的系统立了一条铁律:
LLM 可以帮我写,但不能替我负责。
我必须能把每条关键结论回链到证据卡/原文。
04. 一张总架构图:复利系统不是“工具堆叠”,而是“闭环”
你可以把 Hermes × Obsidian × LLM Wiki 理解为:
一个把信息变成可复用资产,再把资产变成稳定输出的流水线。
4.1 六层流水线 + 两个回路(我的总架构)
mermaid
flowchart LR
A[外部信息源\n文章/书/播客/会议/聊天] --> B[Hermes 输入管道\n采集/去噪/打标签/路由]
B --> C[Obsidian Inbox\n待处理]
C --> D[加工层\n摘录→主张→证据→边界→链接]
D --> E[Obsidian 知识库\n证据库/概念库/项目库]
E --> F[LLM Wiki 服务层\n索引/检索/RAG/引用回链]
F --> G[输出层\n文章/视频/课件/咨询交付]
G --> H[反馈层\n复盘/数据/版本迭代]
H --> D
H --> B
4.2 每层只做一件事(避免“什么都想解决”)
Hermes(入口治理):解决“信息污染”。该拒收就拒收,该分流就分流。 Obsidian(事实底座):你的“可编辑、可链接、可长期维护”的主库。 LLM Wiki(召回与结构化输出):让知识库变成“可对话的研究助理”,但输出必须带回链。 输出层(项目页):复利发生的地方——资产被真实调用。 反馈层(版本日志):让系统越跑越稳,而不是越跑越乱。
05. 复利到底发生在哪里?答案:发生在“项目”,不是发生在“存储”
很多人把精力用在“存得更好”,但复利不是来自“存储更精致”,而来自:
同一份资产(主张/证据/边界) 在 不同项目(文章/视频/咨询/课程)里 被 多次调用,并且调用成本越来越低
Tiago Forte 在 Progressive Summarization 的文章里提到一个很重要的原则:要在“细节”和“可发现性”之间做平衡,并通过“机会式压缩”让笔记在每次触碰时变得更可用。
我的解释是:
你不是在“整理笔记”,你是在降低未来某个项目的调用成本。
所以输出层(Project)必须是中心。
06. 贯穿案例(Casepack-01):我如何用同一套素材跑通最小闭环
为了保证整个系列不是讲概念,我会用同一个素材包贯穿 6 篇文章(你也可以照抄这个结构):
研究底盘:幻觉缓解综述(arXiv 2401.01313) 痛点叙事:BASB 访谈全文稿(Scott Young × Tiago Forte) 加工原则:Progressive Summarization VI(可发现性/机会式压缩)
6.1 Hermes 入口最小元数据(4 个字段就够)
每条素材进库时,只强制写 4 个字段:
source_url(或书名/会议)captured_atwhy_it_matters(一句话用途:未来用在哪个输出)route(writing / research / project / idea)
这一步的“反直觉”在于:
我宁愿多花 10 秒写用途句,也不愿未来花 2 小时在垃圾堆里捞信号。
6.2 在 Obsidian 里产出一对“可回链资产”:主张卡 + 证据卡
示例主张(来自播客稿的痛点):
主张卡:入口治理(拒收与分流)比更强检索更能防止知识库烂掉。 证据卡:Scott 描述“存了很多就害怕打开”;Tiago 提出“全收集≈全不可用”。
注意:这里我不会在文章里贴长引用。你真正的“证据链”应该在 Obsidian 卡片里,读者看到的是你对证据的解释 + 可追溯的回链方式。
6.3 LLM Wiki 在这里做什么?只做两件事
召回:帮我从证据库里找“相关证据卡” 结构化输出:给我一个大纲/段落草稿,并且每条结论都列出引用卡片
我会在第 5 篇专门讲一条“输出契约”(Answer Contract):
每条结论必须带引用回链 推断必须标注为推断 证据不足就拒答,并告诉我缺什么证据
这不是洁癖,这是把 AI 从“写得像”改造成“可审计”。它和 RAG 论文中提到的“provenance/更新知识”问题,是同一条主线。
07. 你现在就能做的行动建议(30/60/120 分钟版本)
30 分钟:画出你自己的“六层流水线”
只写模块,不写工具。写清楚每层负责什么、不负责什么。
60 分钟:建立一个“项目页”(把输出当中心)
项目页包含四块就够:
目标读者 & 文章承诺 关键主张(1–3 条) 证据清单(每条主张至少 2 条证据卡回链) 复盘区(发布后写版本日志)
120 分钟:跑通 Casepack-01 的最小闭环
捕获 3 条素材(长文/播客/文章都行) 做 1 张主张卡 + 2 张证据卡 用 LLM Wiki 生成一个大纲(要求“带引用回链”) 写出 300–500 字可发布段落(引用覆盖率先做到 50% 就算胜利)
这套系统的目标只有一个:让你每次写作都不是从零开始,并且每一次输出都会反过来让系统更好用。
我是一只阿木木 | AI数字大脑实践者
扫码加入行动营👇
或搜索公众号:一只阿木木
获取更多Obsidian + AI数字大脑方法论