一只阿木木

我把知识管理做成一条“内容流水线”:Hermes→Obsidian→LLM Wiki 一张总图讲透(附可复用架构模板)

我把知识管理做成一条“内容流水线”:Hermes→Obsidian→LLM Wiki 一张总图讲透(附可复用架构模板)

我后来才明白:知识管理失败,往往不是你记得不够多,而是你让“任何东西”都能进库。
而 AI 写作失败,也不是模型不够强,而是你给它的输入不可追溯、不可审计、不可复用——它只能“写得像”,却很难“写得对、写得稳”。

下面这篇文章,我会用深度研究 + 框架 + 贯穿案例把整套系统讲透:Hermes × Obsidian × LLM Wiki 为什么能复利、复利发生在哪里、你该如何把它跑成一个闭环。


01. 痛点先讲透:为什么你收藏越多,越不敢打开?

如果你有过这种体验,你就会知道“信息太多”不是问题,“未来自己要还的整理债”才是问题。

在 Scott Young 采访 Tiago Forte 的《Building A Second Brain》播客全文稿里,Scott 描述过一个非常典型的场景:他疯狂 web clip,最后“存了百万条”,甚至害怕打开笔记软件,因为里面“太多了”,他知道自己也不会再看,只是在“把东西送进虚空”。

Tiago 在同一段对话里补了一刀:当你“什么都收集”,结果可能等同于“什么都没收集”,因为你保存了,但知识不可被访问、不可被使用。

这就是我做这套系统的起点:
我不想再做“收藏者”,我想做“能把素材变成输出的人”。


02. 我这篇文章的承诺(可量化,但不编数据)

我不在这里报“效率提升 300%”这种漂亮数字。相反,我只给你一套可审计指标,你跑一周就能自己验证收益。

从今天开始,你只需要记录 6 个指标(每篇系列都会复用它们):

  • Capture→Asset(分钟):一条素材从捕获到变成“可引用卡片”的用时
  • Asset→Ship(分钟):从卡片到输出(段落/大纲/提案)的用时
  • 引用覆盖率(%):文章段落里“带证据回链”的比例
  • Inbox 老化率(%):进入 Inbox 超过 7 天未处理占比
  • 复用次数(次):同一张卡被多少个项目页/文章引用
  • 检索命中率(%):你问一个问题,LLM Wiki 能返回“可用引用”的比例

这套指标的好处是:不依赖热点、不依赖某个工具版本、只依赖你的流程是否跑通。


03. 为什么我坚持“可追溯”?(研究依据:AI 幻觉不是小问题)

如果你把 AI 当成写作加速器,最大的风险不是“它偶尔写错”,而是它会在你没意识到的时候,把错误写得很流畅、很像真的。

一篇 arXiv 综述论文明确指出:LLM 可能因为训练数据偏差、提示词歧义等原因产生不可靠内容;而这在医疗记录总结、金融分析等敏感任务里尤其危险。该综述系统性整理了32+ 种幻觉缓解技术,并把 RAG(检索增强生成)等列为重要方法之一,还讨论了这些方法的挑战与局限。

更早的 RAG 经典论文也点出了一个关键现实:纯参数模型虽然在参数里“存了知识”,但在知识密集任务上,访问与精确操控知识的能力仍受限;同时,“为决策提供来源(provenance)”与“更新世界知识”仍是开放问题。RAG 的方向,是把可检索的外部知识作为一种“非参数记忆”接入生成过程。

所以我给自己的系统立了一条铁律:

LLM 可以帮我写,但不能替我负责。
我必须能把每条关键结论回链到证据卡/原文。


04. 一张总架构图:复利系统不是“工具堆叠”,而是“闭环”

你可以把 Hermes × Obsidian × LLM Wiki 理解为:
一个把信息变成可复用资产,再把资产变成稳定输出的流水线。

4.1 六层流水线 + 两个回路(我的总架构)

mermaid

flowchart LR
A[外部信息源\n文章/书/播客/会议/聊天] --> B[Hermes 输入管道\n采集/去噪/打标签/路由]
B --> C[Obsidian Inbox\n待处理]
C --> D[加工层\n摘录→主张→证据→边界→链接]
D --> E[Obsidian 知识库\n证据库/概念库/项目库]
E --> F[LLM Wiki 服务层\n索引/检索/RAG/引用回链]
F --> G[输出层\n文章/视频/课件/咨询交付]
G --> H[反馈层\n复盘/数据/版本迭代]
H --> D
H --> B

4.2 每层只做一件事(避免“什么都想解决”)

  • Hermes(入口治理):解决“信息污染”。该拒收就拒收,该分流就分流。
  • Obsidian(事实底座):你的“可编辑、可链接、可长期维护”的主库。
  • LLM Wiki(召回与结构化输出):让知识库变成“可对话的研究助理”,但输出必须带回链。
  • 输出层(项目页):复利发生的地方——资产被真实调用。
  • 反馈层(版本日志):让系统越跑越稳,而不是越跑越乱。

05. 复利到底发生在哪里?答案:发生在“项目”,不是发生在“存储”

很多人把精力用在“存得更好”,但复利不是来自“存储更精致”,而来自:

  1. 同一份资产(主张/证据/边界)
  2. 在 不同项目(文章/视频/咨询/课程)里
  3. 被 多次调用,并且调用成本越来越低

Tiago Forte 在 Progressive Summarization 的文章里提到一个很重要的原则:要在“细节”和“可发现性”之间做平衡,并通过“机会式压缩”让笔记在每次触碰时变得更可用。

我的解释是:
你不是在“整理笔记”,你是在降低未来某个项目的调用成本。
所以输出层(Project)必须是中心。


06. 贯穿案例(Casepack-01):我如何用同一套素材跑通最小闭环

为了保证整个系列不是讲概念,我会用同一个素材包贯穿 6 篇文章(你也可以照抄这个结构):

  • 研究底盘:幻觉缓解综述(arXiv 2401.01313)
  • 痛点叙事:BASB 访谈全文稿(Scott Young × Tiago Forte)
  • 加工原则:Progressive Summarization VI(可发现性/机会式压缩)

6.1 Hermes 入口最小元数据(4 个字段就够)

每条素材进库时,只强制写 4 个字段:

  • source_url(或书名/会议)
  • captured_at
  • why_it_matters(一句话用途:未来用在哪个输出)
  • route(writing / research / project / idea)

这一步的“反直觉”在于:
我宁愿多花 10 秒写用途句,也不愿未来花 2 小时在垃圾堆里捞信号。

6.2 在 Obsidian 里产出一对“可回链资产”:主张卡 + 证据卡

示例主张(来自播客稿的痛点):

  • 主张卡:入口治理(拒收与分流)比更强检索更能防止知识库烂掉。
  • 证据卡:Scott 描述“存了很多就害怕打开”;Tiago 提出“全收集≈全不可用”。

注意:这里我不会在文章里贴长引用。你真正的“证据链”应该在 Obsidian 卡片里,读者看到的是你对证据的解释 + 可追溯的回链方式。

6.3 LLM Wiki 在这里做什么?只做两件事

  1. 召回:帮我从证据库里找“相关证据卡”
  2. 结构化输出:给我一个大纲/段落草稿,并且每条结论都列出引用卡片

我会在第 5 篇专门讲一条“输出契约”(Answer Contract):

  • 每条结论必须带引用回链
  • 推断必须标注为推断
  • 证据不足就拒答,并告诉我缺什么证据

这不是洁癖,这是把 AI 从“写得像”改造成“可审计”。它和 RAG 论文中提到的“provenance/更新知识”问题,是同一条主线。


07. 你现在就能做的行动建议(30/60/120 分钟版本)

30 分钟:画出你自己的“六层流水线”

只写模块,不写工具。写清楚每层负责什么、不负责什么。

60 分钟:建立一个“项目页”(把输出当中心)

项目页包含四块就够:

  • 目标读者 & 文章承诺
  • 关键主张(1–3 条)
  • 证据清单(每条主张至少 2 条证据卡回链)
  • 复盘区(发布后写版本日志)

120 分钟:跑通 Casepack-01 的最小闭环

  • 捕获 3 条素材(长文/播客/文章都行)
  • 做 1 张主张卡 + 2 张证据卡
  • 用 LLM Wiki 生成一个大纲(要求“带引用回链”)
  • 写出 300–500 字可发布段落(引用覆盖率先做到 50% 就算胜利)

这套系统的目标只有一个:让你每次写作都不是从零开始,并且每一次输出都会反过来让系统更好用。


我是一只阿木木 | AI数字大脑实践者

扫码加入行动营👇

Image

或搜索公众号:一只阿木木
获取更多Obsidian + AI数字大脑方法论