程序员老鬼

book-to-skill:把一本技术书拆成 Claude Code 能随手调用的“技能”

book-to-skill 这个仓库挺直接:把 PDF、EPUB、DOCX、Markdown 这类资料丢进去,它会生成一个 Claude Code skill,放到 ~/.claude/skills/<slug>/ 下面;里面不是一坨原文,而是 SKILL.md、分章节文件、术语表、patterns、cheatsheet 这些东西。

仓库现在已经 4.2k star,热度不算低。

最抓我的其实不是“把书变成知识库”这句话。

这年头谁没见过知识库,RAG、PDF 问答、浏览器插件,满地都是。麻烦在于:你真把一本 400 页技术书塞进上下文,烧 token;你只做关键词搜索,又经常搜到一堆页码,答案还得自己拼。

Image

它换了个思路:先用一次重分析,把书里的框架、术语、设计模式、速查规则拆出来;后面问到哪一章,再加载哪一章。README 里也写得很清楚,章节文件是 on-demand,不相关内容先不进上下文。

这就很现实。

以前做 AI 插件或者小工具,最烦的不是“能不能接上模型”,而是上下文被乱七八糟的文档撑爆。你问一个 replication,结果模型从缓存、索引、CAP、日志全给你糊一遍,听着热闹,落不到书里的那套方法论。

book-to-skill 想干的,就是把书先“编译”一遍:

/book-to-skill ~/books/ddia.pdf
/book-to-skill ~/books/ddia.pdf designing-data-intensive-apps

技术书这块它还专门分了路线:普通文本可以走 pdftotext、PyPDF2、pdfminer;代码块、表格多的书,会建议用 Docling,README 里给的例子是 103 页技术书,Docling 能保住表格和代码块,但耗时明显更长。啧,这地方才是重点。

当然,别急着吹。

Image

这种工具最怕两件事:一是原书结构本身很烂,二是提炼阶段把作者意思压扁。它说“不是原文摘录,而是提炼方法论”,这方向对,但也意味着你得接受一次模型加工。真要做严肃引用,还是得回书里核。

但日常查书、写代码、复盘某个架构概念,我觉得它挺香。尤其适合那种读过一遍、三个月后只记得“好像第七章讲过”的技术书。

GitHub地址:giliojr94/book-to-skill