我踩坑搭出的 AI 知识库,不是收藏夹,是会迭代的第二大脑
简短总结:这篇文章讲的是,怎么把一个普通文件夹变成可自我迭代的 AI 知识库。核心判断是:真正有用的知识库不是把资料都丢进去,而是让 AI 先维护索引,再根据索引去找答案。适合想搭个人第二大脑、企业知识库、内容资料库的人读。
AI 大神 Karpathy 的 llm-wiki 知识库管理理念早被吹上天了,但没人告诉你这东西到底怎么落地。
我自己踩了一个月的坑,现在把路趟平了给你。
今天这篇内容,会从原理、搭建、实操、踩坑四个部分,把一个可自我迭代的个人和企业第二大脑知识库讲清楚。
原理很简单:AI 先翻索引,不是先翻全库
一句话讲清楚原理:
以前是你自己翻全部文件找信息,现在是 AI 替你维护一个总目录。
找信息时,它先翻目录,目录指哪,它去哪。
而且这个目录不需要你手动维护,大模型可以自动完成。
这就像你去图书馆。没有索引电脑,你得从头到尾一本本书找,得多费劲。有了索引电脑,输入书名,直接告诉你几楼几排几号。
为什么要这么做?
因为大多数人建知识库,就是把文件全丢进去。稍微好点的,按目录分好方便自己看。
但本质没变。
每次提问,AI 还是把所有文件从头翻一遍。文件越多越慢,Token 越烧越多。更亏的是,这次查完,下次一样从头来过。
这套方案只改了一个动作:
AI 不翻全库,先翻索引。
你每次丢资料进去,AI 自动提炼摘要、提取概念、建立关联,全写进一个总目录。
以后提问,AI 先翻目录,目录告诉它去哪几个文件找答案。又快,又准。
有价值的回答还能自动沉淀,下次直接复用。
它不只快,还能自己迭代。
初始化时,先把骨架搭对
明白原理之后,搭建实现其实不复杂。
首先准备几个工具:
- 下载 Karpathy 开源的
llm-wiki.md。 - 准备一个 Agent 工具,例如 OpenClaw、Codex、Claude Code 等。
- 准备一个知识库工具。这里我更推荐 Obsidian,因为它非云端,文件在本地,自由接入大模型,也更安全。
- 如果用 Claude Code,可以在 Obsidian 里装 Claudian 插件,方便直接在 Obsidian 中使用大模型编辑文档。
如果你不用 Claude Code,也没关系。
直接用你手上的 Agent 工具打开知识库目录,编辑的文件会自动同步到 Obsidian。
接下来就是初始化。
把 llm-wiki.md 放到空知识库目录的根目录下,然后对 Agent 说:
“请基于 llm-wiki.md 的指导,帮我在当前文件夹初始化我的知识库。”
大模型执行完成之后,会自动创建基础的 raw 和 wiki 文件夹,以及 index.md、log.md、CLAUDE.md 这几个关键文件。
这里有两个坑一定要检查。
第一个,文件位置可能跑错。
不同环境、不同模型初始化时,虽然 raw 和 wiki 文件夹都有了,但 index.md、log.md、CLAUDE.md 可能不在根目录。后面会全乱。
第二个,CLAUDE.md 内容太简单,甚至没生成。
这个文件是后面所有操作的基础,缺了不行。
为了减少不稳定因素,初始化之后一定要检查根目录结构,不要以为工具跑完就万事大吉。
真正使用时,是 ingest、query、lint 三个动作
初始化好了之后,基础文件夹和文件都具备了。
接下来就是实践。
首先,把确定好的参考文件丢进 raw 文件夹。比如我把 Dan Koe 的一篇长文放进去。
这时候知识库关系图谱通常还是散乱的。
然后打开 Agent 对话窗口,发送指令:
“请帮我对 raw 文件夹的某个文件进行 ingest 索引操作。”
大模型会自动解析源文件,生成摘要文件、实体名词、相关概念,并且更新 index.md 和 log.md。
这时候你再去看关系图谱,如果能看到由 index.md 出发的完整关系图谱,而不是散落的点,就证明这一步成功了。
到这里,资料输入和索引操作就完成了。
接下来是查询。
当你提出问题时,它的搜索链路应该是清晰的:
- 先通过
index.md找到相关摘要页、实体名词和概念。 - 利用概念索引判断问题背后的核心概念。
- 利用实体名词索引分析涉及哪些人物、组织、工具。
- 找到相关摘要页面,能从摘要回答就直接引用摘要;不够时再通过反向链接找到源文件。
- 检查分析页面是否有之前做过类似的分析。
- 综合找到的信息回答问题,如果回答有质量,值得保留,就创建新的分析页面供以后复用。
发现没有?
它不是把知识库当成一个大垃圾桶。
它是通过系统理念提高查询效率,又通过分析沉淀,让知识库持续生长。
这套系统还离不开第三个动作:定期 lint。
你可以直接对 Agent 说:
“帮我进行 Lint 操作维护知识库。”
它会检查矛盾、过时内容、孤立页面、缺失页面、缺失交叉引用,以及新的探索方向。
这才是这套系统健壮的另一个核心原因。
几个最容易踩的坑
跟着做的过程中,有几个坑大概率会遇到。
第一个,是索引文件跑错位置、关系图谱链接连不上。
最常见的一种情况是,索引文件本来应该在 wiki 文件夹,但跑到了 raw 文件夹里。
还有一种是文件名带了引号、特殊符号,Obsidian 关系图谱连不上。
这两个坑的解法类似:提前在 CLAUDE.md 里写好路径规约和命名规范。
第二个,是一次喂太多,中途断了。
一次 ingest 几十个文件,大模型可能跑到一半因为上下文、Token 或额度原因中断。
所以要控制批次。文件多就分批跑,不要指望一次性吞完。
第三个,是自己的内容不知道往哪放。
这是 Karpathy 原版没提、但你一定会遇到的问题。
raw 适合放外部参考,ingest 也更适合处理这些不会变化的源材料。
但你自己的认知、创作、日记会持续变化,不能完全套同一套索引逻辑。
更合理的做法,是在 wiki 下新建个人目录放这些内容,用另一套方式维护。
别停留在收藏,真的做出来
如果你已经感受到这套知识库的价值,切记别停留在收藏。
一定要找时间跟着做出来。
因为这不是一个“资料夹更整齐”的问题。
它关系到你在 AI 时代有没有关键护城河。
这套系统搭好之后,你每丢进一条信息,它都在帮你变得更聪明。
它不是收藏夹。
它是会思考的第二大脑。
最后的判断
大多数人做知识库,停在“我把资料放进去了”。
但 AI 时代真正有用的知识库,不是存资料,而是建立一套能索引、能查询、能沉淀、能维护的系统。
如果它不能自己迭代,它就只是一个更大的文件夹。
如果它能自己迭代,它才开始变成你的第二大脑。
相关内容
- 待补充