用闲置电脑搭一个私人 AI 知识库:我的完整踩坑记录

把散落的 PDF、笔记、网页剪藏喂给本地大模型,随问随答。方案选型、切片参数、翻车现场全记录。

家里那台吃灰的旧电脑,其实可以变成一个只属于你的 AI 知识库:把课件、说明书、工作笔记、网页剪藏全部喂进去,然后用自然语言随时提问,所有数据不出家门。这是我折腾一圈的完整记录。

方案选型

  • 一体化工具(Open WebUI 的知识库功能、AnythingLLM 等):图形界面、开箱即用,适合不想碰代码的人,我最终留下的方案。
  • 笔记软件 + AI 插件:如果你的知识已经整理在 Obsidian/Logseq 里,直接对接最省事,缺点是对 PDF 等异构文档支持一般。
  • 自建 RAG 脚本:灵活度最高,可以定制检索策略,但维护成本高,适合开发者。

我的建议:先用一体化工具验证需求,确实有更复杂的需求再考虑自建。

核心流程只有三步

  1. 灌文档:PDF、Word、Markdown、网页文本都能吃;扫描件需要额外 OCR。
  2. 建索引:工具会把文档切片并计算向量,几百份文档在普通电脑上几分钟完成。
  3. 提问:检索命中的片段连同问题一起交给本地大模型,生成带引用来源的回答。

我踩过的三个坑

  1. 切片大小不合理:切太碎会丢失上下文,切太大检索不准。默认参数不行时,把切片调到 500-800 字再试,效果立刻不同。
  2. 扫描版 PDF 是天坑:图片型 PDF 直接灌进去等于没灌,先过一遍 OCR,没有捷径。
  3. 嵌入模型被忽视:检索质量一半靠嵌入模型。中文文档优先选中文友好的嵌入模型,这一步提升比换大模型还明显。

实际体验

设备是 8GB 显存的旧游戏本,7B 模型 + 中文嵌入模型,问答延迟在可接受范围。最惊喜的是”带页码引用”——查说明书、翻旧笔记的效率翻倍,再也不用全文搜索碰运气了。

旧电脑别卖,先拿来干这个。

Leave a Reply

Your email address will not be published. Required fields are marked *