VectifyAI/PageIndex:不要向量库的推理式检索
来源:GitHub — 2026-09-30 · ⭐ 37,063 · Python
📋 概述
PageIndex 给出的答案是「向量无关、基于推理的 RAG」:不建向量库、不做文本切块,而是把文档组织成树状层级索引,让模型像人翻书一样按上下文逐层定位。它由 VectifyAI 维护,MIT 协议。SDK 在 pip install -U pageindex 之后新增了本地模式,可以完全在自己机器上用自带 LLM key 完成索引、检索与问答,也能用 API key 指向官方云;面向纯文本 PDF 的快速树索引 PageIndex Flash 已是本地模式默认的索引方式;另有一层文件级树索引,把这种推理式检索扩展到百万级文档的语料。
🔑 核心要点
- 路线选择很明确:不建向量库、不做切块,改用树状层级索引加推理定位
- 检索方式接近人翻书,先看目录层级再定位到具体段落,保留上下文
- SDK 新增本地模式,pip install -U pageindex 即可用自己的 LLM key 全本地跑索引与问答
- 同一客户端可用 API key 切换到官方托管云,本地与云端共用一套接口
- PageIndex Flash 面向纯文本 PDF 做快速树索引,已是本地模式默认索引方式
- 文件级树索引层把单文档方案扩展成百万级语料的推理式检索,MIT 协议开源
💡 金句
检索的瓶颈往往不是相似度算得不够准,而是把文档切碎之后,上下文就再也拼不回来了。
👍 0
👎 0
← 返回 GitHub Trending 首页