云图AI云图AI
P

PageIndex

MITPython

📑 PageIndex: Document Index for Vectorless, Reasoning-based RAG

36kFork 3k更新于 2026-09-14

软件介绍

PageIndex 是一个无向量、基于推理的 RAG 系统,通过构建文档的层次化树索引,利用 LLM 进行推理式检索,实现上下文感知、可追溯和可解释的信息检索,无需向量数据库或分块处理。

核心功能

无向量数据库:基于文档结构和 LLM 推理进行检索,而非向量相似度搜索。
无分块:文档按自然章节组织,而非人工分块。
更好的可追溯性与可解释性:检索由推理驱动,结果可追溯到明确的页面和章节引用。
上下文感知检索:检索依赖于完整上下文(如对话历史、领域知识),易于融入新上下文。
类人检索:模拟人类专家在复杂文档中导航和提取知识的方式。

适用场景

金融报告分析(如 SEC 文件、财报披露)法律文档检索与审查技术手册与学术文献的问答医疗文献与监管文件的精准信息提取任何需要深度理解的长篇专业文档检索

Docker 部署

docker build -t pageindex . && docker run -it --rm -v $(pwd):/app -e OPENAI_API_KEY=your_openai_key_here pageindex python3 run_pageindex.py --pdf_path /app/your_document.pdf

FAQ

PageIndex 与传统向量 RAG 有何不同?

PageIndex 不使用向量数据库或分块,而是通过构建文档的层次化树索引,并利用 LLM 进行推理式检索,实现上下文感知、可解释的检索,而非基于语义相似度的模糊匹配。

PageIndex 支持哪些部署方式?

支持自托管(开源仓库)、云服务(通过 MCP 或 API)以及企业级部署(VPC 或本地)。

PageIndex 的检索准确率如何?

在 FinanceBench 金融文档 QA 基准上,基于 PageIndex 的 Mafin 2.5 系统达到了 98.7% 的准确率,显著优于传统向量 RAG。