SOTA Sync
全部文章
工具与行动2026-05-29

LlamaIndex 用 Rust 重写文档解析器:457 页 PDF 0.7 秒解析

LiteParse v2 用 Rust 重写文档解析核心,支持 Python、Node、Rust 和浏览器,面向 RAG 与文档代理提供更快的本地解析能力。

LlamaIndex 的 LiteParse v2 把文档解析核心用 Rust 重写了。原文给出的标志性数据很直接:457 页、100MB 的 PDF,解析耗时 0.777 秒。

这不是一个单纯的性能更新。LiteParse 面向的是 AI 应用里最基础但最容易被低估的一层:把 PDF、Office 文档、图片等复杂文件变成模型可以消费的结构化文本。

#为什么要重写成 Rust

LiteParse v1 使用 Node.js。对小文档来说,Node 进程启动和运行时开销会明显影响延迟;对大文档来说,内存管理、并发能力和底层解析效率都会成为瓶颈。

v2 换成 Rust 后,小文档速度提升 5 到 100 倍,大文档也有约 3 倍提升。Rust 的意义不只是“更快”,还在于它可以作为同一套核心代码,被绑定到多个运行环境里。

#支持的平台和格式

LiteParse v2 同时覆盖 Python、Node/TypeScript、Rust 和 WASM。Python 用户可以直接 pip install liteparse,Node 用户用 npm i @llamaindex/liteparse,Rust 用户可以安装 crate 或 CLI,浏览器端也可以通过 WASM 在本地运行。

输入格式覆盖 PDF、DOCX、XLSX、PPTX 和图片。输出有三类:结构化 JSON、保留版面的纯文本,以及页面截图 PNG。结构化 JSON 带文本定位和 bounding box,适合需要坐标信息的文档理解任务。

#OCR 和 RAG 的关系

LiteParse 内置 Tesseract,也支持外接 HTTP OCR 服务。它会先用 PDFium 提取原生文本,再对扫描页或图片页做选择性 OCR,最后合并结果并恢复空间布局。

这对 RAG 很关键。很多 RAG 失败不是检索模型的问题,而是文档解析阶段已经把表格、段落、页眉页脚、坐标关系处理坏了。解析层越稳定,后面的 chunking、embedding、rerank 和答案生成才越可靠。

#真正的价值

AI 应用越本地化,文档解析就越像基础设施。一个能在 Python、Node、Rust 和浏览器里跑的解析器,意味着开发者可以在服务器、CLI、本地应用和前端环境里复用同一套能力。

LiteParse v2 的重点不是“又一个 PDF 工具”,而是把文档摄取这条链路做成更快、更可移植、更接近本地优先的底层组件。