
用 Paperless-ngx 整理扫描件:VPS 部署、中文 OCR 与全文检索
用 Docker Compose 在 VPS 部署 Paperless-ngx 3.2.1,将扫描 PDF 和图片整理为可检索的文档库。详解中文 OCR、Caddy HTTPS、消费目录、多用户权限与站外导出恢复。
18 min
共 8 篇文章

用 Docker Compose 在 VPS 部署 Paperless-ngx 3.2.1,将扫描 PDF 和图片整理为可检索的文档库。详解中文 OCR、Caddy HTTPS、消费目录、多用户权限与站外导出恢复。
实测 pdf-inspector 1.24.0 的原生抽取、逐页索引和离线自动模式,说明当前可选 OCR 依赖、混合文档路由及表格、中文和失败结果检查。
pdf-inspector 用 Rust 核心把 PDF 分类、阅读顺序、表格抽取和 Markdown 生成放到本地完成,适合作为文档流水线与 RAG 的第一层路由,而不是把所有文档都先扔给 OCR。
围绕跨页表格设计 Unlimited-OCR 评估,解释 R-SWA 的作用范围、多页输入、输出完整性、重复处理和服务化成本,不把论文结果当作本机实测。
从 AI 产品和工程基础设施角度分析 Baidu Unlimited-OCR:长文档一次性解析、R-SWA、三种推理路径与真实落地边界,决定了它更像文档智能管线的一块底座。
面向动手验证的 Baidu Unlimited-OCR 指南:梳理 Transformers、SGLang、vLLM 三条路径,以及单图、多页、PDF 转图、重复输出和布局质量的验收方法。
以参数表格问答为例设计 MinerU 文档入库验收,更新 4.0 的入口、页范围和输出协议,并说明表格、公式、引用、版本回退与权限处理。