
OCR/版面/表格/公式全流水线跑在显卡上,PDF 进 Markdown 出,单卡 5090 最快 559 图/秒,比传统 OCR 快 15-90 倍
把 OCR、版面分析、表格、公式识别整条流水线用 C++/CUDA/TensorRT 重写、全塞进一张显卡的开源文档解析服务。不是又一个套壳 VLM——它走的是相反路线:把百度 PP-OCRv6 这类轻量模型工程化到极致,换来了 VLM 方案望尘莫及的速度。
核心差异:快 20 倍,不是快 20%
- 单张 RTX 5090 上,收据类图片 559 张/秒、表单 520 张/秒、密集文档 200+ 张/秒
- 完整结构化解析(版面 + 表格 + 公式)约 20 页/秒;对照组 PaddleOCR-VL 这类 VLM 文档解析器大约 1 页/秒
- 精度只差一点:OmniDocBench 子集 0.90 vs PaddleOCR-VL 的 0.95;英文表单/收据词级 F1 达 92-93%
- 一句话:VLM 赢在"看得懂",它赢在"跑得快"——批量入库场景的速度/成本完全不是一个量级
真正的闭环:PDF 进,Markdown 出
这才是它和普通 OCR 工具拉开差距的地方——不是给你一堆文字框坐标就完事,而是直接产出能进 RAG 知识库的结构化文档:
- 版面分析(PP-DocLayoutV3,25 类区域)+ 阅读顺序重排
- 表格 → HTML,公式 → LaTeX,按需开启
- PDF 原生支持:并行渲染、自动旋转纠正、整本 PDF 一把出 Markdown
- 一行
POST /ocr/pdf?markdown=1直接拿到成品
部署也是闭环
docker run --gpus all -p 8000:8000 -p 50051:50051 \
-v trt-cache:/home/ocr/.cache/turbo-ocr \
ghcr.io/aiptimizer/turboocr:latest
模型权重全部打进镜像,无需挂载、无需下载;首次启动自动编译 TensorRT 引擎(5090 约 90 秒,之后秒启)。HTTP + gRPC 双接口,自带 Prometheus /metrics,纯 C++ 无 Python 依赖。
模型与语言
- 默认 PP-OCRv6,tiny / small / medium 三档,一套模型覆盖中英日
- 阿拉伯语、西里尔、韩语、泰语、希腊语可切换 PP-OCRv5 识别器
- 显存:纯文字约 4GB,全流水线约 8GB
注意
- 目前仅支持 NVIDIA GPU + Linux(Turing 架构 / RTX 20 系起);Apple Metal、Intel OpenVINO 在测试,AMD ROCm 开发中
- MIT 协议,可商用
- 有闲置 N 卡 + 有批量文档要入库(发票、合同、论文、扫描件)的场景,值得优先试它;零散的"看图问答"需求还是留给 VLM
暂无评论
