TurboOCR — GPU 极限速度的文档解析器

TurboOCR — GPU 极限速度的文档解析器


OCR/版面/表格/公式全流水线跑在显卡上,PDF 进 Markdown 出,单卡 5090 最快 559 图/秒,比传统 OCR 快 15-90 倍

把 OCR、版面分析、表格、公式识别整条流水线用 C++/CUDA/TensorRT 重写、全塞进一张显卡的开源文档解析服务。不是又一个套壳 VLM——它走的是相反路线:把百度 PP-OCRv6 这类轻量模型工程化到极致,换来了 VLM 方案望尘莫及的速度。

核心差异:快 20 倍,不是快 20%

  • 单张 RTX 5090 上,收据类图片 559 张/秒、表单 520 张/秒、密集文档 200+ 张/秒
  • 完整结构化解析(版面 + 表格 + 公式)约 20 页/秒;对照组 PaddleOCR-VL 这类 VLM 文档解析器大约 1 页/秒
  • 精度只差一点:OmniDocBench 子集 0.90 vs PaddleOCR-VL 的 0.95;英文表单/收据词级 F1 达 92-93%
  • 一句话:VLM 赢在"看得懂",它赢在"跑得快"——批量入库场景的速度/成本完全不是一个量级

真正的闭环:PDF 进,Markdown 出

这才是它和普通 OCR 工具拉开差距的地方——不是给你一堆文字框坐标就完事,而是直接产出能进 RAG 知识库的结构化文档:

  • 版面分析(PP-DocLayoutV3,25 类区域)+ 阅读顺序重排
  • 表格 → HTML,公式 → LaTeX,按需开启
  • PDF 原生支持:并行渲染、自动旋转纠正、整本 PDF 一把出 Markdown
  • 一行 POST /ocr/pdf?markdown=1 直接拿到成品

部署也是闭环

docker run --gpus all -p 8000:8000 -p 50051:50051 \
  -v trt-cache:/home/ocr/.cache/turbo-ocr \
  ghcr.io/aiptimizer/turboocr:latest

模型权重全部打进镜像,无需挂载、无需下载;首次启动自动编译 TensorRT 引擎(5090 约 90 秒,之后秒启)。HTTP + gRPC 双接口,自带 Prometheus /metrics,纯 C++ 无 Python 依赖。

模型与语言

  • 默认 PP-OCRv6,tiny / small / medium 三档,一套模型覆盖中英日
  • 阿拉伯语、西里尔、韩语、泰语、希腊语可切换 PP-OCRv5 识别器
  • 显存:纯文字约 4GB,全流水线约 8GB

注意

  • 目前仅支持 NVIDIA GPU + Linux(Turing 架构 / RTX 20 系起);Apple Metal、Intel OpenVINO 在测试,AMD ROCm 开发中
  • MIT 协议,可商用
  • 有闲置 N 卡 + 有批量文档要入库(发票、合同、论文、扫描件)的场景,值得优先试它;零散的"看图问答"需求还是留给 VLM

GitHub: https://github.com/aiptimizer/TurboOCR

5100举报0子龙•1个月前
点击获取 ^_^
被收录:

暂无评论