站内搜索「OCR」共 30 条结果

推荐模型
Unlimited-OCR - 百度开源一次性长文档OCR解析模型百度出品,基于DeepSeek-OCR改进,支持一次性解析超长文档、多页PDF,单图640切片+多页1024两种模式,SGLang部署兼容OpenAI API
3个月前

推荐软件
TurboOCR — GPU 极限速度的文档解析器OCR/版面/表格/公式全流水线跑在显卡上,PDF 进 Markdown 出,单卡 5090 最快 559 图/秒,比传统 OCR 快 15-90 倍
1个月前

资源Skills
Li Juming Fengshui Primer Skill完整 Codex skill:含李居明《学风水的第一本书》OCR/PDF/images 与九宫飞星、三元九运、命卦等确定算法
1个月前

推荐程序员
MarkItDown - 微软开源文档转 Markdown 工具微软开源的 Python 工具,一键将 PDF/Word/Excel/PPT 等文件转换为 Markdown,支持 OCR 和 MCP
5个月前

推荐软件
PixPin - 强大且免费的截图贴图工具PixPin是一款功能强大的免费截图工具,支持截图、录屏、长截图、OCR文字识别、屏幕贴图等功能。为设计师、开发者、办公人员提供高效的屏幕操作体验。
1年前

推荐程序员
MinerU - 文档解析引擎开源文档解析引擎,OpenDataLab 出品 78k Star。PDF/Word/PPT/Excel/图片一键转 LLM 友好的 Markdown/JSON,公式转 LaTeX、表格转 HTML、跨页表格合并、109 语言 OCR;Pipeline 后端纯 CPU 可跑,VLM 后端精度 95+,另有 mineru.net 在线服务免部署
5个月前

推荐程序员
Anything → NotebookLM - Claude Code Skill 多源内容智能处理器支持微信公众号、YouTube、播客、PDF、300+付费墙绕过等15+种内容源,一键生成播客/PPT/思维导图/Quiz
5个月前

推荐模型
Omniparse — 将任意文档/图片/音视频解析为LLM友好格式Ingest, parse, and optimize any data format:PDF/Word/PPT/Excel、图片、音频、视频一键转结构化Markdown,专为GenAI框架优化
4个月前

推荐api
Video Copy Analyzer - AI视频文案拆解分析AI驱动的视频字幕提取+文案三维度分析,支持B站/YouTube/抖音,FunASR中文语音转录+RapidOCR烧录字幕识别
4个月前

推荐模型
MiniCPM-V 4.6 - 口袋级多模态大模型,手机端部署的超高效视觉语言模型OpenBMB超轻量多模态模型,SigLIP2+Qwen3.5-0.8B,AI Index 13分,三端手机部署
3个月前

推荐模型
Qwen3.8-27B - 27B多模态新王,终端编程超Opus 4.6 MaxQwen3.6-27B正统后继:原生多模态+混合线性注意力架构,262K上下文,终端编程基准超Opus 4.6 Max,Apache 2.0可商用,量化后16GB内存可跑
1个月前








