站内搜索「OCR」共 30 条结果
Unlimited-OCR - 百度开源一次性长文档OCR解析模型
推荐模型
Unlimited-OCR - 百度开源一次性长文档OCR解析模型
百度出品,基于DeepSeek-OCR改进,支持一次性解析超长文档、多页PDF,单图640切片+多页1024两种模式,SGLang部署兼容OpenAI API
3个月前
Qwen3-VL-8B - 阿里中英OCR+视觉理解王者
推荐模型
Qwen3-VL-8B - 阿里中英OCR+视觉理解王者
32语言OCR、256K上下文、视觉Agent可操作GUI,MLX版5GB秒回看图
3个月前
TurboOCR — GPU 极限速度的文档解析器
推荐软件
TurboOCR — GPU 极限速度的文档解析器
OCR/版面/表格/公式全流水线跑在显卡上,PDF 进 Markdown 出,单卡 5090 最快 559 图/秒,比传统 OCR 快 15-90 倍
1个月前
Yangzhai Sanyao Skill
资源Skills
Yangzhai Sanyao Skill
《阳宅三要》双OCR校勘与计算 Skill,支持门主灶、大游年、动宅/变宅翻星、兴废年及卷二至卷四查询
1个月前
《阳宅三要》全书简体可读整理版
推荐玄学基础
《阳宅三要》全书简体可读整理版
清代赵九峰阳宅经典,门、主、灶体系全书 OCR 校读整理,含图式文字说明。
1个月前
Li Juming Fengshui Primer Skill
资源Skills
Li Juming Fengshui Primer Skill
完整 Codex skill:含李居明《学风水的第一本书》OCR/PDF/images 与九宫飞星、三元九运、命卦等确定算法
1个月前
MarkItDown - 微软开源文档转 Markdown 工具
推荐程序员
MarkItDown - 微软开源文档转 Markdown 工具
微软开源的 Python 工具,一键将 PDF/Word/Excel/PPT 等文件转换为 Markdown,支持 OCR 和 MCP
5个月前
PixPin - 强大且免费的截图贴图工具
推荐软件
PixPin - 强大且免费的截图贴图工具
PixPin是一款功能强大的免费截图工具,支持截图、录屏、长截图、OCR文字识别、屏幕贴图等功能。为设计师、开发者、办公人员提供高效的屏幕操作体验。
1年前
MinerU - 文档解析引擎
推荐程序员
MinerU - 文档解析引擎
开源文档解析引擎,OpenDataLab 出品 78k Star。PDF/Word/PPT/Excel/图片一键转 LLM 友好的 Markdown/JSON,公式转 LaTeX、表格转 HTML、跨页表格合并、109 语言 OCR;Pipeline 后端纯 CPU 可跑,VLM 后端精度 95+,另有 mineru.net 在线服务免部署
5个月前
Xuan Kong Feixing Skill
资源Skills
Xuan Kong Feixing Skill
Codex skill for 玄空飞星排盘、81双星断语与《沈氏玄空学》新旧OCR交叉查询
1个月前
《阳宅十书》简体可读整理版
推荐玄学基础
《阳宅十书》简体可读整理版
明代阳宅堪舆资料汇编,整理十章正文:外形、福元、游年、九星、门水、宅形、择日与符镇。
1个月前
Anything → NotebookLM - Claude Code Skill 多源内容智能处理器
推荐程序员
Anything → NotebookLM - Claude Code Skill 多源内容智能处理器
支持微信公众号、YouTube、播客、PDF、300+付费墙绕过等15+种内容源,一键生成播客/PPT/思维导图/Quiz
5个月前
LlamaIndex - 开源 LLM 应用框架与 RAG 数据增强工具包
推荐程序员
LlamaIndex - 开源 LLM 应用框架与 RAG 数据增强工具包
从数据连接、索引构建到检索增强,支持 300+ 集成的 Python LLM 应用开发框架
4个月前
Omniparse — 将任意文档/图片/音视频解析为LLM友好格式
推荐模型
Omniparse — 将任意文档/图片/音视频解析为LLM友好格式
Ingest, parse, and optimize any data format:PDF/Word/PPT/Excel、图片、音频、视频一键转结构化Markdown,专为GenAI框架优化
4个月前
Video Copy Analyzer - AI视频文案拆解分析
推荐api
Video Copy Analyzer - AI视频文案拆解分析
AI驱动的视频字幕提取+文案三维度分析,支持B站/YouTube/抖音,FunASR中文语音转录+RapidOCR烧录字幕识别
4个月前
MiniCPM-V 4.6 - 口袋级多模态大模型,手机端部署的超高效视觉语言模型
推荐模型
MiniCPM-V 4.6 - 口袋级多模态大模型,手机端部署的超高效视觉语言模型
OpenBMB超轻量多模态模型,SigLIP2+Qwen3.5-0.8B,AI Index 13分,三端手机部署
3个月前
Keye-VL — 8B 短视频理解大模型
推荐模型
Keye-VL — 8B 短视频理解大模型
快手开源 8B 多模态模型,专为短视频理解优化,Video-MME 73% 同级最强。
3个月前
中国哲学书电子化计划
推荐玄学基础
中国哲学书电子化计划
三万部古籍、五十亿字的在线开放电子图书馆,支持AI英译与全文检索
3个月前
Phone Harness - 让 AI agent 直接控制你的真实 iPhone
推荐软件
Phone Harness - 让 AI agent 直接控制你的真实 iPhone
不用越狱不用 Xcode,AI agent 直接操控你的真机 iPhone
1个月前
Qwen3.8-27B - 27B多模态新王,终端编程超Opus 4.6 Max
推荐模型
Qwen3.8-27B - 27B多模态新王,终端编程超Opus 4.6 Max
Qwen3.6-27B正统后继:原生多模态+混合线性注意力架构,262K上下文,终端编程基准超Opus 4.6 Max,Apache 2.0可商用,量化后16GB内存可跑
1个月前