站内搜索「OCR」共 30 条结果
最新开源视觉大模型横评:Qwen3.6 vs Keye-VL-2.0 vs Tarsier2-Recap
推荐模型
最新开源视觉大模型横评:Qwen3.6 vs Keye-VL-2.0 vs Tarsier2-Recap
三家最新开源MoE视觉大模型,全部30B级只激活3B,定位完全不同
1个月前
Yangzhai Shishu Skill
资源Skills
Yangzhai Shishu Skill
《阳宅十书》双版本校勘与计算 Skill,含332张扫描图、门尺、九星、禄马贵人与日月过宫算法
1个月前
Video-Subtitle-Remover:AI 本地去字幕/去水印工具 (12.6k Star)
推荐软件
Video-Subtitle-Remover:AI 本地去字幕/去水印工具 (12.6k Star)
基于 STTN/LaMA/ProPainter 等多算法的视频硬字幕和文本水印去除工具,完全本地运行,支持 Windows/Mac/Linux/Docker
1个月前
Google Gemma 4 12B - 无编码器多模态大模型
推荐模型
Google Gemma 4 12B - 无编码器多模态大模型
Google DeepMind 开源多模态模型,11.95B参数支持文本+图像+音频,256K上下文,原生函数调用,Apache 2.0免费商用
3个月前
过了40岁这些食物不上桌:长寿家族私人厨师的12条饮食规矩
推荐食疗
过了40岁这些食物不上桌:长寿家族私人厨师的12条饮食规矩
罗斯柴尔德家族私人厨师的不谈判规矩:晚上不吃水果、戒掉种子油、早餐推迟到12点……第12条最扎心
1个月前
觉醒者的最高层次:破一切相(七层全文+出处考证)
推荐修心
觉醒者的最高层次:破一切相(七层全文+出处考证)
破文字相、破关系相、破情绪相、破时间相、破观念相、破我相、破执着相——骨架是金刚经,收尾是道德经
1个月前
Qwen3-Omni - 30B原生全模态,能看能听还能说
推荐模型
Qwen3-Omni - 30B原生全模态,能看能听还能说
甩一段视频进去,画面内容、背景音乐、音效、对白全给你分析出来——阿里原生全模态模型,30B只激活3B,还能直接用语音回答你,Apache 2.0
26天前
MOSS-VL:边看边答的开源实时视频理解模型
推荐软件
MOSS-VL:边看边答的开源实时视频理解模型
复旦OpenMOSS开源11B实时视频理解模型:边看边答、主动沉默、动态纠错,NF4版单卡24G可跑
26天前
Jin Suo Yu Guan Skill
资源Skills
Jin Suo Yu Guan Skill
Codex skill for 金锁玉关二十四山砂水、流年元运计算与三套扫描资料查询
1个月前
Qwen开源模型全家桶选购指南(3.5/3.6/3.8全系列)
推荐模型
Qwen开源模型全家桶选购指南(3.5/3.6/3.8全系列)
从0.8B到397B全覆盖,编程/视觉/推理/端侧一张表选对模型
1个月前