最新开源视觉大模型横评:Qwen3.6 vs Keye-VL-2.0 vs Tarsier2-Recap

最新开源视觉大模型横评:Qwen3.6 vs Keye-VL-2.0 vs Tarsier2-Recap


三家最新开源MoE视觉大模型,全部30B级只激活3B,定位完全不同

三家最新开源视觉大模型横评

Qwen / 快手 / 字节各家的最新开源视觉大模型,全部是 MoE 架构、30B 级、只激活 3B。定位仍然完全不同。

对比项Qwen3.6-35B-A3BKeye-VL-2.0-30B-A3BTarsier2-Recap-7B
出品阿里 Qwen快手 Kwai字节 Omni Research
发布时间2026.042026.052025.02
架构MoE(35B 总/3B 激活)MoE(30B 总/3B 激活)Dense 8.3B(蒸馏)
基座Qwen3.6 统一多模态Qwen2.5-VL + DSAQwen2-VL-7B-Instruct
许可证Apache 2.0Apache 2.0Qwen2-VL 许可
上下文262K(YaRN 可扩至 1M)256K(DSA 稀疏注意力)标准
核心定位全能多模态+编程 Agent长视频理解+多模态 Agent视频描述专精
输入模态图像 + 视频 + 文本图像 + 视频 + 文本图像 + GIF + 视频 + 文本
OCR通用(CC-OCR 81.0)通用非专长
GUI Agent支持(ScreenSpot Pro 50.8)不支持不支持
内置 Agent无Code/Tool/Search Agent无
时间感知通用绝对时间 + 精细时序定位无
Thinking 模式支持(按请求开关)5 种模式无

Benchmark 对比

基准Qwen3.6-35B-A3BKeye-VL-2.0-30B-A3BTarsier2-Recap-7B
图像理解
MMBench v1.192.6——
AI2D92.9——
HallusionBench70.0——
OmniDocBench 1.589.9——
RefCOCO (avg)90.9——
视频理解
Video-MME (w/o sub)82.5——
Video-MME (w/ sub)86.6——
Video-MME-v2—42.4% (512帧)—
VideoMMMU83.7——
MLVU (M-Avg)86.2——
MVBench74.6——
LVBench71.4——
LongVideoBench—74.1—
TimeLens (QVHighlights)—70.1 mIoU—
视频描述(DREAM-1K)
DREAM-1K F1——40.7(GPT-4o: 39.2)
幻觉抑制
VideoHallucer——好
EventHallusion——好
推理/编码
GPQA Diamond86.0——
AIME 202692.7——

部署与生态

对比项Qwen3.6-35B-A3BKeye-VL-2.0-30B-A3BTarsier2-Recap-7B
vLLM首日支持支持支持
SGLang支持支持支持
MLX (Mac)社区版未知未知
Ollama支持未知未知
GGUF社区版丰富有有
最低显存(4bit)~16GB~16GB~8GB
Thinking 模式支持5 种无

一句话选型

你的需求选谁
日常全能 VLM + 编程 AgentQwen3.6-35B-A3B
长视频理解 + 时序定位 + 多 Agent 协作Keye-VL-2.0-30B-A3B
视频转文字描述 / RAG 索引 / 轻量部署Tarsier2-Recap-7B
推理/数学/编程能力最强Qwen3.6-35B-A3B
小时级长视频 + 精细时间定位Keye-VL-2.0-30B-A3B
视频描述超 GPT-4o + 8GB 显存可跑Tarsier2-Recap-7B

链接


一句话点评:三家 30B MoE 只激活 3B,推理成本差不多。Qwen3.6 是全能瑞士军刀还带编程;Keye-VL-2.0 是长视频狙击手还带多 Agent;Tarsier2-Recap 是视频描述专用打字机,8GB 显存就能跑。

8600举报0子龙•1个月前
点击获取 ^_^
被收录:

暂无评论