
三家最新开源MoE视觉大模型,全部30B级只激活3B,定位完全不同
三家最新开源视觉大模型横评
Qwen / 快手 / 字节各家的最新开源视觉大模型,全部是 MoE 架构、30B 级、只激活 3B。定位仍然完全不同。
| 对比项 | Qwen3.6-35B-A3B | Keye-VL-2.0-30B-A3B | Tarsier2-Recap-7B |
|---|---|---|---|
| 出品 | 阿里 Qwen | 快手 Kwai | 字节 Omni Research |
| 发布时间 | 2026.04 | 2026.05 | 2025.02 |
| 架构 | MoE(35B 总/3B 激活) | MoE(30B 总/3B 激活) | Dense 8.3B(蒸馏) |
| 基座 | Qwen3.6 统一多模态 | Qwen2.5-VL + DSA | Qwen2-VL-7B-Instruct |
| 许可证 | Apache 2.0 | Apache 2.0 | Qwen2-VL 许可 |
| 上下文 | 262K(YaRN 可扩至 1M) | 256K(DSA 稀疏注意力) | 标准 |
| 核心定位 | 全能多模态+编程 Agent | 长视频理解+多模态 Agent | 视频描述专精 |
| 输入模态 | 图像 + 视频 + 文本 | 图像 + 视频 + 文本 | 图像 + GIF + 视频 + 文本 |
| OCR | 通用(CC-OCR 81.0) | 通用 | 非专长 |
| GUI Agent | 支持(ScreenSpot Pro 50.8) | 不支持 | 不支持 |
| 内置 Agent | 无 | Code/Tool/Search Agent | 无 |
| 时间感知 | 通用 | 绝对时间 + 精细时序定位 | 无 |
| Thinking 模式 | 支持(按请求开关) | 5 种模式 | 无 |
Benchmark 对比
| 基准 | Qwen3.6-35B-A3B | Keye-VL-2.0-30B-A3B | Tarsier2-Recap-7B |
|---|---|---|---|
| 图像理解 | |||
| MMBench v1.1 | 92.6 | — | — |
| AI2D | 92.9 | — | — |
| HallusionBench | 70.0 | — | — |
| OmniDocBench 1.5 | 89.9 | — | — |
| RefCOCO (avg) | 90.9 | — | — |
| 视频理解 | |||
| Video-MME (w/o sub) | 82.5 | — | — |
| Video-MME (w/ sub) | 86.6 | — | — |
| Video-MME-v2 | — | 42.4% (512帧) | — |
| VideoMMMU | 83.7 | — | — |
| MLVU (M-Avg) | 86.2 | — | — |
| MVBench | 74.6 | — | — |
| LVBench | 71.4 | — | — |
| LongVideoBench | — | 74.1 | — |
| TimeLens (QVHighlights) | — | 70.1 mIoU | — |
| 视频描述(DREAM-1K) | |||
| DREAM-1K F1 | — | — | 40.7(GPT-4o: 39.2) |
| 幻觉抑制 | |||
| VideoHallucer | — | — | 好 |
| EventHallusion | — | — | 好 |
| 推理/编码 | |||
| GPQA Diamond | 86.0 | — | — |
| AIME 2026 | 92.7 | — | — |
部署与生态
| 对比项 | Qwen3.6-35B-A3B | Keye-VL-2.0-30B-A3B | Tarsier2-Recap-7B |
|---|---|---|---|
| vLLM | 首日支持 | 支持 | 支持 |
| SGLang | 支持 | 支持 | 支持 |
| MLX (Mac) | 社区版 | 未知 | 未知 |
| Ollama | 支持 | 未知 | 未知 |
| GGUF | 社区版丰富 | 有 | 有 |
| 最低显存(4bit) | ~16GB | ~16GB | ~8GB |
| Thinking 模式 | 支持 | 5 种 | 无 |
一句话选型
| 你的需求 | 选谁 |
|---|---|
| 日常全能 VLM + 编程 Agent | Qwen3.6-35B-A3B |
| 长视频理解 + 时序定位 + 多 Agent 协作 | Keye-VL-2.0-30B-A3B |
| 视频转文字描述 / RAG 索引 / 轻量部署 | Tarsier2-Recap-7B |
| 推理/数学/编程能力最强 | Qwen3.6-35B-A3B |
| 小时级长视频 + 精细时间定位 | Keye-VL-2.0-30B-A3B |
| 视频描述超 GPT-4o + 8GB 显存可跑 | Tarsier2-Recap-7B |
链接
- Qwen3.6-35B-A3B:https://huggingface.co/Qwen/Qwen3.6-35B-A3B
- Keye-VL-2.0-30B-A3B:https://huggingface.co/Kwai-Keye/Keye-VL-2.0-30B-A3B
- Tarsier2-Recap-7B:https://huggingface.co/omni-research/Tarsier2-Recap-7b
一句话点评:三家 30B MoE 只激活 3B,推理成本差不多。Qwen3.6 是全能瑞士军刀还带编程;Keye-VL-2.0 是长视频狙击手还带多 Agent;Tarsier2-Recap 是视频描述专用打字机,8GB 显存就能跑。
暂无评论
