# 最新开源视觉大模型横评:Qwen3.6 vs Keye-VL-2.0 vs Tarsier2-Recap > 三家最新开源MoE视觉大模型,全部30B级只激活3B,定位完全不同 ## 三家最新开源视觉大模型横评 Qwen / 快手 / 字节各家的最新开源视觉大模型,全部是 MoE 架构、30B 级、只激活 3B。定位仍然完全不同。 | 对比项 | Qwen3.6-35B-A3B | Keye-VL-2.0-30B-A3B | Tarsier2-Recap-7B | |--------|----------------------|----------------------|----------------------| | **出品** | 阿里 Qwen | 快手 Kwai | 字节 Omni Research | | **发布时间** | 2026.04 | 2026.05 | 2025.02 | | **架构** | MoE(35B 总/3B 激活) | MoE(30B 总/3B 激活) | Dense 8.3B(蒸馏) | | **基座** | Qwen3.6 统一多模态 | Qwen2.5-VL + DSA | Qwen2-VL-7B-Instruct | | **许可证** | Apache 2.0 | Apache 2.0 | Qwen2-VL 许可 | | **上下文** | 262K(YaRN 可扩至 1M) | 256K(DSA 稀疏注意力) | 标准 | | **核心定位** | 全能多模态+编程 Agent | 长视频理解+多模态 Agent | 视频描述专精 | | **输入模态** | 图像 + 视频 + 文本 | 图像 + 视频 + 文本 | 图像 + GIF + 视频 + 文本 | | **OCR** | 通用(CC-OCR 81.0) | 通用 | 非专长 | | **GUI Agent** | 支持(ScreenSpot Pro 50.8) | 不支持 | 不支持 | | **内置 Agent** | 无 | Code/Tool/Search Agent | 无 | | **时间感知** | 通用 | 绝对时间 + 精细时序定位 | 无 | | **Thinking 模式** | 支持(按请求开关) | 5 种模式 | 无 | ### Benchmark 对比 | 基准 | Qwen3.6-35B-A3B | Keye-VL-2.0-30B-A3B | Tarsier2-Recap-7B | |------|--:|--:|--:| | **图像理解** |||| | MMBench v1.1 | **92.6** | — | — | | AI2D | **92.9** | — | — | | HallusionBench | **70.0** | — | — | | OmniDocBench 1.5 | **89.9** | — | — | | RefCOCO (avg) | **90.9** | — | — | | **视频理解** |||| | Video-MME (w/o sub) | **82.5** | — | — | | Video-MME (w/ sub) | **86.6** | — | — | | Video-MME-v2 | — | **42.4% (512帧)** | — | | VideoMMMU | **83.7** | — | — | | MLVU (M-Avg) | **86.2** | — | — | | MVBench | **74.6** | — | — | | LVBench | 71.4 | — | — | | LongVideoBench | — | **74.1** | — | | TimeLens (QVHighlights) | — | **70.1 mIoU** | — | | **视频描述(DREAM-1K)** |||| | DREAM-1K F1 | — | — | **40.7**(GPT-4o: 39.2) | | **幻觉抑制** |||| | VideoHallucer | — | — | 好 | | EventHallusion | — | — | 好 | | **推理/编码** |||| | GPQA Diamond | **86.0** | — | — | | AIME 2026 | **92.7** | — | — | ### 部署与生态 | 对比项 | Qwen3.6-35B-A3B | Keye-VL-2.0-30B-A3B | Tarsier2-Recap-7B | |--------|--:|--:|--:| | vLLM | 首日支持 | 支持 | 支持 | | SGLang | 支持 | 支持 | 支持 | | MLX (Mac) | 社区版 | 未知 | 未知 | | Ollama | 支持 | 未知 | 未知 | | GGUF | 社区版丰富 | 有 | 有 | | 最低显存(4bit) | ~16GB | ~16GB | ~8GB | | Thinking 模式 | 支持 | 5 种 | 无 | ### 一句话选型 | 你的需求 | 选谁 | |----------|------| | 日常全能 VLM + 编程 Agent | **Qwen3.6-35B-A3B** | | 长视频理解 + 时序定位 + 多 Agent 协作 | **Keye-VL-2.0-30B-A3B** | | 视频转文字描述 / RAG 索引 / 轻量部署 | **Tarsier2-Recap-7B** | | 推理/数学/编程能力最强 | **Qwen3.6-35B-A3B** | | 小时级长视频 + 精细时间定位 | **Keye-VL-2.0-30B-A3B** | | 视频描述超 GPT-4o + 8GB 显存可跑 | **Tarsier2-Recap-7B** | ### 链接 - Qwen3.6-35B-A3B:https://huggingface.co/Qwen/Qwen3.6-35B-A3B - Keye-VL-2.0-30B-A3B:https://huggingface.co/Kwai-Keye/Keye-VL-2.0-30B-A3B - Tarsier2-Recap-7B:https://huggingface.co/omni-research/Tarsier2-Recap-7b --- 一句话点评:三家 30B MoE 只激活 3B,推理成本差不多。Qwen3.6 是全能瑞士军刀还带编程;Keye-VL-2.0 是长视频狙击手还带多 Agent;Tarsier2-Recap 是视频描述专用打字机,8GB 显存就能跑。 --- **分类**:模型 **标签**:视频 · Qwen3 · Keye **作者**:子龙 **链接**:https://octohz.com/p/2060