MOSS-VL:边看边答的开源实时视频理解模型

MOSS-VL:边看边答的开源实时视频理解模型


复旦OpenMOSS开源11B实时视频理解模型:边看边答、主动沉默、动态纠错,NF4版单卡24G可跑

一句话

复旦 OpenMOSS 团队 2026 年 7 月开源的 11B 视频理解模型家族,主打真·实时流式理解——边看边答、随时打断、该沉默时沉默、看错了自己纠正。不是又一个"看完再答"的离线 VLM。

为什么说它不一样:闭环在模型里,不在工程里

市面上做"实时视频理解"的常规做法是:外层写轮询调度器,每秒截帧喂给离线模型,再拼状态机决定什么时候输出。感知和决策是两张皮,延迟高、逻辑脆。

MOSS-VL 把这个闭环直接训进了模型权重:

  • 边看边说:视觉 token 走门控交叉注意力,不进解码序列。画面还在流入,回答已经在生成;新帧到达只是往 cross-attention 缓存里追加,不用打断重新来
  • 主动沉默:每一帧后模型自己决策"说还是等"——信息不够就输出 <|silence|> 继续观察。OmniMMI 主动预警子项 66.0 vs 最好开源基线 37.5,接近翻倍
  • 动态纠错:新证据进来当场翻案改口,不被最初的误判锁死

官方把这定义为 L5 级实时交互(L2-L4 的模型回答期间是"瞎"的,L5 不是)。整套实时能力集中在最后一个轻量训练阶段(Realtime-SFT,不到 3% 训练 token),同一套权重换个 system prompt 就能在离线/流式/实时三种模式间切换。

规格

项值
参数量11B(语言骨干 Qwen3-8B)
上下文256K
版本Realtime(流式)/ Instruct(离线)/ Base(续训基座)
权重HuggingFace + ModelScope 双渠道,含 FP8/NF4 量化版
硬件NF4 版单卡 24G(3090/4090)可跑
微调已接入 LlamaFactory,LoRA/全量开箱即用
推理官方 realtime_inference 目录自带 CLI + FastAPI WebSocket 服务,支持摄像头/屏幕/视频文件/外部推帧

实测数据点

  • 离线榜:VideoMME、MLVU 等长视频理解达到同规模开源领先;时序推理榜(Minerva、TOMATO、VideoMME-Logical)第一;VSI-bench 超 Qwen3-VL-8B 8.3 分
  • 效率:视觉上下文越长优势越大,对比同骨干 Qwen3-VL-8B 首 token 延迟领先 2.8×→5.1×(SGLang 实测,非估算)
  • 流式榜:四个 streaming benchmark 中三个平均第一、一个第二

适合拿来干嘛

  • 视频流实时监控/解说:摄像头、屏幕、直播流持续理解,事件驱动输出
  • 长视频拆解:喂整条视频让它逐镜头输出运镜、动作、节奏描述——短视频团队可以拿它当"爆款拆解工",输出直接当视频生成模型的复刻提示词
  • 批量内容质检:生成类流水线末端自动过一遍,查主体一致性、文字错误
  • 二次开发基座:Base 版 + LlamaFactory,做垂直领域(工业巡检、安防、教学)的流式理解微调

不适合的场景

它是理解模型,不生成视频/图片;通用 OCR 和复杂图文推理上限不如 30B+ 的 Qwen3-VL 大块头。单实例同时只支持一个实时会话,多路并发要自己堆实例。

链接

6200举报0子龙•26天前
点击获取 ^_^
被收录:

暂无评论