
复旦OpenMOSS开源11B实时视频理解模型:边看边答、主动沉默、动态纠错,NF4版单卡24G可跑
一句话
复旦 OpenMOSS 团队 2026 年 7 月开源的 11B 视频理解模型家族,主打真·实时流式理解——边看边答、随时打断、该沉默时沉默、看错了自己纠正。不是又一个"看完再答"的离线 VLM。
为什么说它不一样:闭环在模型里,不在工程里
市面上做"实时视频理解"的常规做法是:外层写轮询调度器,每秒截帧喂给离线模型,再拼状态机决定什么时候输出。感知和决策是两张皮,延迟高、逻辑脆。
MOSS-VL 把这个闭环直接训进了模型权重:
- 边看边说:视觉 token 走门控交叉注意力,不进解码序列。画面还在流入,回答已经在生成;新帧到达只是往 cross-attention 缓存里追加,不用打断重新来
- 主动沉默:每一帧后模型自己决策"说还是等"——信息不够就输出
<|silence|>继续观察。OmniMMI 主动预警子项 66.0 vs 最好开源基线 37.5,接近翻倍 - 动态纠错:新证据进来当场翻案改口,不被最初的误判锁死
官方把这定义为 L5 级实时交互(L2-L4 的模型回答期间是"瞎"的,L5 不是)。整套实时能力集中在最后一个轻量训练阶段(Realtime-SFT,不到 3% 训练 token),同一套权重换个 system prompt 就能在离线/流式/实时三种模式间切换。
规格
| 项 | 值 |
|---|---|
| 参数量 | 11B(语言骨干 Qwen3-8B) |
| 上下文 | 256K |
| 版本 | Realtime(流式)/ Instruct(离线)/ Base(续训基座) |
| 权重 | HuggingFace + ModelScope 双渠道,含 FP8/NF4 量化版 |
| 硬件 | NF4 版单卡 24G(3090/4090)可跑 |
| 微调 | 已接入 LlamaFactory,LoRA/全量开箱即用 |
| 推理 | 官方 realtime_inference 目录自带 CLI + FastAPI WebSocket 服务,支持摄像头/屏幕/视频文件/外部推帧 |
实测数据点
- 离线榜:VideoMME、MLVU 等长视频理解达到同规模开源领先;时序推理榜(Minerva、TOMATO、VideoMME-Logical)第一;VSI-bench 超 Qwen3-VL-8B 8.3 分
- 效率:视觉上下文越长优势越大,对比同骨干 Qwen3-VL-8B 首 token 延迟领先 2.8×→5.1×(SGLang 实测,非估算)
- 流式榜:四个 streaming benchmark 中三个平均第一、一个第二
适合拿来干嘛
- 视频流实时监控/解说:摄像头、屏幕、直播流持续理解,事件驱动输出
- 长视频拆解:喂整条视频让它逐镜头输出运镜、动作、节奏描述——短视频团队可以拿它当"爆款拆解工",输出直接当视频生成模型的复刻提示词
- 批量内容质检:生成类流水线末端自动过一遍,查主体一致性、文字错误
- 二次开发基座:Base 版 + LlamaFactory,做垂直领域(工业巡检、安防、教学)的流式理解微调
不适合的场景
它是理解模型,不生成视频/图片;通用 OCR 和复杂图文推理上限不如 30B+ 的 Qwen3-VL 大块头。单实例同时只支持一个实时会话,多路并发要自己堆实例。
链接
- GitHub(含推理代码、WebSocket 协议文档):https://github.com/OpenMOSS/MOSS-VL
- 技术报告:https://arxiv.org/abs/2608.15045
- 模型权重:https://huggingface.co/OpenMOSS-Team
暂无评论
