# MOSS-VL:边看边答的开源实时视频理解模型 > 复旦OpenMOSS开源11B实时视频理解模型:边看边答、主动沉默、动态纠错,NF4版单卡24G可跑 ## 一句话 复旦 OpenMOSS 团队 2026 年 7 月开源的 11B 视频理解模型家族,主打**真·实时流式理解**——边看边答、随时打断、该沉默时沉默、看错了自己纠正。不是又一个"看完再答"的离线 VLM。 ## 为什么说它不一样:闭环在模型里,不在工程里 市面上做"实时视频理解"的常规做法是:外层写轮询调度器,每秒截帧喂给离线模型,再拼状态机决定什么时候输出。**感知和决策是两张皮**,延迟高、逻辑脆。 MOSS-VL 把这个闭环直接训进了模型权重: - **边看边说**:视觉 token 走门控交叉注意力,不进解码序列。画面还在流入,回答已经在生成;新帧到达只是往 cross-attention 缓存里追加,不用打断重新来 - **主动沉默**:每一帧后模型自己决策"说还是等"——信息不够就输出 `<|silence|>` 继续观察。OmniMMI 主动预警子项 66.0 vs 最好开源基线 37.5,接近翻倍 - **动态纠错**:新证据进来当场翻案改口,不被最初的误判锁死 官方把这定义为 L5 级实时交互(L2-L4 的模型回答期间是"瞎"的,L5 不是)。整套实时能力集中在最后一个轻量训练阶段(Realtime-SFT,不到 3% 训练 token),同一套权重换个 system prompt 就能在离线/流式/实时三种模式间切换。 ## 规格 | 项 | 值 | |---|---| | 参数量 | 11B(语言骨干 Qwen3-8B) | | 上下文 | 256K | | 版本 | Realtime(流式)/ Instruct(离线)/ Base(续训基座) | | 权重 | HuggingFace + ModelScope 双渠道,含 FP8/NF4 量化版 | | 硬件 | NF4 版**单卡 24G(3090/4090)可跑** | | 微调 | 已接入 LlamaFactory,LoRA/全量开箱即用 | | 推理 | 官方 realtime_inference 目录自带 CLI + FastAPI WebSocket 服务,支持摄像头/屏幕/视频文件/外部推帧 | ## 实测数据点 - 离线榜:VideoMME、MLVU 等长视频理解达到同规模开源领先;时序推理榜(Minerva、TOMATO、VideoMME-Logical)第一;VSI-bench 超 Qwen3-VL-8B 8.3 分 - 效率:视觉上下文越长优势越大,对比同骨干 Qwen3-VL-8B 首 token 延迟领先 2.8×→5.1×(SGLang 实测,非估算) - 流式榜:四个 streaming benchmark 中三个平均第一、一个第二 ## 适合拿来干嘛 - **视频流实时监控/解说**:摄像头、屏幕、直播流持续理解,事件驱动输出 - **长视频拆解**:喂整条视频让它逐镜头输出运镜、动作、节奏描述——短视频团队可以拿它当"爆款拆解工",输出直接当视频生成模型的复刻提示词 - **批量内容质检**:生成类流水线末端自动过一遍,查主体一致性、文字错误 - **二次开发基座**:Base 版 + LlamaFactory,做垂直领域(工业巡检、安防、教学)的流式理解微调 ## 不适合的场景 它是**理解**模型,不生成视频/图片;通用 OCR 和复杂图文推理上限不如 30B+ 的 Qwen3-VL 大块头。单实例同时只支持一个实时会话,多路并发要自己堆实例。 ## 链接 - GitHub(含推理代码、WebSocket 协议文档):https://github.com/OpenMOSS/MOSS-VL - 技术报告:https://arxiv.org/abs/2608.15045 - 模型权重:https://huggingface.co/OpenMOSS-Team --- **分类**:软件 **标签**:视频 · 实时 · 模型 **作者**:子龙 **链接**:https://octohz.com/p/2103