
字节跳动蒸馏版视频理解模型,DREAM-1K描述F1超越GPT-4o,8.3B参数低门槛部署
简介
Tarsier2-Recap-7b 是字节跳动 Omni Research 团队推出的视频理解大模型,基于 Qwen2-VL-7B-Instruct,通过蒸馏 Tarsier2-7b 的视频描述能力得到。8.3B 参数(BF16),Apache 2.0 许可。
简单说:Tarsier2-7B 是完整版(SOTA 全能),Tarsier2-Recap-7B 是蒸馏轻量版——只专注视频描述,但描述能力接近完整版,在 DREAM-1K 上 F1 达 40.7%,超越 GPT-4o 的 39.2%。
核心亮点
- 视频描述能力超 GPT-4o:DREAM-1K 详细视频描述基准 F1 40.7%,仅次于 Tarsier2-7B(42.0%),超越 GPT-4o(39.2%)
- 低幻觉:继承 Tarsier2 系列的低幻觉特性,在 VideoHallucer 和 EventHallusion 上表现优秀
- 蒸馏自 SOTA:用 Tarsier2-Recap-585K 数据集微调 2 个 epoch,保留了完整版的核心视频理解能力
- 基座成熟:基于 Qwen2-VL-7B-Instruct,生态兼容性好,部署门槛低
Benchmark 成绩
| 基准 | Tarsier2-Recap-7B | GPT-4o | 说明 |
|---|---|---|---|
| DREAM-1K(详细描述) | 40.7% | 39.2% | 细粒度动作/事件描述 |
| TVBench(时序理解) | 前 3 | — | 需额外 prompt 引导 |
| FAVOR-Bench | 前 3 | — | 多选视频问答 |
与 Tarsier2-7B 完整版的区别
| Recap-7B | Tarsier2-7B | |
|---|---|---|
| 定位 | 视频描述专精 | 全能视频理解 |
| 训练 | Qwen2-VL-7B 蒸馏 | 基座升级+多阶段训练 |
| DREAM-1K F1 | 40.7% | 42.0% |
| 视频 QA | 中等(需 prompt) | SOTA |
| 视频 Grounding | 无 | SOTA |
| 幻觉抑制 | 好 | 最好 |
| 模型体积 | 8.3B(同) | 8.3B(同) |
技术细节
- 基座:Qwen2-VL-7B-Instruct
- 训练数据:Tarsier2-Recap-585K(视频描述数据集)
- 训练方式:2 epochs,lr=2e-5
- 参数量:8.3B(BF16)
- 许可:Qwen2-VL-7B 原始许可
- 论文:arXiv 2501.07888
快速上手
# 推理示例(来自官方 GitHub)
python -m tarsier.eval.infer \
--model_path "omni-research/Tarsier2-Recap-7b" \
--video_file "your_video.mp4" \
--prompt "Describe the video in detail."
支持图片、GIF、视频输入。
适用场景
✅ 视频内容详细描述/字幕生成 ✅ 视频内容审核与摘要 ✅ 短视频理解与分析 ✅ RAG 系统中视频转文本
链接
- HuggingFace 模型:https://huggingface.co/omni-research/Tarsier2-Recap-7b
- GitHub 仓库:https://github.com/bytedance/tarsier
- 论文:https://arxiv.org/abs/2501.07888
一句话点评:字节跳动的视频描述专精蒸馏模型,7B 体积里视频描述能力超 GPT-4o。如果你只需要「把视频讲清楚」而不是做复杂视频 QA/Grounding,Recap 版比完整 Tarsier2-7B 更轻量直接。
暂无评论
