# Tarsier2-Recap-7B - 字节视频描述专精模型,7B超GPT-4o > 字节跳动蒸馏版视频理解模型,DREAM-1K描述F1超越GPT-4o,8.3B参数低门槛部署 ## 简介 Tarsier2-Recap-7b 是字节跳动 Omni Research 团队推出的视频理解大模型,基于 Qwen2-VL-7B-Instruct,通过蒸馏 Tarsier2-7b 的视频描述能力得到。8.3B 参数(BF16),Apache 2.0 许可。 简单说:Tarsier2-7B 是完整版(SOTA 全能),Tarsier2-Recap-7B 是蒸馏轻量版——**只专注视频描述,但描述能力接近完整版,在 DREAM-1K 上 F1 达 40.7%,超越 GPT-4o 的 39.2%**。 ## 核心亮点 - **视频描述能力超 GPT-4o**:DREAM-1K 详细视频描述基准 F1 40.7%,仅次于 Tarsier2-7B(42.0%),超越 GPT-4o(39.2%) - **低幻觉**:继承 Tarsier2 系列的低幻觉特性,在 VideoHallucer 和 EventHallusion 上表现优秀 - **蒸馏自 SOTA**:用 Tarsier2-Recap-585K 数据集微调 2 个 epoch,保留了完整版的核心视频理解能力 - **基座成熟**:基于 Qwen2-VL-7B-Instruct,生态兼容性好,部署门槛低 ## Benchmark 成绩 | 基准 | Tarsier2-Recap-7B | GPT-4o | 说明 | |------|---:|---:|------| | DREAM-1K(详细描述) | 40.7% | 39.2% | 细粒度动作/事件描述 | | TVBench(时序理解) | 前 3 | — | 需额外 prompt 引导 | | FAVOR-Bench | 前 3 | — | 多选视频问答 | ## 与 Tarsier2-7B 完整版的区别 | | Recap-7B | Tarsier2-7B | |--|----------|------------| | 定位 | 视频描述专精 | 全能视频理解 | | 训练 | Qwen2-VL-7B 蒸馏 | 基座升级+多阶段训练 | | DREAM-1K F1 | 40.7% | 42.0% | | 视频 QA | 中等(需 prompt) | SOTA | | 视频 Grounding | 无 | SOTA | | 幻觉抑制 | 好 | 最好 | | 模型体积 | 8.3B(同) | 8.3B(同) | ## 技术细节 - 基座:Qwen2-VL-7B-Instruct - 训练数据:Tarsier2-Recap-585K(视频描述数据集) - 训练方式:2 epochs,lr=2e-5 - 参数量:8.3B(BF16) - 许可:Qwen2-VL-7B 原始许可 - 论文:arXiv 2501.07888 ## 快速上手 ```bash # 推理示例(来自官方 GitHub) python -m tarsier.eval.infer \ --model_path "omni-research/Tarsier2-Recap-7b" \ --video_file "your_video.mp4" \ --prompt "Describe the video in detail." ``` 支持图片、GIF、视频输入。 ## 适用场景 ✅ 视频内容详细描述/字幕生成 ✅ 视频内容审核与摘要 ✅ 短视频理解与分析 ✅ RAG 系统中视频转文本 ## 链接 - HuggingFace 模型:https://huggingface.co/omni-research/Tarsier2-Recap-7b - GitHub 仓库:https://github.com/bytedance/tarsier - 论文:https://arxiv.org/abs/2501.07888 --- 一句话点评:字节跳动的视频描述专精蒸馏模型,7B 体积里视频描述能力超 GPT-4o。如果你只需要「把视频讲清楚」而不是做复杂视频 QA/Grounding,Recap 版比完整 Tarsier2-7B 更轻量直接。 --- **分类**:源码 **标签**:视频 · 描述 · Tarsier2 **作者**:子龙 **链接**:https://octohz.com/p/2059