Tarsier2-Recap-7B - 字节视频描述专精模型,7B超GPT-4o

Tarsier2-Recap-7B - 字节视频描述专精模型,7B超GPT-4o


字节跳动蒸馏版视频理解模型,DREAM-1K描述F1超越GPT-4o,8.3B参数低门槛部署

简介

Tarsier2-Recap-7b 是字节跳动 Omni Research 团队推出的视频理解大模型,基于 Qwen2-VL-7B-Instruct,通过蒸馏 Tarsier2-7b 的视频描述能力得到。8.3B 参数(BF16),Apache 2.0 许可。

简单说:Tarsier2-7B 是完整版(SOTA 全能),Tarsier2-Recap-7B 是蒸馏轻量版——只专注视频描述,但描述能力接近完整版,在 DREAM-1K 上 F1 达 40.7%,超越 GPT-4o 的 39.2%。

核心亮点

  • 视频描述能力超 GPT-4o:DREAM-1K 详细视频描述基准 F1 40.7%,仅次于 Tarsier2-7B(42.0%),超越 GPT-4o(39.2%)
  • 低幻觉:继承 Tarsier2 系列的低幻觉特性,在 VideoHallucer 和 EventHallusion 上表现优秀
  • 蒸馏自 SOTA:用 Tarsier2-Recap-585K 数据集微调 2 个 epoch,保留了完整版的核心视频理解能力
  • 基座成熟:基于 Qwen2-VL-7B-Instruct,生态兼容性好,部署门槛低

Benchmark 成绩

基准Tarsier2-Recap-7BGPT-4o说明
DREAM-1K(详细描述)40.7%39.2%细粒度动作/事件描述
TVBench(时序理解)前 3—需额外 prompt 引导
FAVOR-Bench前 3—多选视频问答

与 Tarsier2-7B 完整版的区别

Recap-7BTarsier2-7B
定位视频描述专精全能视频理解
训练Qwen2-VL-7B 蒸馏基座升级+多阶段训练
DREAM-1K F140.7%42.0%
视频 QA中等(需 prompt)SOTA
视频 Grounding无SOTA
幻觉抑制好最好
模型体积8.3B(同)8.3B(同)

技术细节

  • 基座:Qwen2-VL-7B-Instruct
  • 训练数据:Tarsier2-Recap-585K(视频描述数据集)
  • 训练方式:2 epochs,lr=2e-5
  • 参数量:8.3B(BF16)
  • 许可:Qwen2-VL-7B 原始许可
  • 论文:arXiv 2501.07888

快速上手

# 推理示例(来自官方 GitHub)
python -m tarsier.eval.infer \
  --model_path "omni-research/Tarsier2-Recap-7b" \
  --video_file "your_video.mp4" \
  --prompt "Describe the video in detail."

支持图片、GIF、视频输入。

适用场景

✅ 视频内容详细描述/字幕生成 ✅ 视频内容审核与摘要 ✅ 短视频理解与分析 ✅ RAG 系统中视频转文本

链接


一句话点评:字节跳动的视频描述专精蒸馏模型,7B 体积里视频描述能力超 GPT-4o。如果你只需要「把视频讲清楚」而不是做复杂视频 QA/Grounding,Recap 版比完整 Tarsier2-7B 更轻量直接。

3900举报0子龙•1个月前
点击获取 ^_^

暂无评论