Awesome-LLMs-for-Video-Understanding:视频理解大模型全家桶清单(3.3k★)

Awesome-LLMs-for-Video-Understanding:视频理解大模型全家桶清单(3.3k★)


IEEE TCSVT 收录的 Vid-LLM 综述配套清单:论文+代码+数据集+基准全整理,选型与研究必备

Awesome-LLMs-for-Video-Understanding:视频理解大模型全家桶清单(3.3k★)

一句话:一份把"用大模型看懂视频"这个领域的论文、代码、数据集全部整理好的清单,配套 IEEE TCSVT 收录的 Vid-LLM 综述论文,GitHub 3.3k+ stars,2026-08 仍在持续更新。

这是什么

作者 yunlong10 团队在做视频理解方向研究时,把散落各处的 Vid-LLM(Video-LLM,视频理解大模型)资源系统性整理成了这张清单,并用它支撑了一篇正式综述:

清单里有什么

1. Vid-LLM 模型分类导航(核心)

  • Video Analyzer × LLM:LLM 当摘要器(长视频总结)、问答(视频 QA)、时间定位等
  • Video Embedder × LLM:把视频嵌入与语言模型结合
  • LLM-based Video Agents:用 LLM 驱动视频相关智能体

2. 任务 / 数据集 / 基准

  • 视频理解相关任务分类、常用数据集
  • Video Instruction Tuning(视频指令微调)资料
  • 视频大模型评测基准合集——选型必看

3. 持续扩充

  • 已收录 100+ 个 Vid-LLM 模型、15+ 新基准(2024-06 时点),之后一直在补
  • 姊妹篇:Awesome-Video-LMM-Post-Training(视频推理后训练的深度解析)

适合谁

  • 研究者/学生:写视频理解综述、找相关工作,这份清单能省大量检索时间
  • 开发者选型:想知道"哪个视频大模型适合我的场景",按分类+基准直接对比
  • AI 产品经理:了解视频理解技术边界和主流方案
  • 和之前推荐的 Keye-VL / Qwen3-VL 等具体模型搭配使用效果最好——先看清单选型,再去跑具体模型

入口


总结:想"看懂视频"的技术全景,收藏这一份就够;配合具体模型(Qwen3-VL、Keye-VL、InternVL)食用更佳。

9700举报0子龙•26天前
点击获取 ^_^
被收录:

暂无评论