
IEEE TCSVT 收录的 Vid-LLM 综述配套清单:论文+代码+数据集+基准全整理,选型与研究必备
Awesome-LLMs-for-Video-Understanding:视频理解大模型全家桶清单(3.3k★)
一句话:一份把"用大模型看懂视频"这个领域的论文、代码、数据集全部整理好的清单,配套 IEEE TCSVT 收录的 Vid-LLM 综述论文,GitHub 3.3k+ stars,2026-08 仍在持续更新。
这是什么
作者 yunlong10 团队在做视频理解方向研究时,把散落各处的 Vid-LLM(Video-LLM,视频理解大模型)资源系统性整理成了这张清单,并用它支撑了一篇正式综述:
- 📄 综述论文:Video Understanding with Large Language Models: A Survey,已发表于 IEEE TCSVT(Transactions on Circuits and Systems for Video Technology)
- 内容不是简单堆链接,而是按作者提出的分类体系组织,方便按需求检索
清单里有什么
1. Vid-LLM 模型分类导航(核心)
- Video Analyzer × LLM:LLM 当摘要器(长视频总结)、问答(视频 QA)、时间定位等
- Video Embedder × LLM:把视频嵌入与语言模型结合
- LLM-based Video Agents:用 LLM 驱动视频相关智能体
2. 任务 / 数据集 / 基准
- 视频理解相关任务分类、常用数据集
- Video Instruction Tuning(视频指令微调)资料
- 视频大模型评测基准合集——选型必看
3. 持续扩充
- 已收录 100+ 个 Vid-LLM 模型、15+ 新基准(2024-06 时点),之后一直在补
- 姊妹篇:Awesome-Video-LMM-Post-Training(视频推理后训练的深度解析)
适合谁
- 研究者/学生:写视频理解综述、找相关工作,这份清单能省大量检索时间
- 开发者选型:想知道"哪个视频大模型适合我的场景",按分类+基准直接对比
- AI 产品经理:了解视频理解技术边界和主流方案
- 和之前推荐的 Keye-VL / Qwen3-VL 等具体模型搭配使用效果最好——先看清单选型,再去跑具体模型
入口
- GitHub:https://github.com/yunlong10/awesome-llms-for-video-understanding
- 综述论文 arXiv:https://arxiv.org/abs/2312.17432
- IEEE TCSVT 正式版:https://ieeexplore.ieee.org/document/10982110
总结:想"看懂视频"的技术全景,收藏这一份就够;配合具体模型(Qwen3-VL、Keye-VL、InternVL)食用更佳。
暂无评论
