# Awesome-LLMs-for-Video-Understanding:视频理解大模型全家桶清单(3.3k★) > IEEE TCSVT 收录的 Vid-LLM 综述配套清单:论文+代码+数据集+基准全整理,选型与研究必备 # Awesome-LLMs-for-Video-Understanding:视频理解大模型全家桶清单(3.3k★) **一句话**:一份把"用大模型看懂视频"这个领域的**论文、代码、数据集**全部整理好的清单,配套 IEEE TCSVT 收录的 Vid-LLM 综述论文,GitHub 3.3k+ stars,2026-08 仍在持续更新。 ## 这是什么 作者 yunlong10 团队在做视频理解方向研究时,把散落各处的 Vid-LLM(Video-LLM,视频理解大模型)资源系统性整理成了这张清单,并用它支撑了一篇正式综述: - 📄 综述论文:[Video Understanding with Large Language Models: A Survey](https://arxiv.org/abs/2312.17432),已发表于 **IEEE TCSVT**(Transactions on Circuits and Systems for Video Technology) - 内容不是简单堆链接,而是按作者提出的**分类体系**组织,方便按需求检索 ## 清单里有什么 **1. Vid-LLM 模型分类导航(核心)** - **Video Analyzer × LLM**:LLM 当摘要器(长视频总结)、问答(视频 QA)、时间定位等 - **Video Embedder × LLM**:把视频嵌入与语言模型结合 - **LLM-based Video Agents**:用 LLM 驱动视频相关智能体 **2. 任务 / 数据集 / 基准** - 视频理解相关任务分类、常用数据集 - Video Instruction Tuning(视频指令微调)资料 - 视频大模型评测基准合集——选型必看 **3. 持续扩充** - 已收录 100+ 个 Vid-LLM 模型、15+ 新基准(2024-06 时点),之后一直在补 - 姊妹篇:[Awesome-Video-LMM-Post-Training](https://github.com/yunlong10/Awesome-Video-LMM-Post-Training)(视频推理后训练的深度解析) ## 适合谁 - **研究者/学生**:写视频理解综述、找相关工作,这份清单能省大量检索时间 - **开发者选型**:想知道"哪个视频大模型适合我的场景",按分类+基准直接对比 - **AI 产品经理**:了解视频理解技术边界和主流方案 - 和之前推荐的 Keye-VL / Qwen3-VL 等具体模型搭配使用效果最好——先看清单选型,再去跑具体模型 ## 入口 - GitHub:https://github.com/yunlong10/awesome-llms-for-video-understanding - 综述论文 arXiv:https://arxiv.org/abs/2312.17432 - IEEE TCSVT 正式版:https://ieeexplore.ieee.org/document/10982110 --- **总结**:想"看懂视频"的技术全景,收藏这一份就够;配合具体模型(Qwen3-VL、Keye-VL、InternVL)食用更佳。 --- **分类**:软件 **标签**:视频 · Video · 模型 **作者**:子龙 **链接**:https://octohz.com/p/2099