# video-talkcraft - 口播稿+配音一键成片的 agent skill,78张动效配方卡 > 字级配音同步、七层反PPT镜头系统、三重验收自动返工,把Claude Code/Codex变成口播视频动效工作室 ## 这是什么 **video-talkcraft** 是一个开源 agent skill(Claude Code / Codex 技能包),专治"口播解说视频":你给它**一份口播稿 + 一条成品配音**(任何 TTS 或真人录音),它自动完成从字级时间戳对齐、分镜设计、动效实现到渲染验收的**完整闭环**,产出可直接发布的解说成片。 不是剪辑软件,不是模板站——是让你的 AI agent 变成一个懂动效设计的视频工作室。 ## 为什么值得发:闭环才是重点 市面上 AI 视频工具大多只管"生成画面",剪映模板只管"套壳"。这个 skill 的差异化在于**全流程都在 agent 手里闭环**: 1. **字级配音同步**:口播稿对齐到音频(FireRedASR2-CTC / faster-whisper 双后端,CPU 可跑),字级偏差中位 20–40ms——每个动效节拍都锚在确切的字上,不是大概齐 2. **SHOTBOOK 语义分镜**:按语义拍拆分镜,带层矩阵和排版预算 3. **78 张动效配方卡**:每张卡有意图、参数、已知坑、可直接复制的自包含 Remotion tsx 源码 + 可跑 HTML 预览,[在线画廊一页全览](https://vincentwei1021.github.io/video-talkcraft/) 4. **七层反 PPT 系统**:连续相机曲线、视差平面、让位生命周期、呼吸环境层——**静止帧在结构上不可能出现**,漏网的也会被自动检测抓住(做出口播视频最忌讳的"PPT 感"从机制上杜绝) 5. **三重验收**:自动静止检测、音效逐 cue 能量验证、锚点帧 + 连拍三帧组独立评审——专抓单帧看不见的时域缺陷,不过关自动返工 ## 怎么用 最简单的方式——把仓库链接直接丢给你的 agent: ```text 帮我安装这个 skill:https://github.com/Vincentwei1021/video-talkcraft ``` 然后说:`用 video-talkcraft 把这份口播稿 + voiceover.wav 做成视频。` 环境要求:Node 18+(Remotion 渲染)、Python 3.10+、ffmpeg,agent 会按需自行配置。 ## 适合谁 - 做知识科普、产品评测、新闻解读、观点锐评类**口播/解说横屏视频**的创作者 - 已经有 TTS 或真人配音,想把"稿→成片"这一步全自动化的人 - 中文口播优先设计,中英混排完全支持 - 可选支持人物出镜(抠像 + 人脸安全区检测工具已含) ## 许可注意 **PolyForm Noncommercial 1.0.0**——个人、教育、研究免费;用它做出的视频归你所有;但工具本身商用需联系作者授权(vincentwei1021@gmail.com)。不是 Apache/MIT,商用前先发邮件。 ## 链接 - GitHub:https://github.com/Vincentwei1021/video-talkcraft - 动效在线画廊:https://vincentwei1021.github.io/video-talkcraft/ - 同系列姊妹篇:[video-shotcraft](https://github.com/Vincentwei1021/video-shotcraft) --- **分类**:Skills **标签**:video · 口播 · talkcraft **作者**:子龙 **链接**:https://octohz.com/p/2084