video-talkcraft - 口播稿+配音一键成片的 agent skill,78张动效配方卡

video-talkcraft - 口播稿+配音一键成片的 agent skill,78张动效配方卡


字级配音同步、七层反PPT镜头系统、三重验收自动返工,把Claude Code/Codex变成口播视频动效工作室

这是什么

video-talkcraft 是一个开源 agent skill(Claude Code / Codex 技能包),专治"口播解说视频":你给它一份口播稿 + 一条成品配音(任何 TTS 或真人录音),它自动完成从字级时间戳对齐、分镜设计、动效实现到渲染验收的完整闭环,产出可直接发布的解说成片。

不是剪辑软件,不是模板站——是让你的 AI agent 变成一个懂动效设计的视频工作室。

为什么值得发:闭环才是重点

市面上 AI 视频工具大多只管"生成画面",剪映模板只管"套壳"。这个 skill 的差异化在于全流程都在 agent 手里闭环:

  1. 字级配音同步:口播稿对齐到音频(FireRedASR2-CTC / faster-whisper 双后端,CPU 可跑),字级偏差中位 20–40ms——每个动效节拍都锚在确切的字上,不是大概齐
  2. SHOTBOOK 语义分镜:按语义拍拆分镜,带层矩阵和排版预算
  3. 78 张动效配方卡:每张卡有意图、参数、已知坑、可直接复制的自包含 Remotion tsx 源码 + 可跑 HTML 预览,在线画廊一页全览
  4. 七层反 PPT 系统:连续相机曲线、视差平面、让位生命周期、呼吸环境层——静止帧在结构上不可能出现,漏网的也会被自动检测抓住(做出口播视频最忌讳的"PPT 感"从机制上杜绝)
  5. 三重验收:自动静止检测、音效逐 cue 能量验证、锚点帧 + 连拍三帧组独立评审——专抓单帧看不见的时域缺陷,不过关自动返工

怎么用

最简单的方式——把仓库链接直接丢给你的 agent:

帮我安装这个 skill:https://github.com/Vincentwei1021/video-talkcraft

然后说:用 video-talkcraft 把这份口播稿 + voiceover.wav 做成视频。

环境要求:Node 18+(Remotion 渲染)、Python 3.10+、ffmpeg,agent 会按需自行配置。

适合谁

  • 做知识科普、产品评测、新闻解读、观点锐评类口播/解说横屏视频的创作者
  • 已经有 TTS 或真人配音,想把"稿→成片"这一步全自动化的人
  • 中文口播优先设计,中英混排完全支持
  • 可选支持人物出镜(抠像 + 人脸安全区检测工具已含)

许可注意

PolyForm Noncommercial 1.0.0——个人、教育、研究免费;用它做出的视频归你所有;但工具本身商用需联系作者授权(vincentwei1021@gmail.com)。不是 Apache/MIT,商用前先发邮件。

链接

14400举报0子龙•28天前
点击获取 ^_^

暂无评论