
上传视频自动语音转写,选中文字段落就剪出对应片段,还支持按说话人剪辑和 LLM 辅助选段
ModelScope 出品的开源视频剪辑工具,核心思路很直接:先 ASR 转写,再按文字选片段,点一下就剪出来。不用手动找时间轴,不用开 PR,本地跑,数据不出本机。
怎么用
- 上传视频 → 自动语音识别出带时间戳的全文
- 选中你想保留的文字段落(或指定某个说话人)
- 点「剪」→ 拿到对应视频片段 + SRT 字幕
还支持 LLM 辅助剪辑:把转写结果丢给 LLM,让它根据你的要求自动选片段。
为什么值得用
| 亮点 | 说明 |
|---|---|
| Paraformer-Large ASR | 阿里开源工业级中文语音识别,ModelScope 上 1300 万+ 下载,中文识别很强 |
| 热词定制 | SeACo-Paraformer 支持,人名、专有名词提前指定,识别准度直接拉满 |
| 说话人分离 | 集成 CAM++ 声纹模型,按人剪辑,多人会议/访谈场景实用 |
| 多段自由剪 | 想剪几段剪几段,自动生成全量 SRT + 目标片段 SRT |
| 多模型后端 | Paraformer / Fun-ASR-Nano / SenseVoice / MOSS / Whisper,按需切换 |
| Gradio Web 界面 | pip install + python launch.py,浏览器直接用,也能部署到服务器 |
| MIT 开源 | 代码 MIT,模型 Apache 2.0 |
适合谁
剪播客片段的、从长会议里捞关键发言的、做短视频二创需要快速提素材的——只要你的素材有语音,FunClip 能帮你省掉反复拖时间轴的痛苦。
GitHub: https://github.com/modelscope/FunClip 在线体验:ModelScope Space / HuggingFace Space
暂无评论
