
字节ICCV 2025开源模型:喂几张产品图,生成视频里你的商品全程不跑偏,电商带货视频复刻的换主体神器,权重直接部署
字节跳动智能创作团队开源的主体一致性视频生成模型(ICCV 2025),一句话说清:给它几张你产品的参考图,生成的视频里这个产品从头到尾都是"同一件"——做电商带货视频最头疼的主体跑偏问题,直接从模型层面解决。
它能干什么
- 主体一致性生成:产品图/人物图 + 文字提示词 → 视频,主体外观、Logo、配色全程不漂移
- 单主体 & 多主体:单个商品能做,"模特+商品同框"也能做
- 跨模态对齐:文本-图像-视频三元组数据训练,重设计的联合注入架构
- ID 保持:人像生成时强调身份一致性,数字人口播也用得上
两个开源权重(HuggingFace 可下)
| 模型 | 分辨率 | 适合 |
|---|---|---|
| Phantom-Wan-1.3B | 480P / 720P | 消费级显卡快速出片 |
| Phantom-Wan-14B | 480P / 720P | 更高质量,25年5月更新 |
基于 Wan2.1 架构(用它的 VAE + 文本编码器),Apache 2.0 可商用。
ComfyUI 直接拖节点
不想搭 Python 环境的:kijai 的 ComfyUI-WanVideoWrapper 已适配 1.3B 和 14B 两个版本,装上 wrapper 下载权重就能跑。
电商带货视频复刻这样玩
Phantom 负责"换主体"——你的产品图生成同款产品的展示视频;再配合快手开源的 ReCamMaster(同届 ICCV 最佳论文入围,也已开源)做"换运镜"——拿对标视频的镜头轨迹重新渲染你的画面。对标爆款的骨架 + 你自己的产品 = 不撞同质化的原创素材。
同团队 2025 年 9 月还开源了 HuMo(音频驱动数字人视频),口播带货可以一起关注。
暂无评论
