
FLUX 1/2 团队新作:图像/视频/音频联合训练的世界模型,视频+原生音频最长 20 秒,Early Access 已开放
是什么
FLUX 3 是 Black Forest Labs(FLUX 系列原班团队,Stable Diffusion 创始人创立)的首个多模态统一基础模型,2026 年 7 月 23 日发布 Early Access。和 FLUX 1/2 只做图片不同,FLUX 3 在单一架构里联合学习图像、视频和音频——不是三套模型拼接,而是基于「世界模型」理念:图像、视频、音频是对同一现实的不同传感器投影,联合训练让模型理解物理规律、因果和运动。
核心能力
| 模态 | 能力 |
|---|---|
| 视频 | 文/图/视频→视频,最长 20 秒,原生音频同步,多语言对白,关键帧控制,多镜头串联 |
| 图像 | 文生图 + 编辑,复杂提示词和多语言文字渲染大幅提升(几周后开放 Early Access) |
| 音频 | 视频原生音效/对白同步生成,不是后期配音 |
| 动作预测 | 世界理解延伸到物理 AI,已和 mimic robotics 合作开发 FLUX-mimic |
视频生成细节
- 文生视频、图生视频(起始帧动画 / 视觉参考)、视频到视频(角色迁移到新场景)
- 输入视频 + 音频 → 生成性续写
- 关键帧到视频:控制两个时刻之间的过渡
- 多语言对白 + 强唇形同步
- 支持手持 DV 风格、动画、电影级等广泛视觉风格
- 强文字渲染和动画设计能力
- Agent 式单镜头串联为多分钟长序列
评测表现(10 秒 720p 文生视频,Early Access 阶段)
| 对比模型 | FLUX 3 偏好率 |
|---|---|
| Runway Gen-4.5 | 77% |
| Luma Ray 3.2 | 93% |
| Grok Imagine Video | 69% |
| Kling v3 Pro | 60% |
| Happy Horse v1 | 59% |
| Seedance 2.0 / Gemini Omni Flash | 52% |
技术架构
基于 Self-Flow 方法——在同一个底层架构中对齐多模态生成与理解。相比标准 Flow Matching,生成误差更低、操控任务成功率更高。最终目标是统一感知、动作和语言预测。
发布节奏
- FLUX 3 Video — Early Access 已开放(API + 私有权重申请)
- FLUX 3 Action — 通过研究/商业合作伙伴(mimic robotics 已接入)
- FLUX 3 Image — 几周后开放 Early Access
- FLUX 3 Dev — 开源权重(时间未定)
注意
- 目前尚未开源,Early Access 需申请
- 参数量、硬件需求等细节未公布
- 图像能力尚未开放,仅视频先行
相关链接
官网博客:https://bfl.ai/blog/flux-3 模型页面:https://bfl.ai/models/flux-3 Early Access 申请:https://bfl.ai/contact
暂无评论
