# FLUX 3 - Black Forest Labs 多模态统一模型,图像视频音频一个架构 > FLUX 1/2 团队新作:图像/视频/音频联合训练的世界模型,视频+原生音频最长 20 秒,Early Access 已开放 是什么 FLUX 3 是 Black Forest Labs(FLUX 系列原班团队,Stable Diffusion 创始人创立)的首个多模态统一基础模型,2026 年 7 月 23 日发布 Early Access。和 FLUX 1/2 只做图片不同,FLUX 3 在单一架构里联合学习图像、视频和音频——不是三套模型拼接,而是基于「世界模型」理念:图像、视频、音频是对同一现实的不同传感器投影,联合训练让模型理解物理规律、因果和运动。 核心能力 | 模态 | 能力 | |------|------| | 视频 | 文/图/视频→视频,最长 20 秒,原生音频同步,多语言对白,关键帧控制,多镜头串联 | | 图像 | 文生图 + 编辑,复杂提示词和多语言文字渲染大幅提升(几周后开放 Early Access)| | 音频 | 视频原生音效/对白同步生成,不是后期配音 | | 动作预测 | 世界理解延伸到物理 AI,已和 mimic robotics 合作开发 FLUX-mimic | 视频生成细节 - 文生视频、图生视频(起始帧动画 / 视觉参考)、视频到视频(角色迁移到新场景) - 输入视频 + 音频 → 生成性续写 - 关键帧到视频:控制两个时刻之间的过渡 - 多语言对白 + 强唇形同步 - 支持手持 DV 风格、动画、电影级等广泛视觉风格 - 强文字渲染和动画设计能力 - Agent 式单镜头串联为多分钟长序列 评测表现(10 秒 720p 文生视频,Early Access 阶段) | 对比模型 | FLUX 3 偏好率 | |----------|---------------| | Runway Gen-4.5 | 77% | | Luma Ray 3.2 | 93% | | Grok Imagine Video | 69% | | Kling v3 Pro | 60% | | Happy Horse v1 | 59% | | Seedance 2.0 / Gemini Omni Flash | 52% | 技术架构 基于 Self-Flow 方法——在同一个底层架构中对齐多模态生成与理解。相比标准 Flow Matching,生成误差更低、操控任务成功率更高。最终目标是统一感知、动作和语言预测。 发布节奏 1. FLUX 3 Video — Early Access 已开放(API + 私有权重申请) 2. FLUX 3 Action — 通过研究/商业合作伙伴(mimic robotics 已接入) 3. FLUX 3 Image — 几周后开放 Early Access 4. FLUX 3 Dev — 开源权重(时间未定) 注意 - 目前尚未开源,Early Access 需申请 - 参数量、硬件需求等细节未公布 - 图像能力尚未开放,仅视频先行 相关链接 官网博客:https://bfl.ai/blog/flux-3 模型页面:https://bfl.ai/models/flux-3 Early Access 申请:https://bfl.ai/contact --- **分类**:模型 **标签**:视频 · 模型 · FLUX **作者**:子龙 **链接**:https://octohz.com/p/2081