FLUX 3 - Black Forest Labs 多模态统一模型,图像视频音频一个架构

FLUX 3 - Black Forest Labs 多模态统一模型,图像视频音频一个架构


FLUX 1/2 团队新作:图像/视频/音频联合训练的世界模型,视频+原生音频最长 20 秒,Early Access 已开放

是什么

FLUX 3 是 Black Forest Labs(FLUX 系列原班团队,Stable Diffusion 创始人创立)的首个多模态统一基础模型,2026 年 7 月 23 日发布 Early Access。和 FLUX 1/2 只做图片不同,FLUX 3 在单一架构里联合学习图像、视频和音频——不是三套模型拼接,而是基于「世界模型」理念:图像、视频、音频是对同一现实的不同传感器投影,联合训练让模型理解物理规律、因果和运动。

核心能力

模态能力
视频文/图/视频→视频,最长 20 秒,原生音频同步,多语言对白,关键帧控制,多镜头串联
图像文生图 + 编辑,复杂提示词和多语言文字渲染大幅提升(几周后开放 Early Access)
音频视频原生音效/对白同步生成,不是后期配音
动作预测世界理解延伸到物理 AI,已和 mimic robotics 合作开发 FLUX-mimic

视频生成细节

  • 文生视频、图生视频(起始帧动画 / 视觉参考)、视频到视频(角色迁移到新场景)
  • 输入视频 + 音频 → 生成性续写
  • 关键帧到视频:控制两个时刻之间的过渡
  • 多语言对白 + 强唇形同步
  • 支持手持 DV 风格、动画、电影级等广泛视觉风格
  • 强文字渲染和动画设计能力
  • Agent 式单镜头串联为多分钟长序列

评测表现(10 秒 720p 文生视频,Early Access 阶段)

对比模型FLUX 3 偏好率
Runway Gen-4.577%
Luma Ray 3.293%
Grok Imagine Video69%
Kling v3 Pro60%
Happy Horse v159%
Seedance 2.0 / Gemini Omni Flash52%

技术架构

基于 Self-Flow 方法——在同一个底层架构中对齐多模态生成与理解。相比标准 Flow Matching,生成误差更低、操控任务成功率更高。最终目标是统一感知、动作和语言预测。

发布节奏

  1. FLUX 3 Video — Early Access 已开放(API + 私有权重申请)
  2. FLUX 3 Action — 通过研究/商业合作伙伴(mimic robotics 已接入)
  3. FLUX 3 Image — 几周后开放 Early Access
  4. FLUX 3 Dev — 开源权重(时间未定)

注意

  • 目前尚未开源,Early Access 需申请
  • 参数量、硬件需求等细节未公布
  • 图像能力尚未开放,仅视频先行

相关链接

官网博客:https://bfl.ai/blog/flux-3 模型页面:https://bfl.ai/models/flux-3 Early Access 申请:https://bfl.ai/contact

6500举报0子龙•1个月前
点击获取 ^_^
被收录:

暂无评论