Signal Brief

FLUX 3 发布:真实世界模型

Black Forest Labs 发布 FLUX 3,定位为真实世界模型,将图像、视频、音频、语言整合进多模态 flow 架构,强调模态间的互约束以逼近世界表征。产品线分为 Video(最长 20 秒、原生音频)、Image(即将推出)和 Action(动作预测)。

twitter关注列表 meng shao (@shao__meng) 发布 2026-07-24 收录 2026-07-24 观察

一句话判断

不同于传统多模态模型,FLUX 3 强调模态互约束以学习世界运作规律,值得关注其动作预测能力。

核心信息

Black Forest Labs 发布 FLUX 3,定位为真实世界模型,将图像、视频、音频、语言整合进多模态 flow 架构,强调模态间的互约束以逼近世界表征。产品线分为 Video(最长 20 秒、原生音频)、Image(即将推出)和 Action(动作预测)。

原始内容

FLUX 3 发布了! Black Forest Labs 对它的定位,不再是又一个「文生视频模型」或「文生图模型」,是「真实世界模型」! 团队把 图像 / 视频 / 音频 放进同一套 multimodal flow 架构里,试图学「世界如何运作」,再把同一底座同时接到 内容生成 和 具身/动作预测。 为什么要「多模态一起学」? · 图像:提供某一时刻的空间结构与关系 · 视频:提供时间、动力学、物理规律 · 音频:提供机械现象与声学之间的因果线索 · 语言:提供目标、抽象、指令 各模态都是同一现实的「投影」,单独训只能拟合投影;一起训时,模态之间的互约束(声音必须对得上撞击、运动必须符合质量、未来必须接续过去)才更接近「世界表征」。 能力拆解:同一模型,三条产品线 1. Video(已 Early Access):最长约 20 秒、原生音频;文/图/视频参考、续写、关键帧、多语言对白;可链式拼更长片。 2. Image(随后数周):合成 + 编辑;复杂 prompt、多语文字、风格与分辨率更强(仍在 midtraining 迭代)。 3. Action(伙伴通道):原生动作预测,或把视频骨干当动力学底座微调;已有 FLUX-mimic(mimic robotics / Audi 场景)。 https://video.twimg.com/amplify_video/2080499285335162880/vid/avc1/3840x2160/8su4sMcnaO2yLla8.mp4?tag=29

相关动态

04

FLUX 3 将极大影响机器人智能和学习

Black Forest Labs 发布 FLUX 3 统一多模态模型,支持图像、视频、音频和动作预测。其 Self-Flow 架构使机器人微调数据减少一半,相比早期模仿视频实验,机器人训练数据减少 10 倍,通过大规模视频预训练隐式学习物理规律。

twitter关注列表2026-07-23#模型发布#多模态#技术突破
观察
05

Black Forest Labs 发布 FLUX 3 统一多模态模型

Black Forest Labs 发布 FLUX 3,采用统一架构同时处理图像生成、视频、原生音频和机器人动作预测。视频已开放早期访问,后续将开放权重,并与 mimic、Audi 合作在真实机器人上运行。团队认为物理世界智能与内容创作可共享同一视觉基础模型。

twitter关注列表2026-07-23#模型发布#多模态#技术突破
观察