一句话判断
不同于传统多模态模型,FLUX 3 强调模态互约束以学习世界运作规律,值得关注其动作预测能力。
核心信息
Black Forest Labs 发布 FLUX 3,定位为真实世界模型,将图像、视频、音频、语言整合进多模态 flow 架构,强调模态间的互约束以逼近世界表征。产品线分为 Video(最长 20 秒、原生音频)、Image(即将推出)和 Action(动作预测)。
原始内容
相关动态
Codex GPT Live 跨项目协作与屏幕读取能力
Codex GPT Live 提供跨项目协作、跨桌面文件交互、语音直对聊及屏幕内容读取能力,支持读取当前活动窗口的图像和文本进行分析。
ClaudeDevs 更新缩放工具,Chartography 测试成绩提升
ClaudeDevs 更新了缩放工具 Cookbook,让 Claude 模型在 Chartography 基准测试(100 道难题)上实现提升,Fable 5 准确率从 29% 提升至 73%,Sonnet 5 从 13% 提升至 44%。
Fugu-Ultra v1.1发布
Fugu发布Fugu-Ultra v1.1,性能最高提升7.9分,尤其在ProgramBench和Terminal Bench 2.1上,价格不变。
FLUX 3 将极大影响机器人智能和学习
Black Forest Labs 发布 FLUX 3 统一多模态模型,支持图像、视频、音频和动作预测。其 Self-Flow 架构使机器人微调数据减少一半,相比早期模仿视频实验,机器人训练数据减少 10 倍,通过大规模视频预训练隐式学习物理规律。
Black Forest Labs 发布 FLUX 3 统一多模态模型
Black Forest Labs 发布 FLUX 3,采用统一架构同时处理图像生成、视频、原生音频和机器人动作预测。视频已开放早期访问,后续将开放权重,并与 mimic、Audi 合作在真实机器人上运行。团队认为物理世界智能与内容创作可共享同一视觉基础模型。