一句话判断
这是NVIDIA在物理AI领域的新进展,其统一MoT架构结合自回归推理与扩散视频/动作生成,值得关注开源实现。
核心信息
NVIDIA发布4B参数Cosmos3-Edge世界-动作模型,用于实时物理AI。该模型在VANTAGE-Bench排名第一,实现SOTA机器人策略性能,处理640×360观测,每次推理预测32个动作,以15Hz运行,采用统一MoT架构。
原始内容
相关动态
Anthropic发布Claude 3 Opus
Anthropic 发布 Claude 3 Opus,模型参数量达 200B,支持 200k token 上下文。该模型在 MMLU benchmark 上达到 85% accuracy,比 Claude 2 提升 20%。API 价格为 0.0015 美元/千 token,计划 2024 年 6 月上线。
通义发布 Qwen-Image-3.0
通义实验室发布 Qwen-Image-3.0 模型,支持 12 国语言原生渲染,提供 100 多种艺术风格,能生成九张信息图和一整版报纸,指令上限提升至 4.5k token,联网获取最新世界知识。
Seedance惨败,Grok横行,Alaya开源降成本
AYi (@AYi_AInotes) 发布长文分析了新开源的 Alaya World,一个将游戏原型成本逻辑彻底重构的 3D 世界模型,引入了显式 3D 空间缓存、压缩帧历史记忆和 Error Bank 污染回灌技术,使独立团队仅凭图片、相机轨迹和提示词即可用几分钟生成可探索场景,将原本需要几周、多个人员的流程压缩到秒级完成。Alaya ...
Google AI模型排名急降
Google发布Gemini 3.6 Flash模型,在Frontend Code Arena排名12(原排名21),得分1537分;涉及参数量、排名变化数据
UnMaskFork: 掩码扩散模型的推理时缩放
Sakana AI 在 ICML2026 发表论文 UnMaskFork,提出通过多个掩码扩散语言模型 (MDLM) 协作实现推理时缩放,使用蒙特卡洛树搜索在不同模型间切换以增加多样性。该方法无需额外训练,在编码基准上一致优于现有推理时缩放方法,在数学任务上也随计算量稳步提升。