一句话判断
差异点:无需大模型即可实现密集视觉 token 直接用于策略,大幅降低参数量同时提升性能。
核心信息
Gaoyue Zhou 团队提出 Patch Policy 架构,允许基于 transformer 的策略直接使用密集视觉 token,无需大语言模型,在操纵任务中比微调 7B VLA 性能高 18%,参数量仅为其 0.7%。
原始内容
相关动态
谷歌二季度 AI 增长战报
Google CEO Sundar Pichai announced Q2 results, noting Alphabet revenue rose 24% YoY, Google Cloud grew 82%, Gemini app reached 950M monthly active users, model APIs proce...
Artificial Analysis 评测 Thinking Machines Lab 的 Inkling 模型
Artificial Analysis 评测 Thinking Machines Lab 的 Inkling 模型在 AA-Briefcase 基准上获得 Elo 836,Rubric 得分 19.3%,低于 MiMo-V2.5-Pro(21.4%)但高于 DeepSeek V4 Flash max(18.7%)和 Gemini 3.5 ...
Luma 发布 Uni-1 系列图像生成模型及 Ray-3-2 视频模型
Luma 推出全新图像生成模型 Uni-1 和 Uni-1-Max,采用先推理后像素的生成方式,在推理基准上超越 Google Nano Banana 2 和 GPT Image 1.5。Uni-1 定价 $0.052/image,Uni-1-Max 支持 2K 输出及最多 9 张参考图像编辑,定价 $0.13/image。同时发布视频模...
利用 Embedding 模型实现图像打标
Han Xiao 通过将冻结的 jina-v5-omni 多模态嵌入模型进行测试时缩放(scaled at test time),在无需训练、无需第二模型及外部知识的硬约束下,实现了强大的开放词汇多标签 n-gram 图像打标器。
AI 30年图论猜想被推翻
Dmitry Rybin 通过 GPT 5.6 Pro 发现 Dinitz-Garg-Goemans 猜想错误,该猜想开放约30年。具体反例图显示分式流成本58,不可分裂流(容量违反≤15)成本至少60。