一句话判断
展示了 Gemini 3.6 Flash 在多模态 Agents 场景的实际应用案例,值得关注技术实现细节
核心信息
Google AI Developers展示了基于 Gemini 3.5 Flash-Lite 和 3.6 Flash 的多智能体系统,实时迭代可玩游戏设计,利用 Flash-Lite 进行设计、构建和验证拼图挑战,基于玩家实时行为平衡速度与推理。
原始内容
相关动态
Claude Opus 5 在 3D 编码测试中超越 Fable 5,价格仅为其三分之四
Anthropic 发布了 Claude Opus 5,官方称其为 '思慎且主动的模型',性能接近 Claude Fable 5 但价格仅为后者一半。Opus 5 在 frontier-bench v0.1(43.3%)、gdpval-aa v2(1861)、arc-agi-3(30.2%)、zapier automationbench(...
vLLM 发布 AFD 插件实现 MoE 推理优化
vLLM 发布实验性插件 vLLM AFD Plugin,实现 Attention-FFN Disaggregation (AFD),将 MoE 模型的注意力路径与专家路径分离为独立服务,支持独立扩缩,兼容 NVIDIA GPU 和 Ascend NPU。
OPUS 5超越Fable 5
Chubby♨️发布OPUS 5模型对比,声称在大多数评估中超越Fable 5。核心数据为评估结果比较,但未具体披露参数量、版本号或具体分数
Opus 5 在 ARC-AGI-3 上达到 30% 新 SOTA
Opus 5 在 ARC-AGI-3 基准上取得 30% 的得分,刷新该基准的 SOTA,且得分是次优模型的三倍。
Dari 开源路由模型
Dari团队开源了用于编码agent的自动路由模型,在Terminal-Bench 2.1上达到79.8%准确率,总推理成本仅$76,相比Frontier setup成本降低70%,性能与Fable相当。该小型微调模型会根据缓存决策动态选择模型,仅在必要时调用昂贵模型。