一句话判断
新增自主调度机制,有价值的商业化应用价值,但技术细节仍需补充。
核心信息
Offloop开发了D1调度模型,降低多代理系统的冗余成本,在GDPval基准测试中达成SOTA,与Claude Code和Codex相比效率提升显著,关键数据未明确具体值量值数据(如2.4万亿年收入、技术细节)未具体说明,属于中等价值资讯。
原始内容
相关动态
京东开源 JoyAI-VL-Interaction 实时视频交互模型
京东开源了 8B 参数的 JoyAI-VL-Interaction 模型,专为实时视觉驱动交互设计。在 26 个视频理解基准上平均得分 57.53,超过 Qwen3-VL-8B-Instruct 3.37 分。模型每秒处理直播视频并决定是否发言或保持沉默,交互时序通过时间对齐数据和强化学习学习,无需外部检测器。开源内容包括训练配方、数据和...
ChatGPT 健康功能面向美国用户
OpenAI 开始向美国用户滚动 ChatGPT 健康功能,支持连接 Apple Health 与医疗记录,每周有超过 3 亿人进行健康相关提问。该功能基于 GPT‑5.5 Instant 与 GPT‑5.6 Sol 两代模型,经数百名医师评估,且不使用连接的医疗数据进行模型训练或广告定位。
Gemma 4 下载量突破 3 亿
Google Gemma 宣布 Gemma 4 模型下载量已突破 3 亿次。
Google DeepMind推出Gemini 3.5 Flash Cyber,轻量化模型专为安全团队设计
Google DeepMind开发Gemini 3.5 Flash Cyber以提升代码漏洞检测效率。该模型通过测试自家代码库(如Google Chrome和Android代码库),展现出捕捉标准模型忽略的复杂漏洞能力,无营销性言论或质量评价。Google DeepMind推出Gemini 3.5 Flash Cyber, Google ...
Harness Handbook论文提升编码代理规划胜率
Harness Handbook论文提出使用静态分析和LLM辅助的BGPD流程,构建从运行时行为到源码位置的映射,在60个修改请求上规划胜率从28.3%提升至38.3%和从26.7%提升至45.6%,规划器token使用下降12.7%和8.6%,文件级和符号级F1在24个对比中全面优于GPT-5.5和Opus 4.8参考计划,定位失败减少...