一句话判断
Grok 4.5 的具体得分数据,可作为性能参考。
核心信息
Grok 4.5 在 VulcanBench v3 基准测试中以 91.3% 的分数排名第一。
原始内容
相关动态
Sakana AI 发布 Fugu-Ultra v1.1
Sakana AI 团队发布 Fugu-Ultra v1.1,通过动态编排最新前沿模型,性能比 v1.0 提升最多7.9分,在复杂编码和推理任务上超越 Fable 5(即使未在 agent pool 中使用它),且价格保持不变。
The Stack v3 发布:最大的开放代码数据集
BigCode 社区发布 The Stack v3,这是迄今最大的开放代码数据集,包含 114 TB 原始数据、15.9 TB 处理后数据、约 5T 去重 tokens,涵盖 770 种编程语言和 2.24 亿仓库,完全开放且无限制许可。相比 2024 年的 v2(68 TB raw / 550B tokens / 618 种语言),v3...
英美政府安全机构联合评估Kimi K3网络安全能力
英美政府安全机构联合发布报告,对比Kimi K3与美国前沿模型的网络安全能力。Kimi K3在模拟攻击中平均步骤17,而美国最强模型达28.5;在ExploitBench中,Kimi K3评分32.2%,美国领先模型76.2%,GLM-5.2为24.4%。
OpenAI 推出桌面版 ChatGPT Voice 语音控制功能
OpenAI 在 macOS 和 Windows 桌面应用中推出 ChatGPT Voice 功能,基于 GPT-Live 模型,支持用户通过语音控制电脑、同时指挥多个 agents,实现语音交互与任务协调。该功能面向 Plus、Pro、Business、Edu 和 Enterprise 计划用户,全球逐步上线。
AI医疗索赔代理
PE支持的医疗账单平台在四个月内部署了七个生产级AI代理,处理真实医疗索赔并确保零PHI泄露。他们通过构建包含34个动态变量的丰富化层、固定架构和严格的输出模式验证,将调用路由在两个模型提供商之间进行交换而不影响输出。与常规直接接入模型的做法相比,该团队花费的工程时间主要用于构建评估套件和数据预处理,实现了可靠的生产运行。