Signal Brief

Grok 4.5 在 VulcanBench v3 排名第一

Grok 4.5 在 VulcanBench v3 基准测试中以 91.3% 的分数排名第一。

twitter关注列表 DogeDesigner (@cb_doge) 发布 2026-07-24 收录 2026-07-24 观察

一句话判断

Grok 4.5 的具体得分数据,可作为性能参考。

核心信息

Grok 4.5 在 VulcanBench v3 基准测试中以 91.3% 的分数排名第一。

原始内容

Grok 4.5 takes the #1 spot on VulcanBench v3 with a 91.3% score. 🔥 https://t.co/PnWqfjRprb ![photo](https://pbs.twimg.com/media/HN90cgKbIAAFhY9.jpg)

相关动态

01

Sakana AI 发布 Fugu-Ultra v1.1

Sakana AI 团队发布 Fugu-Ultra v1.1,通过动态编排最新前沿模型,性能比 v1.0 提升最多7.9分,在复杂编码和推理任务上超越 Fable 5(即使未在 agent pool 中使用它),且价格保持不变。

twitter关注列表2026-07-24#产品发布#模型
观察
02

The Stack v3 发布:最大的开放代码数据集

BigCode 社区发布 The Stack v3,这是迄今最大的开放代码数据集,包含 114 TB 原始数据、15.9 TB 处理后数据、约 5T 去重 tokens,涵盖 770 种编程语言和 2.24 亿仓库,完全开放且无限制许可。相比 2024 年的 v2(68 TB raw / 550B tokens / 618 种语言),v3...

twitter关注列表2026-07-23#技术#开源#模型
观察
04

OpenAI 推出桌面版 ChatGPT Voice 语音控制功能

OpenAI 在 macOS 和 Windows 桌面应用中推出 ChatGPT Voice 功能,基于 GPT-Live 模型,支持用户通过语音控制电脑、同时指挥多个 agents,实现语音交互与任务协调。该功能面向 Plus、Pro、Business、Edu 和 Enterprise 计划用户,全球逐步上线。

twitter关注列表2026-07-23#AI#产品更新#模型
观察
05

AI医疗索赔代理

PE支持的医疗账单平台在四个月内部署了七个生产级AI代理,处理真实医疗索赔并确保零PHI泄露。他们通过构建包含34个动态变量的丰富化层、固定架构和严格的输出模式验证,将调用路由在两个模型提供商之间进行交换而不影响输出。与常规直接接入模型的做法相比,该团队花费的工程时间主要用于构建评估套件和数据预处理,实现了可靠的生产运行。

twitter关注列表2026-07-23#技术#评测#发布
观察