发生了什么Grok 发布 Grok 4.5(VulcanBench v3 91.3%) 为什么值得关注Grok 4.5 的具体得分数据,可作为性能参考。 信息来源 以下内容来自公开来源,可打开原文继续核验。 01 Grok 4.5 在 VulcanBench v3 排名第一 twitter关注列表 2026年07月24日 12:25 Grok 4.5 在 VulcanBench v3 基准测试中以 91.3% 的分数排名第一。 打开原始来源 ↗ ← 返回精选动态
01 Grok 4.5 在 VulcanBench v3 排名第一 twitter关注列表 2026年07月24日 12:25 Grok 4.5 在 VulcanBench v3 基准测试中以 91.3% 的分数排名第一。 打开原始来源 ↗
01 Kimi K3 发布:开源模型与闭源模型差距缩小 Moonshot AI 发布 Kimi K3,在 Artificial Analysis Intelligence Index 上获得 57 分。目前该指数排名最高的闭源模型为 Anthropic 的 Claude Opus 5 (61分)、Claude Fable 5 (60分) 以及 OpenAI 的 GPT-5.6 Sol (59分... twitter关注列表2026年07月28日 10:17#模型发布#评测#大模型 观察
02 Microsoft 公布 MAI-Cyber-1-Flash 网络安全模型 Microsoft 公布其网络安全模型 MAI-Cyber-1-Flash 与 MDASH 系统在 CyberGym 上达到 95.95% 的成绩,超过次优的 GPT-5.5 Cyber(85.6%),并能以领先模型一半的成本自动查找和修复代码漏洞。MDASH 协调超过 100 个专门代理,且将模型与安全上下文分离,实现模型可替换。 twitter关注列表2026年07月28日 04:30#AI安全#模型发布#评测 观察
03 Kimi K3 在 Agent Arena 领先开源模型 Arena.ai 发布 Agent Arena 评测,Kimi K3 (Max) 在开源模型中领先,净提升 +9.75%,在所有42个模型中排名第三,仅次于 Claude Fable 5 (High) 和 GPT 5.6 Sol (xHigh),而 GLM 5.2 (Max) 是下一个开源模型,净提升 +7.12%。 twitter关注列表2026年07月28日 04:53#评测#开源#技术 观察