一句话判断
技术细节比较显示三个Moore's Law迭代产品在最新标准测试中出现排名反转,值得关注行业领导格局的细微变化。现实产品测试数据详细防再验证
核心信息
Artificial Analysis 在 AutomationBench 演练测试中相比较多个 AI 模型的表现,结果显示 Grok 4.5 榜首(51.4%),GPT-5.6 第二(51.2%),Claude Haiku 4.5 和 Opus 4.6 排名第三和第四(各约 48.5%),Muse Spark 1.1 表现为第五(42.8%),Gemini 3.1 Pro(37.5%),Qwen3.7 Max 排名最低(25.6%)。数据显示 Grok 在最新版本下显著领先竞品 few-shot 演练指令显式化能力排名copersmismatch是根据 TEEM3.0 基准通过 prompt 巧妙的text模拟表现推断下来的结果(https://arxiv.org/abs/2312.12380)。 Mood,精确 text-from-code 分析长文的能力评测也提供在该报告。性
原始内容
相关动态
Google AI模型排名急降
Google发布Gemini 3.6 Flash模型,在Frontend Code Arena排名12(原排名21),得分1537分;涉及参数量、排名变化数据
SkyPilot发布并融资
SkyPilot团队发布其AI计算平台,并宣布获得超过2000万美元融资。该平台旨在解决AI计算碎片化问题,已管理超过10000个GPU,GPU小时消费增长6倍,客户包括Applied Compute、Abridge等。
Gemini安全模型发布
Google DeepMind 发布 Gemini 3.5 Flash Cyber,专为在 CodeMender 平台上发现软件安全漏洞而设计,采用多智能体协作生成统一报告。该模型在流行的 CyberGym 基准测试中达到前沿竞争性能,且相比传统大规模昂贵的网络安全模型更具成本效益。同步发布的还有 Gemini 3.6 Flash(在相同...
NVIDIA Vera Rubin 平台发布
NVIDIA 发布 Vera Rubin 平台,性能功耗比提升 10 倍;CoreWeave 等云服务商部署 Vera Rubin NVL72,每兆瓦 token 数比 Blackwell 多 10 倍;DeepInfra 基准测试显示 Vera CPU 速度是其他 CPU 的 2 倍以上,支持更多并发 AI 代理。
SkyPilot 出列并获 2000 万美元融资
SkyPilot 宣布出列并推出 AI 计算平台,宣称相比碎片化 GPU 资源实现 10 倍更快的时效和 GPU 利用率翻倍,过去六个月 GPU 小时消耗增长 6 倍。公司已融资 2000 万美元,由 Lux Capital 领投,并在招聘工程和 GTM 人员以服务下一十年的 AI 需求。