一句话判断
新增了 Grok 4.5 在真实发票处理任务中的量化对比数据,值得关注其实际工作性能。
核心信息
Ramp 测试了 Grok 4.5 等模型在 150k 张真实发票上的表现,Grok 4.5 获得最高完美提取率,击败了 Gemini Flash 3.6、GPT 5.6 Terra 和 Sonnet 5。
原始内容
相关动态
Claude Opus 5 在 AA-Briefcase 基准上领先 Fable 5,成本更低
Artificial Analysis 发布评测,Claude Opus 5 在 AA-Briefcase 基准上以 1720 Elo 领先,比 Claude Fable 5 高 146 点,成本降低 20% 至 $17.79 每任务,但推理时间更长,max 设置平均 36.2 分钟。
OpenCode爆炸增长数据
Y Combinator 在播客中披露,OpenCode(开源替代 Claude Code 和 Codex 的 AI 编码工具)自年初起增长至 460 万周活用户、1300 万月活用户,年化收入约 4000 万美元,处理了 7 万亿 tokens,CEO Jay V 谈到 Anthropic 争议和 20 倍增长驱动因素。
Atomic Agent GAIA基准胜Hermes
Atomic Agent在GAIA Level 1基准测试中以69.8%正确率超越Hermes的58.5%,速度快1.6倍(3h12m vs 5h10m),使用相同4-bit Qwen-3.6-35B模型和Apple M4 Max硬件,开源MIT许可。
Grok 集成 Google Workspace
Grok 已集成到 Google Workspace,通过侧边栏插件在 Sheets、Slides、Docs 中提供数据解释、公式书写、演示生成、文档起草等功能,无需频繁切换标签页,组织可批量部署。
Claude Opus 5 在 3D 编码测试中超越 Fable 5,价格仅为其三分之四
Anthropic 发布了 Claude Opus 5,官方称其为 '思慎且主动的模型',性能接近 Claude Fable 5 但价格仅为后者一半。Opus 5 在 frontier-bench v0.1(43.3%)、gdpval-aa v2(1861)、arc-agi-3(30.2%)、zapier automationbench(...