一句话判断
该方法揭示了代理基准所需的不同能力(如规划、验证),并提供了低成本的评估替代方案,值得阅读原文了解具体实现。
核心信息
Yueqi Song 及合作者发布 PACE,一种通过从非代理基准中选取少量实例来预测代理基准性能的方法。在 14 个模型、4 个代理基准和 19 个非代理基准上,PACE 实现了 3.80% 的绝对分数预测 MAE、0.81 的 Spearman 排名相关、约 84% 的成对偏好准确率,以及约 100 倍的成本降低。
原始内容
相关动态
Databricks 融资 30 亿美元估值 1880 亿
数据平台 Databricks 正在进行一轮 30 亿美元的 Series M 融资,估值达 1880 亿美元,由 Coatue 领投。
Kimi K3非对称竞争分析
Kimi K3在Arena前端/WebDev人类盲测中以1679 Elo排名第一,领先Fable 5(1631)和GPT-5.6 Sol(1618),但在综合智能指数中仅排第四(57.1分),落后Fable 5(59.9)和GPT-5.6 Sol(58.9)。K3定价15美元/百万输出tokens,远低于Fable 5的50美元,并计划7...
二年级学生Jo Nagai发现蝴蝶可遗传记忆
日本东京都二年级学生Jo Nagai注意到养育的食蚜 caterpillars 在蝴蝶化后仍保持对薰衣草的回避行为,经Georgetown大学Entomologist Dr. Martha Weiss合作完成实验:70%训练过的蝴蝶及其后代均表现出对薰衣草的遗传性回避,记忆在全变态发育中保存并遗传。
Claude Fable 5 计划调整:从7月20日起在Max和Team Premium中50%额度
Anthropic宣布从7月20日起,Claude Fable 5将纳入Max和Team Premium计划,但限制为50%的使用额度。Pro和Team Standard用户将通过使用额度继续访问,并获一次性$100信用额度。公司称需求难以预测,因此分阶段推出并持续增加容量。
BestBlogs 早报 · 07-18
月之暗面发布Kimi K3,2.8万亿参数,896选16的Stable LatentMoE,上下文100万token,接近Fable-5但仍落后最强闭源模型,完整权重7月27日前开源;VentureBeat调查显示54%企业已发生AI代理安全事件;xAI开源Grok Build(84万行Rust代码)并残留上传用户代码痕迹;Cursor评...