一句话判断
本文提供了 AGENTS.md 规则的具体编写方法和评测维度,值得点开原文参考方法论并尝试应用。
核心信息
OpenAI 为 Codex Code Review 新增 AGENTS.md 自定义规则功能,允许团队将 reviewer 的隐性知识(如兼容性要求、数据边界)写入规则文件,使审查召回率从 58.3% 提升至 98%。文章提供了规则编写方法和四维评测框架(覆盖、克制、保持、可操作性),并建议从 reviewer 反复解释的检查开始迭代。
原始内容
相关动态
Google AI模型排名急降
Google发布Gemini 3.6 Flash模型,在Frontend Code Arena排名12(原排名21),得分1537分;涉及参数量、排名变化数据
AgentLoop: 解决Agent非确定性混沌的运维方案
Alibaba Cloud推出AgentLoop,解决传统APM无法处理Agent非确定性混沌的问题,提供非侵入式全栈轨迹捕获、Agent-as-Judge(90%+人类对齐评估)和自我演化能力。
Agent Swarm 与新模型经济学:Fable 5 全程两万刀,Opus 规划 + Composer 执行一千三
Cursor团队使用多智能体系统(Planner+Worker模式)从零实现Rust版SQLite,通过新harness在4小时内达到100%测试通过率,成本从$1,339(Opus planner+Composer worker)到$20,057(Fable 5全程),关键发现是模型组合质量接近但成本差异达15倍,协调成本与上下文效率比...
Unity发布CLI免费开放AI Agent接入
Unity推出了Unity CLI,提供终端原生方式连接编码代理、CI流水线和自定义工具,同时保留MCP模式,并免费开放,无并发限制。此举使AI Agent能直接在终端操作引擎、跑构建、迭代项目,降低了AI辅助Unity开发的门槛。
Kimi K3 AA-Briefcase 评测
Artificial Analysis 公布了 Kimi K3(2.8T 参数)在 AA-Briefcase 基准测试中的结果:Elo 1543,仅次于 Claude Fable 5(1574),较 Kimi K2.6 提升 727;但每任务平均成本 $10.57,耗时 56.4 分钟,远高于竞品。