发生了什么
Univ of Texas 发表 AgingBench 基准
为什么值得关注
反共识结论:agent 可靠性随时间衰减,而非单次评测结果能反映;建议阅读原文以了解具体退化机制和测试方法。
信息来源
以下内容来自公开来源,可打开原文继续核验。
01
Your Agents Are Aging Too: Agent Lifespan
Univ of Texas 论文发现 AI agent 在部署后即使模型不变,也会因记忆管理(摘要、合并、更新、维护)逐渐变得不可靠,并提出 AgingBench 基准来评估 agent 跨会话的可靠性下降问题。
打开原始来源 ↗