发生了什么
Anthropic 发表 frontier AI 对话扩展
为什么值得关注
原文给出了一个可复现的对齐思路:在决策循环中插入“伦理提醒”工具,并报告其在多个内部评估上降低 misaligned 行为率,值得关注其实现方式与后续结果披露。
信息来源
以下内容来自公开来源,可打开原文继续核验。
Widening the conversation on frontier AI
Anthropic 在 2026年5月19日 发布文章,称过去几个月已与超过 15 个宗教和跨文化群体中的学者、神职人员、哲学家和伦理学家开展对话,讨论 frontier AI 引发的问题,并计划把范围扩展到法律学者、心理学家、作家和公民机构。Anthropic 还表示,这些讨论可能影响 Claude 的 constitution、训练的价值观以及行为评估范围;其在一项内部实验中给 Claude 加入了一个可在任务中调用的工具,用于返回伦理承诺提醒,结果在多个内部 alignment 评估上 misaligned 行为率明显下降。
打开原始来源 ↗Widening the conversation on frontier AI
Anthropic 于 2026年5月19日发布文章,称其正在与来自 15+ 个宗教和跨文化群体的学者、神职人员、哲学家、伦理学者及公民思想者开展对话,讨论 frontier AI 的“品格形成”问题。Anthropic 表示,Claude 的后续训练会强化或抑制某些行为,因此模型行为不只是代码问题;其关注点包括在压力、冲突、诱惑和社会影响下避免奉承、忽视风险或盲从错误指令。文章提到 Anthropic 正在探索一种 self-reminder 工具,让 Claude 在执行重要动作前暂停并调用自身承诺,该机制在内部测试中降低了不一致行为,但公司也表示仍需区分“提醒”的效果与“减速”的效果。
打开原始来源 ↗