发生了什么
OpenAI 发布 LifeSciBench 基准(750 任务, 七流程)
为什么值得关注
该基准强调真实研究场景而非知识测试,值得关注 AI 在科学推理上的进展。
信息来源
以下内容来自公开来源,可打开原文继续核验。
01
OpenAI 发布 LifeSciBench 基准
OpenAI 与 173 位科学家合作发布 LifeSciBench,包含 750 个专家编写的任务,覆盖七个生物研究流程,用于评估 AI 在真实研究场景中的推理、不确定性处理等能力。初始结果显示 GPT-Rosalind 在全部流程上得分超过 GPT-5.5。
打开原始来源 ↗