研究揭示 boredom 与 sadism 的关联
研究揭示 boredom 与 sadism 的关联,对 AI 应用有影响
围绕 研究突破 的精选动态、来源摘要和重要性判断。
研究揭示 boredom 与 sadism 的关联,对 AI 应用有影响
本期《Superintelligence》汇集了2026年5月至4月的AI领域重大动态,包括OpenAI 持续工作流的编码代理、DeepSeek V4 对NVIDIA 硬件的挑战、Anthropic 企业部署模式、AI 基础设施竞争(Google TPU、OpenAI 脱离 Microsoft)以及全球 AI 政策风险,覆盖模型发布、产业...
Gregor Zunic展示了一款名为'goal'的AI智能体,通过单一提示指令驱动构建GTA 6游戏,显示出每轮次自动实现新功能的能力,揭示了AI代理在软件开发中的高效Autonomous潜力
Google DeepMind 发布研究,揭示 AI 智能体安全的新视角:将模型本身之外的网络环境作为主要攻击面,提出覆盖感知、推理、记忆等六大类的 AI 智能体陷阱框架,展示隐藏提示注入、代理劫持等攻击可达 86% 成功率,指出网页隐性内容(如隐藏 HTML 注释)可能成为风险源。
伊利诺伊大学+清华大学等实验室的研究发现,LLM agents 在持续重写记忆时变得不可靠,导致性能显著下降,建议保持原始证据而非自动总结。
DAIR.AI 发布了 Theodore J Kalaitzidis 的新论文《The Evaluation Trap》,揭示了 AI 基准测试可能无法测量声称的能力,并引入了 Epistematics 方法论来改进评估。
Duke大学Fred Peng等人提出了一种名为REPR-ALIGN的新方法,通过在扩散语言模型训练过程中对齐隐藏状态到冻结的自回归教师模型,从而大幅提升训练效率,训练速度最高可提升4倍。
Mythos(与Anthropic的Glasswing团队相关)在五天内成功破解macOS,发现内核内存破坏漏洞,获XBOW和UK AISI等机构确认,标志着AI安全研究在苹果系统方面的重要突破。
一篇新论文提出单个神经元即可绕过大型语言模型的安全对齐,揭示了当前安全对齐机制存在容易被单一神经元利用的脆弱性。
英国国家AI安全研究所发现,Mythos和GPT-5.5在网络能力方面有重大提升,能力翻倍时间为4.5个月。
SenseNova-U1通过NEO-unify架构统一了多模态理解与生成,整合了视觉和语言任务,提升了模型的综合能力。该论文由多位作者于2026年5月12日发布,是当日最受欢迎的论文之一。
研究人员提出'Positive Alignment'概念,旨在开发AI系统积极支持人类繁荣,处理价值权衡并增强韧性。
AK@_akhaliq在X平台分享论文《TMAS: Scaling Test-Time Compute via Multi-Agent Synergy》,提出通过多智能体协同提升推理计算能力。
研究发现长期运行的Agent常因过早停止而失败,并在8项长时任务中测试了5种Harness,提出的Zenith在5/8任务上以43%成本击败最强基线。
Anthropic研究员发布了Model Spec Midtraining (MSM)研究,通过教导AI泛化的方式解决对齐中的泛化问题。
文章揭示了嵌入方法优化的突破性进展,通过测试时间计算实现500倍嵌入效率提升,并验证了计算量扩展的收益递减规律,揭示了多LoRA信号的门控机制特性
Anthropic Fellows 发布关于“内省适配器”的研究,提出让语言模型在训练后自报所学行为与潜在对齐风险的方法。该工作为模型可解释性与对齐验证提供了面向开发者的技术路径。