Code as Agent Harness
Xuying Ning、Katherine Tieu、Dongqi Fu、Tianxin Wei、Zihao Li、Yuanchen Bei 等人发布综述《Code as Agent Harness: Toward Executable, Verifiable, and Stateful Agent Systems》,并同步维护了配套仓库...
围绕 研究突破 的精选动态、来源摘要和重要性判断。
Xuying Ning、Katherine Tieu、Dongqi Fu、Tianxin Wei、Zihao Li、Yuanchen Bei 等人发布综述《Code as Agent Harness: Toward Executable, Verifiable, and Stateful Agent Systems》,并同步维护了配套仓库...
University of Illinois Urbana-Champaign、Meta 和 Stanford University 相关作者发布了 2026 年的 survey《Code as Agent Harness: Toward Executable, Verifiable, and Stateful Agent Systems...
Intology 发布了 NanoGPT-Bench,用于评测代码智能体在开放式 AI R&D 任务上的表现,基于 NanoGPT Speedrun 基准,要求智能体在无人工干预、无互联网访问的情况下,从截至 2025 年 9 月 3 日的人类世界纪录出发,恢复接下来 2025 年 9 月 3 日到 2026 年 1 月 19 日约 5 ...
Google DeepMind 发布了 Gemini for Science,一套实验性工具,目标是帮助科学家探索更多假设、在更大规模上验证研究结果,并更方便地梳理文献。其中文提到的 2 个能力包括:基于 Co-Scientist 的 Hypothesis Generation,用多智能体“idea tournament”生成、辩论和评估...
向阳乔木转述了 Yann LeCun 在播客 Unsupervised Learning 中的访谈内容:他已从 Meta 离职并创办新公司 AMI(Advanced Machine Intelligence),继续押注 JEPA、世界模型和在表示空间做预测的路线,明确反对把 LLM 视为通往人类级智能的主路径。文中给出的核心技术判断是:L...
Nous Research 发布 Contrastive Neuron Attribution(CNA),一种通过对比提示对来定位并消融稀疏 MLP 神经元电路的方法,且不需要训练 sparse autoencoder、不修改权重,也不会降低通用能力基准表现。该方法只用少量能诱发目标行为及其相反行为的对比提示对,找出激活差异最大的前 0....
NVIDIA 在 Hugging Face 上发布了 Nemotron CLIMB Proxy Models,两款仅 62M 和 350M 参数的 decoder-only 小模型,使用 10T tokens 训练,目标是做 scaling law 研究并在无需完整大规模算力的情况下预测更大模型行为。对行业而言,这类 proxy mode...
PolyAI 发布了面向客服场景的 Raven 3.5,并称其在 4 个客户服务基准上均超过 GPT-5 和 Claude Sonnet 4.6,且延迟保持在 300ms 以下。文章同时介绍了两款新产品 ADK 和 PolyPhone,显示企业语音 AI 正从传统呼叫中心方案转向更易开发、可快速上线的产品基础设施。
Odyssey 发布了 Agora-1,一个多智能体 world model,可支持最多 4 个人类或 AI 参与者在同一实时模拟世界中互动,并提供了一个可试玩的研究预览,示例是多人 GoldenEye 死斗。它的意义在于把 world model 从单人预测推进到共享状态一致性的多人环境,指向游戏、仿真、教育和机器人等更广泛的交互式 A...
Meta 的一篇新论文提出了 AIRA-Compose 和 AIRA-Design 两个协作智能体,用于自动发现神经网络架构,并在 24 小时算力预算内找到在 350M、1B、3B 规模上优于 Llama 3.2 的模型设计。论文结论表明,将“规划”和“实现”拆分为两个 agent,能在真实架构搜索任务中优于单一端到端 agent,对未来...
一篇论文提出用弱推理模型的多候选结果配合执行/证明信号做筛选,在 SWE-bench Verified 上,GPT-5.4 nano 通过 8 个候选的 critic-comparator 编排达到 76.4%,可匹配单体 Gemini 3 Pro 和 Claude Opus 4.5 Thinking。结论是许多正确补丁早已存在于弱模型的...
OdysseyML 发布了 Starchild-1,宣称这是首个实时多模态世界模型,能够生成可交互的世界模拟,并且“首次”可被听见。该项目被定位为迈向通用世界模拟器的一步,若能力属实,意味着世界模型正从纯视觉走向多模态交互。
Alibaba 的 ModelScope 团队提出并开源了 Diffusion Templates:一种面向扩散模型的统一插件框架,尝试把结构控制、亮度、颜色、图像编辑、超分辨率等可控能力做成可组合、可复用的组件。团队基于 FLUX.2-klein-base-4B 训练了 11 个模板并公开代码、模型和数据集,意味着扩散生态正从单点技巧走...
ModelScope 团队发布了 Diffusion Templates:一个统一的可控扩散插件框架,并同步开源了框架、训练代码、11 个模型和约 1.2 TB 的 ImagePulseV2 数据集(17 个子数据集,Apache 2.0)。这意味着可控扩散能力可以以更模块化、可组合的方式迁移到不同底座模型上,降低训练和集成门槛。
腾讯 Hunyuan 开源了 HY-World 2.0 的完整推理代码和全部模型权重,这是一个面向 3D 世界重建、生成与仿真的多模态 world model。该系统支持从文本、单张图像、多视图图像和视频生成可编辑、可导入引擎的 3D 世界资产,意味着世界模型正从“生成视频”走向“生成可交互的 3D 内容”。
作者提出 Heuristic Learning(HL)这一概念:用编码代理持续修改规则、状态检测、测试和记忆等代码结构,而不是更新神经网络权重。文中给出多个实验结果,显示纯程序化策略在 Atari Breakout、MuJoCo Ant、HalfCheetah 和 VizDoom 等任务上能达到接近常见 Deep RL 基线的表现,意味着...
作者在 arXiv 提交名为 Nexus 的多智能体框架,用于结合宏观/微观时间波动并融入上下文进行时间序列预测,展示出比传统模型更强的预测能力。
Daniel Miessler提出9级个人AI成熟度模型(PAIMM),从聊天机器人到主动助手的演进路径,揭示AI从被动回答到主动执行任务的转变趋势,对行业意味着需关注AI主动性与整合能力的发展方向
NBER 研究表明,AI 需求推动数据中心扩张,导致县级就业、工资、收入和房价上升,同时电价也随之提高。
研究人员进行了一项现场实验,发现使用 AI 的个人与不使用 AI 的人类团队在绩效上相当,AI 通过在人们技能较弱的任务上提供优于平均水平的表现来提升生产力。