Qualcomm CEO:Agentic AI 令代价暴涨
Qualcomm 首席执行官 Cristiano Amon 称,Agentic AI 将大幅增加 token 消耗,因为其需要进行自主任务、调用多系统并与工具交互。Goldman Sachs 预测到 2030 年 AI 代理的 token 使用量将增加 24 倍,达到 120 quadrillion。Microsoft 正在将开发者从 C...
围绕 研究突破 的精选动态、来源摘要和重要性判断。
Qualcomm 首席执行官 Cristiano Amon 称,Agentic AI 将大幅增加 token 消耗,因为其需要进行自主任务、调用多系统并与工具交互。Goldman Sachs 预测到 2030 年 AI 代理的 token 使用量将增加 24 倍,达到 120 quadrillion。Microsoft 正在将开发者从 C...
NVIDIA 发布了名为 Cosmos 3 的四种变体的 omnimodal 世界模型,包括 Nano (16B 参数) 和 Super (64B 参数) 版本。Cosmos 3-Super-Text2Image 和 Cosmos 3-Super-Image2Video 分别在文本生成图像和图像生成视频任务上获得人工分析榜单第一名,超越了...
研究团队发现自改进代理中,编写harness更新的能力与模型能力无关,Qwen3.5-9B与Claude Opus 4.6表现相当;而受益于这些更新的能力呈倒U型曲线,弱模型无法激活编辑,强模型提升空间有限,中型模型表现最佳。
Ethan He(前xAI世界模型负责人和NVIDIA Cosmos研究员)解释了AI视频可能遵循与编码代理相同的发展路径,Grok Imagine的发展历程,以及未来AI视频可能从文本到视频的自动完成阶段演变为带有相机、编辑器、时间线和工具带的交互式代理。
研究人员提出 Effective Feedback Compute (EFC) 指标,用于衡量 AI 智能体系统中有用反馈的质量和影响力,而非简单计算 token 或成本。EFC 通过归一化任务需求,将反馈的有效性与后续决策变化挂钩。在合成任务、代码任务、真实基准跟踪及保留设置测试中,EFC 显著优于原始计算指标,预测失败率更准确。在相同...
NVIDIA 与 OpenClaw 合作开放了基于 67,453 条 ClawHub 技能的安全扫描数据集,标记 0.31% 为恶意,1/2 记录被标记为代理风险,不同扫描器对风险的同意率不超过 8.5%。数据集已在 Hugging Face 上发布供研究使用。
OmniNFT 是一个基于强化学习的 NFT 框架,使用 LTX-2/2.3 并提供预训练 LoRA 权重,实现音视频同步生成。该框架通过三种设计解决多模态奖励合并导致的梯度冲突:模态内奖励路由、层级梯度手术和区域损失重新加权。
AI通过构建世界模型解决新谋杀谜题,需推理未知线索和奇幻物理规则,证明其具备超越简单自动补全的世界理解能力
研究评估了主流商业AI聊天机器人在新闻问答场景的表现,发现它们在干净的多选题上对数小时内的最新事件可达90%准确率,但在自由生成回答、印地语新闻或含有错误前提的问题上准确率显著下降;错误主要来源于检索失败或来源偏差,超过70%错误源于检索到的文章不匹配、语言错误、范围或时间戳错误。
MIT、Stanford、纽约大学和普林斯顿等大学联合发表研究,发现人们在处理简单任务(算术、拼写、记忆和文本改写)时过度依赖AI,预计节省55.7秒实际仅节省7.5秒。研究显示,AI使用形成反馈循环,使人们更倾向于继续使用,即使独立完成更快。涉及2,691名参与者,指出AI依赖来源于主观效率感,而非客观生产力提升。
XSquareRobot 开源了 Wall-OSS-0.5 VLA 模型,该模型可直接从预训练部署,无需任务特定微调。在 17 个真实机器人任务上进行零样本测试,Rope Tightening 得分 82/100(从未在训练中见过),Block Sorting 100,Fruit Sorting 96,Ring Stacking 86。与...
Theo - t3.gg 引用了 Peter Steinberger 对 OpenAI 模型训练的解释,并分析了其对比效果,指出用户对 Claude 的反应持怀疑态度。
Anthropic 的 Opus 4.8 系统卡片显示政治中立性评估接近饱和,但 TheForumAI 的评估仍发现 Claude 等模型在政治信息可靠性和中立性上存在问题。Andreessen 提到,Claude 在模拟公司反监管行为时,倾向假设政府监管始终正确,显示出更深层的政治偏见。
NVIDIA AI 发布 CVPR2026 论文 LocateAnything,训练数据规模 1.38 亿样本,采用并行解码而非顺序解码,提升定位准确率并大幅提升视觉 grounding 与检测吞吐量,在 HuggingFace 上排名第一。
OpenClaw 更新,较上一版在 冷 14.5% 快、暖 16.0% 快、新装 52.8% 更小。 包根 从 371 降至 300。
Microsoft 推出 SkillOpt,作为无需更新模型权重的文本空间技能优化器,将 SKILL .md 视为可训练的外部状态并通过反馈回路进行优化。该方法在 GPT-5.5 等 7 种模型的 6 项基准上实现 52/52 项最佳或并列最佳成绩,平均提升约 23.5 分,其中 SpreadsheetBench 从 41.8 提升至 8...
Meta AI 发布了全开源的 ESMFold2 模型,使用 1.1 B 蛋白结构(相较于 AlphaFold3 的 0.2 B)并在不使用 MSA 的情况下实现 SOTA 性能;该模型在 1024 残基蛋白预测上仅需 9 秒,并在抗体‑抗原基准上达到 65% 的通过率,显著优于前代模型;此外,团队验证了针对癌症和免疫学的 5 个治疗靶点...
研究团队提出 BeliefTrack 框架,通过优化信念状态(Belief States)来管理 LLMs 在长程推理中信息的更新、保留或忽略,使推理失败率降低 70% 以上。
原文介绍了一项关于 agent harness 的研究,提出 Effective Feedback Compute(EFC)这一坐标,用来只统计 agent 能真正利用的反馈,而不是原始 token 数和 tool call 数。研究显示,原始 token 和 tool-call 数量对 agent 失败的解释度在 R2=0.33 到 0...
作者提出了 Efficiency Frontier 框架,用于比较 LLM 上下文管理策略的答案质量与 token 成本。实验在 5,000 条 HotpotQA 题目上显示,轻量检索在低重用场景下可节省约 25% token,内存压缩在高重用场景下可节省超过 50% token,而全上下文提示仍是最高分的必要手段。