Agent Arena
Arena.ai 发布 Agent Arena,用于在真实用户的实际任务中评估 agent,覆盖百万级 live sessions。该环境为模型提供 web search、filesystem 和 terminal 工具,任务包括写代码、做 slide deck、网页研究、构建应用和分析文档;系统基于 300K+ tasks、2M+ to...
围绕 智能体 的精选动态、来源摘要和重要性判断。
Arena.ai 发布 Agent Arena,用于在真实用户的实际任务中评估 agent,覆盖百万级 live sessions。该环境为模型提供 web search、filesystem 和 terminal 工具,任务包括写代码、做 slide deck、网页研究、构建应用和分析文档;系统基于 300K+ tasks、2M+ to...
Illinois、Tsinghua University 等实验室的一项研究发现,LLM agent 的记忆在反复被模型自身改写后会变得不可靠;相比之下,原始 episode(真实的历史尝试与解决方案)往往比被压缩成“经验总结”的文本更有用。研究在 web shopping、模拟世界、app 使用和 ARC 风格谜题等任务上进行测试,结果...
作者对 MiniMax-M3 做了前端、后端 Agentic Coding 和 Agent 能力测试,并给出使用经验总结。结论是,M3 的前端能力可适配 KCORES2026p2 的前端测试题目,在空间理解、建模精确度和场景美学上表现较好,但复杂需求一次写对能力不足;后端能力得分超过 deepseek-v4-pro 和其他一众国产大模型,...
文章描述了 Zara Zhang 开源的 feishu-claude-code-bridge 项目,实现了飞书与 Claude Code 的智能连接,支持无缝接入 Claude 命令行处理或流式输出,解决了跨平台文档生成和智能协作的问题。项目内容详实,涵盖配置、配置和实际使用案例,展示了 Moody AI 工具链的进一步扩展。
BestBlogs 早报 06-04 汇总了多条 AI 相关内容,重点包括微软 CEO Satya Nadella 在 Build 访谈中提出“Frontier Intelligence Platform”战略,强调企业 AI 壁垒来自 private eval,并提到 Azure 网络团队用 Agent 系统 Miles 将 500 余...
TownAI 正式推出 AI assistant Town,并结束 beta。公司同步宣布完成 5500 万美元 Series A 融资,由 a16z 的 Andreessen Horowitz 的 Angela Strange 领投,forerunner 的 Kirsten Green 参与,firstround、altcap 和 co...
国内团队开源了 OpenSquilla,用 Python 重写了“小龙虾”相关能力,重点解决 agent 太费 token、不按规则执行和安全问题。项目内置本地小模型做请求分诊:先把每个请求在本地向量化,判断是简单任务还是复杂任务,再分别路由到便宜模型或顶级模型;官方测试中,25 个任务纯用 Claude Opus 4.7 的总成本为 6...
Factory 推出 Factory Router,一个面向 coding-agent 的模型选择器。该系统把每次 coding-agent 运行视为一次路由决策,先分配给足够胜任任务的低成本模型类,如果会话开始失败或需要更深推理,再升级到更强的 frontier 模型。Factory 称其可在保持 Claude Opus-class 表...
论文提出 FluxMem,将智能体记忆从静态存储改为图结构连接:把事实、历史任务片段和可复用技能作为相互关联的节点管理。系统在执行任务时先检索可能有用的记忆,再根据任务反馈修补连接关系,包括补充缺失链接、删除错误链接,以及把记忆改写到合适的细节层级;同时会把重复成功的任务路径沉淀为可复用技能。作者在长对话记忆、网页导航和通用助手任务上测试...
初创公司Factory发布模型路由系统,通过动态路由不同基础模型优化成本与性能平衡。实现25%成本降低、同等或更高的任务准确率,但具体基准数据未提供。文中提及与Claude Code的关系作为案例,但未给出明确对比参数指标。
OpenAI 表示,Codex 每周已有超过 500 万人使用,其中非开发者约占整体用户的 20%,且增长速度比开发者快 3 倍以上。OpenAI 今日为 Codex 引入插件、内联注释和可通过 URL 分享到工作区的交互式网站/应用预览;同时发布 6 个角色插件,合计覆盖 62 个常用应用和 110 项技能,面向数据分析、创意制作、销售...
黄仁勋在Computex 2026上发布了N1X芯片,从牛仔裤口袋中取出,宣称这是人类有史以来最惊人的芯片。N1X采用台积电3nm工艺,配备20核Arm CPU和6144个CUDA核心的Blackwell GPU,拥有128GB统一内存和1 Petaflop AI算力,功耗仅45-80W,能本地流畅运行120B参数大模型并支持多个Agen...
Claude Code 核心开发者 @trq212 分享了一套用于人机结对编程的“理解验证”工作流,目标不是只让 Coding Agent 完成任务,而是让人类在会话结束时能复述、辩护问题、方案和影响。该工作流强调每次只推进一个可验收的小步骤,先让用户复述,再按缺口补课,并通过清单、开放题或多选测验来验证是否真正理解。文中将理解拆成问题域...
文章讨论了AI是否真实具备智能,引用了@atmoio 对 AGI 可行性的质疑,并指出实际进展与理论定义存在差距。强调可用的实用定义,关注人类可操作的应用。
研究团队发现自改进代理中,编写harness更新的能力与模型能力无关,Qwen3.5-9B与Claude Opus 4.6表现相当;而受益于这些更新的能力呈倒U型曲线,弱模型无法激活编辑,强模型提升空间有限,中型模型表现最佳。
研究人员提出 Effective Feedback Compute (EFC) 指标,用于衡量 AI 智能体系统中有用反馈的质量和影响力,而非简单计算 token 或成本。EFC 通过归一化任务需求,将反馈的有效性与后续决策变化挂钩。在合成任务、代码任务、真实基准跟踪及保留设置测试中,EFC 显著优于原始计算指标,预测失败率更准确。在相同...
NVIDIA宣布扩大DRIVE Hyperion生态系统,这是一个为全球L4级自动驾驶车队准备的机器人出租车平台。HUMAIN、VinFast与Autobrains_AI合作,以及Uber与Autobrains合作,将在东南亚、中东和欧洲推出基于DRIVE Hyperion的机器人出租车项目。该平台基于NVIDIA Halos、DRIVE...
微软 MAI Image 2.5 在 LM Arena 预览中展现出优于其他模型的指令遵循能力,是唯一能正确执行极简指令的模型。
OpenClaw 2026.5.28 版本发布,新增对 Claude Opus 4.8 和 Krea 图像模型的支持,优化 Gateway/插件/会话路径性能,Discord 进度草稿现在显示评论。
Nous Research 通过 Nous Portal 提供 Hermes Agent 的 30 天免费试用,该模型专注于多模态工作流、代码生成和智能体效率,用户反馈积极。试用包含 300+ 模型、专属折扣和捆绑工具(网络搜索、代码执行等)。