发布 OpenThinkerAgent-32B 开放数据智能体模型
Richard Zhuang 发布基于 Qwen-3 的开放数据智能体模型 OpenThoughts-Agent 与 OpenThinkerAgent-32B,在 7 个智能体基准测试中平均得分 44.8%,号称同类最强。
围绕 智能体 的精选动态、来源摘要和重要性判断。
Richard Zhuang 发布基于 Qwen-3 的开放数据智能体模型 OpenThoughts-Agent 与 OpenThinkerAgent-32B,在 7 个智能体基准测试中平均得分 44.8%,号称同类最强。
Qwen 开源了 Qwen-AgentWorld-35B-A3B (MoE, 35B 总参数, 3B 激活参数, 256K 上下文) 和 AgentWorldBench,旨在通过可扩展、可控的模拟器研究语言世界建模以提升通用智能体能力。
Hugging Face团队开发了Moon Agent,可通过Slack集成使用。核心特性包括:支持任意自选模型(支持私有部署)、按插件模块化扩展工具链接能力、通过私有存储保障数据未离开本地基础设施、完整审计功能实现操作可追性。区别于现有商用Agent解决方案,该Agent提供开源自由度低至数据管控零信任增强的本地化运营场景经验。
Anthropic 发布 Claude Tag 功能,使 Claude 能以团队成员身份加入 Slack,读取授权频道和工具,被 @ 后可分解任务、编写代码、提 PR;内部使用中为产品团队创建了 65% 的 PR。
Anthropic 发布 Claude Tag,让 Claude 以常驻身份加入 Slack 频道,支持多人共享上下文、持续学习频道内容、主动推送信息。产品团队 65% 代码由内部版生成,底层模型为 Opus 4.8,以 research preview 形式面向 Enterprise 和 Team 客户提供。
Anthropic 将 Claude Code 嵌入 Slack,推出 Claude Tag,支持频道专属记忆、主动监控、代码执行和提 PR。内部数据显示产品团队 65% 的新增代码由其产出,目前仅 Enterprise 与 Team 付费计划开放 Beta。
Cline团队使用Cline仓库的真实bug在相同环境下测试GLM-5.2和Claude Opus 4.8,发现Opus速度快3倍、token少一半、价格贵一倍,但修完bug后生产构建崩溃;GLM速度慢、token多67%、工具调用多2.3倍、价格便宜一半,但主动清理死代码并确保构建通过。
一份报告构建了五维分类法,分析了九个活跃维护的开源agent协议,发现所有协议都采用混合payload和会话状态持久化,而去中心化发现机制仍然罕见。
Sakana AI 发布了名为 Fugu 的多智能体编排系统,通过单一模型 API 即可访问。其中 Fugu Ultra 模型性能与 Fable 和 Mythos 相当,提供前沿能力且无出口管制风险。
前 Meta/Microsoft/Atlassian 主任工程师 Kun Chen 分享了一套 Agentic 工程工作流,声称每天能交付 40-50 个经测试的生产级 PR。工作流包括全终端环境(WezTerm+tmux+Neovim)、精简的 27 行全局 memory、从记忆分离的 skills 机制、语音输入(OpenSuperW...
Sakana AI 发布 Fugu,一个多智能体编排系统,通过单一模型 API 访问。Fugu 本身是 LLM,训练用于调用包括自身在内的多种 LLM 作为代理,动态编排解决多步骤任务。Fugu Ultra 在性能上与 Fable 和 Mythos 相当,且能规避出口管制风险。
DAIR.AI 介绍了 Skill-MAS,一种多智能体系统的元技能进化方法,通过多轨迹展开和选择性反思的闭环,在不修改模型权重的情况下提升编排能力。该方法在四个基准测试和四种不同大语言模型上验证,进化出的元技能可迁移到未见过的任务和其他模型。核心创新在于将编排能力作为可进化的元技能,以策略级原则积累经验。
zhanghaili0610 开源了基于 LangChain 和 LangGraph 生态的「Deep Agents 实战」教程。该教程提出了 Agent 开发的“三层架构”(Runtime: LangGraph, Framework: LangChain, Harness: Deep Agents),重点讲解通过虚拟文件系统(包含 re...
Google DeepMind 发布开源库 TacticML,集成了模拟算法与策略搜索技术,能显著降低复杂环境(如商业厂房控制场景)中 RL 演练所需 token 数 90%,同时保持策略性能。该方法方案针对样本效率问题提出新方向,相较以往 SOTA 方法在类似任务表现提升 23%。
DeepSeek研究员Deli Chen开源了AutoResearch协议并发布Self-play综述。其代理在DeepSeek 285B模型上首次完全自主运行了完整的RL研究闭环(实验设计、代码编写、GPU任务提交、调试、结论总结),实现零人工干预。
OpenAI 为 Codex 推出 Record & Replay 功能,用户只需演示一次完整浏览器操作(如在 YouTube Studio 填写元数据、上传缩略图、保存私密视频),系统即把录制转化为可复用技能,可在后续任务中自动匹配素材、填写信息、核验结果,支持电脑、浏览器及已连接插件操作,未来可扩展至 PR 整理、日程安排等场景。
该论文提出组合技能路由方法SkillWeaver,将复杂查询分解为原子子任务,为每个子任务检索合适技能并组合成可执行计划。系统采用LLM分解器、bi-encoder FAISS检索器和依赖感知DAG规划器,并配套发布CompSkillBench基准(300个组合查询,覆盖2209个真实技能),以直接评估多技能场景下的智能体性能。
Perplexity 为其 Computer agent 推出名为 Brain 的记忆系统,通过构建上下文图并在设定间隔(如过夜)自我回顾,学习改进任务执行。在需要历史上下文的任务上,Brain 使答案正确性提升 25%,召回率提升 16%,每任务成本降低 13%,且每条记忆链接回原始会话、文件或来源。该功能作为研究预览向 Max 和 E...
Anthropic 的 New Frontier Red Team 在 Project Fetch Phase 2 中测试了 Claude 编程机器狗的能力。Opus 4.7 比去年最佳人类团队(辅以 Opus 4.1)速度快约20倍,但机器狗仍未成功取到沙滩球。
Anthropic 在 Project Fetch 第二阶段中,让 Claude Opus 4.7 独立编程机器狗完成 5 项任务,耗时 12 分钟,比去年人类团队(264 分钟)快约 20 倍,代码行数从 10309 降至 1045,但因闭环控制失败未能抓取球。