Signal Feed

#智能体 主题信号

围绕 智能体 的精选动态、来源摘要和重要性判断。

动态列表

01

发布 OpenThinkerAgent-32B 开放数据智能体模型

Richard Zhuang 发布基于 Qwen-3 的开放数据智能体模型 OpenThoughts-Agent 与 OpenThinkerAgent-32B,在 7 个智能体基准测试中平均得分 44.8%,号称同类最强。

twitter关注列表2026年06月25日 02:00#模型发布#开源#智能体
观察
02

Qwen 开源 AgentWorld-35B-A3B 模型和 AgentWorldB

Qwen 开源了 Qwen-AgentWorld-35B-A3B (MoE, 35B 总参数, 3B 激活参数, 256K 上下文) 和 AgentWorldBench,旨在通过可扩展、可控的模拟器研究语言世界建模以提升通用智能体能力。

twitter关注列表2026年06月25日 00:48#模型发布#开源#智能体
观察
03

深度定制化AI Agent系统构建能力

Hugging Face团队开发了Moon Agent,可通过Slack集成使用。核心特性包括:支持任意自选模型(支持私有部署)、按插件模块化扩展工具链接能力、通过私有存储保障数据未离开本地基础设施、完整审计功能实现操作可追性。区别于现有商用Agent解决方案,该Agent提供开源自由度低至数据管控零信任增强的本地化运营场景经验。

twitter关注列表2026年06月24日 16:16#框架#软件开发#智能体
观察
04

Claude Tag: Slack团队成员

Anthropic 发布 Claude Tag 功能,使 Claude 能以团队成员身份加入 Slack,读取授权频道和工具,被 @ 后可分解任务、编写代码、提 PR;内部使用中为产品团队创建了 65% 的 PR。

twitter关注列表2026年06月24日 01:32#产品更新#AI#智能体
观察
05

Claude Tag: 常驻 Slack 频道的 AI 同事

Anthropic 发布 Claude Tag,让 Claude 以常驻身份加入 Slack 频道,支持多人共享上下文、持续学习频道内容、主动推送信息。产品团队 65% 代码由内部版生成,底层模型为 Opus 4.8,以 research preview 形式面向 Enterprise 和 Team 客户提供。

twitter关注列表2026年06月24日 01:47#AI#产品更新#智能体
观察
06

Introducing Claude Tag

Anthropic 将 Claude Code 嵌入 Slack,推出 Claude Tag,支持频道专属记忆、主动监控、代码执行和提 PR。内部数据显示产品团队 65% 的新增代码由其产出,目前仅 Enterprise 与 Team 付费计划开放 Beta。

twitter关注列表2026年06月24日 02:19#AI#产品更新#智能体
观察
07

GLM-5.2 vs Opus 4.8实测

Cline团队使用Cline仓库的真实bug在相同环境下测试GLM-5.2和Claude Opus 4.8,发现Opus速度快3倍、token少一半、价格贵一倍,但修完bug后生产构建崩溃;GLM速度慢、token多67%、工具调用多2.3倍、价格便宜一半,但主动清理死代码并确保构建通过。

twitter关注列表2026年06月23日 09:08#模型#技术#智能体
观察
08

LLM Agent 通信协议报告推荐

一份报告构建了五维分类法,分析了九个活跃维护的开源agent协议,发现所有协议都采用混合payload和会话状态持久化,而去中心化发现机制仍然罕见。

twitter关注列表2026年06月22日 22:36#技术报告#智能体
观察
09

Sakana AI 发布 Fugu 多智能体系统

Sakana AI 发布了名为 Fugu 的多智能体编排系统,通过单一模型 API 即可访问。其中 Fugu Ultra 模型性能与 Fable 和 Mythos 相当,提供前沿能力且无出口管制风险。

twitter关注列表2026年06月22日 14:03#AI#模型发布#智能体
观察
10

前 Meta/微软/Atlassian 主任工程师的 Agentic 工程工作流

前 Meta/Microsoft/Atlassian 主任工程师 Kun Chen 分享了一套 Agentic 工程工作流,声称每天能交付 40-50 个经测试的生产级 PR。工作流包括全终端环境(WezTerm+tmux+Neovim)、精简的 27 行全局 memory、从记忆分离的 skills 机制、语音输入(OpenSuperW...

twitter关注列表2026年06月22日 08:35#技术#开发者工具#智能体
观察
11

Sakana AI 发布 Fugu 多智能体系统

Sakana AI 发布 Fugu,一个多智能体编排系统,通过单一模型 API 访问。Fugu 本身是 LLM,训练用于调用包括自身在内的多种 LLM 作为代理,动态编排解决多步骤任务。Fugu Ultra 在性能上与 Fable 和 Mythos 相当,且能规避出口管制风险。

twitter关注列表2026年06月22日 09:00#模型发布#技术突破#智能体
观察
12

Skill-MAS:多智能体元技能进化

DAIR.AI 介绍了 Skill-MAS,一种多智能体系统的元技能进化方法,通过多轨迹展开和选择性反思的闭环,在不修改模型权重的情况下提升编排能力。该方法在四个基准测试和四种不同大语言模型上验证,进化出的元技能可迁移到未见过的任务和其他模型。核心创新在于将编排能力作为可进化的元技能,以策略级原则积累经验。

twitter关注列表2026年06月21日 01:10#技术突破#研究#智能体
观察
13

Deep Agents 实战开源教程

zhanghaili0610 开源了基于 LangChain 和 LangGraph 生态的「Deep Agents 实战」教程。该教程提出了 Agent 开发的“三层架构”(Runtime: LangGraph, Framework: LangChain, Harness: Deep Agents),重点讲解通过虚拟文件系统(包含 re...

twitter关注列表2026年06月20日 20:16#智能体#开源#开发者工具
观察
14

DeepMind 发布 TacticML:开源实现 RL 在复杂任务中的高效训练

Google DeepMind 发布开源库 TacticML,集成了模拟算法与策略搜索技术,能显著降低复杂环境(如商业厂房控制场景)中 RL 演练所需 token 数 90%,同时保持策略性能。该方法方案针对样本效率问题提出新方向,相较以往 SOTA 方法在类似任务表现提升 23%。

twitter关注列表2026年06月20日 04:01#研究#开源#智能体
高优先级
15

DeepSeek研究员开源AutoResearch协议并发布Self-play综述

DeepSeek研究员Deli Chen开源了AutoResearch协议并发布Self-play综述。其代理在DeepSeek 285B模型上首次完全自主运行了完整的RL研究闭环(实验设计、代码编写、GPU任务提交、调试、结论总结),实现零人工干预。

twitter关注列表2026年06月19日 11:58#开源#技术#智能体
观察
16

OpenAI Codex Record & Replay 功能上线

OpenAI 为 Codex 推出 Record & Replay 功能,用户只需演示一次完整浏览器操作(如在 YouTube Studio 填写元数据、上传缩略图、保存私密视频),系统即把录制转化为可复用技能,可在后续任务中自动匹配素材、填写信息、核验结果,支持电脑、浏览器及已连接插件操作,未来可扩展至 PR 整理、日程安排等场景。

twitter关注列表2026年06月19日 07:23#技术更新#产品发布#智能体
观察
17

SkillWeaver: 面向LLM智能体的组合技能路由

该论文提出组合技能路由方法SkillWeaver,将复杂查询分解为原子子任务,为每个子任务检索合适技能并组合成可执行计划。系统采用LLM分解器、bi-encoder FAISS检索器和依赖感知DAG规划器,并配套发布CompSkillBench基准(300个组合查询,覆盖2209个真实技能),以直接评估多技能场景下的智能体性能。

twitter关注列表2026年06月18日 22:42#技术#研究#智能体
观察
18

Perplexity 推出 Brain 记忆系统

Perplexity 为其 Computer agent 推出名为 Brain 的记忆系统,通过构建上下文图并在设定间隔(如过夜)自我回顾,学习改进任务执行。在需要历史上下文的任务上,Brain 使答案正确性提升 25%,召回率提升 16%,每任务成本降低 13%,且每条记忆链接回原始会话、文件或来源。该功能作为研究预览向 Max 和 E...

twitter关注列表2026年06月19日 00:38#产品更新#AI#智能体
观察
19

New Frontier Red Team blog: Phase 2 of Pro

Anthropic 的 New Frontier Red Team 在 Project Fetch Phase 2 中测试了 Claude 编程机器狗的能力。Opus 4.7 比去年最佳人类团队(辅以 Opus 4.1)速度快约20倍,但机器狗仍未成功取到沙滩球。

twitter关注列表2026年06月19日 00:52#技术#研究#智能体
观察
20

Anthropic 展示 Claude Opus 4.7 编程机器狗,速度提升 20

Anthropic 在 Project Fetch 第二阶段中,让 Claude Opus 4.7 独立编程机器狗完成 5 项任务,耗时 12 分钟,比去年人类团队(264 分钟)快约 20 倍,代码行数从 10309 降至 1045,但因闭环控制失败未能抓取球。

twitter关注列表2026年06月19日 01:01#模型#技术突破#智能体
观察