Signal Feed

#智能体 主题信号第 6 页

围绕 智能体 的精选动态、来源摘要和重要性判断。

动态列表

01

Firecrawl 上线 /monitor

Firecrawl 上线了 /monitor 功能,支持用户输入一个 URL,并用自然语言描述要跟踪的目标,系统会按设定频率监测页面变化并通过 webhook 推送给 AI agent。官方称该方案只摄取真正变动的部分,最多可减少 90% 的 LLM tokens,diff 中会列出新增、删除和修改内容,并提供 permalink。功能支...

twitter关注列表2026年05月29日 07:17#基础设施#开发者工具#智能体
观察
02

SIA 自我改进框架

Sumanth 引用并转发了关于 Self Improving AI(SIA)的帖子,称该框架可以让任意 AI 系统在基准任务上通过自我反馈循环持续提升性能。原文称 SIA 在每次运行后会同时更新自身的 harness、底层模型权重和 memory layer;在 OpenAI 的 MLE-Bench 上,它登上排行榜首位,超过了专门的 ...

twitter关注列表2026年05月29日 00:13#开源#智能体#基准测试
观察
03

WallStreetPrep 的财务建模评测

WallStreetPrep 对面向真实财务工作的 AI 财务建模代理做了一次评测,任务不是玩具提示词,而是为 Apple 构建历史与预测财务报表,要求引用来源、链接假设、添加附表并保证工作簿可审计。测试中 Primer 这一 AI financial modeling tool 表现领先,其方法是先生成更强的三表模型,再把结果转换为可审...

twitter关注列表2026年05月29日 05:29#行业动态#产品更新#智能体
观察
04

Introducing Claude Opus 4.8

Anthropic 将 Claude Opus 升级到 Claude Opus 4.8,称其在各项 benchmark 上较 Opus 4.7 有改进,并在定价上保持不变。claude.ai 新增可调节 Claude 处理任务所投入 effort 的功能,Claude Code 新增 dynamic workflows,可处理更大规模问题...

Anthropic-news2026年05月28日 08:00#模型发布#产品更新#智能体
值得跟进
05

LocateAnything视觉检测模型

NVIDIA AI研究团队在CVPR2026会议上发布了LocateAnything视觉语言检测模型,该模型在HuggingFace上趋势排名第一。模型训练于138M高质量样本,采用并行解码边界框技术而非传统的一次一个坐标方式,提高了定位精度并大幅增加视觉定位和检测的吞吐量。

twitter关注列表2026年05月29日 02:00#研究突破#模型发布#智能体
观察
06

Claude Opus 4.8

Anthropic 发布了 Claude Opus 4.8,价格与上一代 4.7 持平;官方称其判断更准确、更诚实地承认不确定性,并且能更长时间独立执行 agent 任务。同步上线 fast mode,速度约提升 2.5 倍,价格比以前便宜 3 倍,在 Claude Code 中可用 /fast 开启,API 用户需找客户经理申请或排队。

twitter关注列表2026年05月29日 01:30#模型发布#开发者工具#智能体
值得跟进
07

Opus 4.8 上线

Anthropic 发布 Opus 4.8,并表示它比之前版本更诚实,会承认自己不知道的内容,并在自己的代码里发现问题而不是掩盖。该模型被推荐用于 Claude Code 的日常使用。Anthropic 还在 Claude Code 中以 research preview 形式推出 dynamic workflows:Claude 可以先...

twitter关注列表2026年05月29日 01:31#模型发布#智能体#开发者工具
观察
08

Claude Opus 4.8 发布

Claude团队发布Opus 4.8版本,相比Opus 4.7在速度(2.5倍快)、成本(3倍便宜)和代码能力(74.6% agentic terminal coding)上有显著提升,新增动态工作流功能可通过并行子代理协作处理复杂工程任务,验证机制通过对比子代理结果迭代优化结果。

twitter关注列表2026年05月29日 01:40#模型发布#开发者工具#智能体
值得跟进
09

HexoAI 开源 SIA

HexoAI 发布开源自我改进框架 SIA(Self Improving AI framework),主张在反复利用自身任务反馈训练后,模型不仅能改进外部工作流(harness),还会更新自身权重。原文称该方法在 LawBench 上提升 56.6%,GPU kernels 运行时减少 91.9%,在单细胞 RNA 去噪任务上相对基线提升...

twitter关注列表2026年05月29日 02:20#开源#研究突破#智能体
值得跟进
10

TERMS-Bench 发布

Erica (@ericavaneee) 团队发布 TERMS-Bench,一个用于评测 LLM agents 在真实经济谈判场景中的三层基准。该基准不使用 LLM-as-judge,也不依赖 outcome rubrics,而是由环境本身作为验证器。结果显示,在前沿模型中 AnthropicAI 的 Claude Opus 4.6 排名...

twitter关注列表2026年05月29日 00:33#基准测试#智能体#大模型
值得跟进
11

Anthropic 发布 Opus 4.8,提升推理能力和成本效率

Anthropic 发布 Opus 4.8 模型,核心改进包括判断能力提升、诚实度增强、处理长度扩展,保持原价。新增功能:快速模式速度提升至 2.5x(成本降低 3 倍)、动态工作流支持并行运行数百个子代理(Claude Code),Claude 应用新增努力控制功能。

twitter关注列表2026年05月29日 00:51#模型发布#开发者工具#智能体
值得跟进
12

Claude Opus 4.8 上线

Claude 发布 Opus 4.8,称其在 Opus 4.7 基础上提升了判断力、自我进展诚实度,以及更长时间的独立工作能力。官方同时表示,Fast mode 已可用,速度约为原来的 2.5 倍,成本比之前低 3 倍;引用原帖还称该模型“今天按同样价格 उपलब्ध”。原文提到基准测试中 Agentic coding 提升尤其明显。

twitter关注列表2026年05月29日 01:04#模型发布#智能体#基准测试
值得跟进
13

Claude Code 动态工作流

ClaudeDevs 在 Claude Code 的 research preview 中推出 dynamic workflows:Claude 会先按任务现场生成 orchestration script,再并行调度一组 coordinated subagents 处理复杂任务。该功能从今天起可用于 Max、Team、Enterpris...

twitter关注列表2026年05月29日 01:05#智能体#产品更新#开发者工具
观察
14

Claude Code 动态工作流

Anthropic 在 Claude Code 中加入 Dynamic Workflows(research preview)。Claude 会先制定计划,再动态生成编排脚本,在单次会话里运行几十到数百个并行 subagents,并在向用户返回前先校验结果。该能力面向复杂的 legacy codebase 场景,例如跨整个 service...

twitter关注列表2026年05月29日 01:06#智能体#产品更新#开发者工具
观察
15

HF science team 异步 RL 权重同步优化

clem 🤗 介绍了 Hugging Face science team 在 TRL 中实现的异步 RL 权重同步优化:每个 RL step 不再同步完整权重,只导出变化的元素为稀疏 safetensors 文件,通过 Hugging Face Bucket 分发给 vLLM。对于 Qwen3-0.6B,单步传输载荷从 1.2 GB 降到...

twitter关注列表2026年05月28日 21:23#开源#智能体#基础设施
观察
16

SWE-rebench 更新

Ibragim (@ibragim_bad) 更新了 live benchmark SWE-rebench 的 3 月到 5 月版本,新增了更多 fresh 和 complex 的 GitHub issue+PR 任务,并对每个 model/scaffold 运行了 110 个任务、每个任务重复 5 次。该基准计划每两个月更新一次任务集,...

twitter关注列表2026年05月27日 23:52#基准测试#智能体#开发者工具
观察
17

Your Agents Are Aging Too: Agent Lifespan

德克萨斯大学团队提出论文《Your Agents Are Aging Too: Agent Lifespan Engineering for Deployed Systems》,指出 AI agents 在部署后即使底层模型不变,也会随着多轮会话、记忆压缩、事实更新和维护流程而逐步失去可靠性。论文提出基准 AgingBench,用于评估 ...

twitter关注列表2026年05月28日 19:43#研究突破#智能体#基准测试
观察
18

腾讯云 Agent Memory 方案

腾讯技术工程团队介绍了 TencentDB Agent Memory 的短期记忆压缩方案,核心是“上下文卸载”与 Mermaid 任务画布结合:将完整工具调用结果、网页正文、日志等外部保存,只在上下文中保留摘要和索引,再用带状态、摘要和时间戳的 Mermaid 图组织任务进度与依赖关系。文章还提出四层记忆架构,包括原始原文、工具级 JSO...

twitter关注列表2026年05月28日 16:47#智能体#开发者工具#基础设施
值得跟进
19

我们如何在多个产品中约束 Claude

Anthropic Engineering 介绍了其在三个主要产品中约束 AI 智能体的工程方法,涵盖 https://t.co/4zA6V9Pu5R、Claude Code 和 Claude Cowork。文章区分了三类风险:用户滥用、模型行为不当、外部攻击者,并对应三类防御组件:环境、模型、外部内容。文中给出三种隔离模式:用于 htt...

twitter关注列表2026年05月28日 15:25#智能体#基础设施#AI安全
观察
20

Qwen3.7-Max 跻身 ITBench-AA 第3

Artificial Analysis 与 IBM Research 发布 ITBench-AA,这是一个用于评估模型在 agentic enterprise IT 任务上的新基准,首个场景是 Site Reliability Engineering(SRE)。该基准共包含 59 个 SRE 任务,其中 40 个公开任务、19 个全新留出...

twitter关注列表2026年05月28日 16:08#基准测试#智能体#行业动态
值得跟进