Firecrawl 上线 /monitor
Firecrawl 上线了 /monitor 功能,支持用户输入一个 URL,并用自然语言描述要跟踪的目标,系统会按设定频率监测页面变化并通过 webhook 推送给 AI agent。官方称该方案只摄取真正变动的部分,最多可减少 90% 的 LLM tokens,diff 中会列出新增、删除和修改内容,并提供 permalink。功能支...
围绕 智能体 的精选动态、来源摘要和重要性判断。
Firecrawl 上线了 /monitor 功能,支持用户输入一个 URL,并用自然语言描述要跟踪的目标,系统会按设定频率监测页面变化并通过 webhook 推送给 AI agent。官方称该方案只摄取真正变动的部分,最多可减少 90% 的 LLM tokens,diff 中会列出新增、删除和修改内容,并提供 permalink。功能支...
Sumanth 引用并转发了关于 Self Improving AI(SIA)的帖子,称该框架可以让任意 AI 系统在基准任务上通过自我反馈循环持续提升性能。原文称 SIA 在每次运行后会同时更新自身的 harness、底层模型权重和 memory layer;在 OpenAI 的 MLE-Bench 上,它登上排行榜首位,超过了专门的 ...
WallStreetPrep 对面向真实财务工作的 AI 财务建模代理做了一次评测,任务不是玩具提示词,而是为 Apple 构建历史与预测财务报表,要求引用来源、链接假设、添加附表并保证工作簿可审计。测试中 Primer 这一 AI financial modeling tool 表现领先,其方法是先生成更强的三表模型,再把结果转换为可审...
Anthropic 将 Claude Opus 升级到 Claude Opus 4.8,称其在各项 benchmark 上较 Opus 4.7 有改进,并在定价上保持不变。claude.ai 新增可调节 Claude 处理任务所投入 effort 的功能,Claude Code 新增 dynamic workflows,可处理更大规模问题...
NVIDIA AI研究团队在CVPR2026会议上发布了LocateAnything视觉语言检测模型,该模型在HuggingFace上趋势排名第一。模型训练于138M高质量样本,采用并行解码边界框技术而非传统的一次一个坐标方式,提高了定位精度并大幅增加视觉定位和检测的吞吐量。
Anthropic 发布了 Claude Opus 4.8,价格与上一代 4.7 持平;官方称其判断更准确、更诚实地承认不确定性,并且能更长时间独立执行 agent 任务。同步上线 fast mode,速度约提升 2.5 倍,价格比以前便宜 3 倍,在 Claude Code 中可用 /fast 开启,API 用户需找客户经理申请或排队。
Anthropic 发布 Opus 4.8,并表示它比之前版本更诚实,会承认自己不知道的内容,并在自己的代码里发现问题而不是掩盖。该模型被推荐用于 Claude Code 的日常使用。Anthropic 还在 Claude Code 中以 research preview 形式推出 dynamic workflows:Claude 可以先...
Claude团队发布Opus 4.8版本,相比Opus 4.7在速度(2.5倍快)、成本(3倍便宜)和代码能力(74.6% agentic terminal coding)上有显著提升,新增动态工作流功能可通过并行子代理协作处理复杂工程任务,验证机制通过对比子代理结果迭代优化结果。
HexoAI 发布开源自我改进框架 SIA(Self Improving AI framework),主张在反复利用自身任务反馈训练后,模型不仅能改进外部工作流(harness),还会更新自身权重。原文称该方法在 LawBench 上提升 56.6%,GPU kernels 运行时减少 91.9%,在单细胞 RNA 去噪任务上相对基线提升...
Erica (@ericavaneee) 团队发布 TERMS-Bench,一个用于评测 LLM agents 在真实经济谈判场景中的三层基准。该基准不使用 LLM-as-judge,也不依赖 outcome rubrics,而是由环境本身作为验证器。结果显示,在前沿模型中 AnthropicAI 的 Claude Opus 4.6 排名...
Anthropic 发布 Opus 4.8 模型,核心改进包括判断能力提升、诚实度增强、处理长度扩展,保持原价。新增功能:快速模式速度提升至 2.5x(成本降低 3 倍)、动态工作流支持并行运行数百个子代理(Claude Code),Claude 应用新增努力控制功能。
Claude 发布 Opus 4.8,称其在 Opus 4.7 基础上提升了判断力、自我进展诚实度,以及更长时间的独立工作能力。官方同时表示,Fast mode 已可用,速度约为原来的 2.5 倍,成本比之前低 3 倍;引用原帖还称该模型“今天按同样价格 उपलब्ध”。原文提到基准测试中 Agentic coding 提升尤其明显。
ClaudeDevs 在 Claude Code 的 research preview 中推出 dynamic workflows:Claude 会先按任务现场生成 orchestration script,再并行调度一组 coordinated subagents 处理复杂任务。该功能从今天起可用于 Max、Team、Enterpris...
Anthropic 在 Claude Code 中加入 Dynamic Workflows(research preview)。Claude 会先制定计划,再动态生成编排脚本,在单次会话里运行几十到数百个并行 subagents,并在向用户返回前先校验结果。该能力面向复杂的 legacy codebase 场景,例如跨整个 service...
clem 🤗 介绍了 Hugging Face science team 在 TRL 中实现的异步 RL 权重同步优化:每个 RL step 不再同步完整权重,只导出变化的元素为稀疏 safetensors 文件,通过 Hugging Face Bucket 分发给 vLLM。对于 Qwen3-0.6B,单步传输载荷从 1.2 GB 降到...
Ibragim (@ibragim_bad) 更新了 live benchmark SWE-rebench 的 3 月到 5 月版本,新增了更多 fresh 和 complex 的 GitHub issue+PR 任务,并对每个 model/scaffold 运行了 110 个任务、每个任务重复 5 次。该基准计划每两个月更新一次任务集,...
德克萨斯大学团队提出论文《Your Agents Are Aging Too: Agent Lifespan Engineering for Deployed Systems》,指出 AI agents 在部署后即使底层模型不变,也会随着多轮会话、记忆压缩、事实更新和维护流程而逐步失去可靠性。论文提出基准 AgingBench,用于评估 ...
腾讯技术工程团队介绍了 TencentDB Agent Memory 的短期记忆压缩方案,核心是“上下文卸载”与 Mermaid 任务画布结合:将完整工具调用结果、网页正文、日志等外部保存,只在上下文中保留摘要和索引,再用带状态、摘要和时间戳的 Mermaid 图组织任务进度与依赖关系。文章还提出四层记忆架构,包括原始原文、工具级 JSO...
Anthropic Engineering 介绍了其在三个主要产品中约束 AI 智能体的工程方法,涵盖 https://t.co/4zA6V9Pu5R、Claude Code 和 Claude Cowork。文章区分了三类风险:用户滥用、模型行为不当、外部攻击者,并对应三类防御组件:环境、模型、外部内容。文中给出三种隔离模式:用于 htt...
Artificial Analysis 与 IBM Research 发布 ITBench-AA,这是一个用于评估模型在 agentic enterprise IT 任务上的新基准,首个场景是 Site Reliability Engineering(SRE)。该基准共包含 59 个 SRE 任务,其中 40 个公开任务、19 个全新留出...