Claude Code 新插件 security-guidance
Claude Code 发布了插件 security-guidance,用两个 Claude 实例配合完成代码审查:一个实例负责写代码,另一个使用全新上下文和独立 prompt 审查刚修改的内容。插件采用三层机制,从浅到深分别是 per-edit 正则匹配、turn 结束后的 diff review,以及 commit/push 时读取调...
围绕 智能体 的精选动态、来源摘要和重要性判断。
Claude Code 发布了插件 security-guidance,用两个 Claude 实例配合完成代码审查:一个实例负责写代码,另一个使用全新上下文和独立 prompt 审查刚修改的内容。插件采用三层机制,从浅到深分别是 per-edit 正则匹配、turn 结束后的 diff review,以及 commit/push 时读取调...
CMU 发布了新基准“Odysseys”,用于评测更困难的任务。Alexander Yue 在引用原帖中表示,Microsoft 近期用 auto-eval agent WebWright 在该榜单上以 61% 领跑,而他今天用 BrowserCode 和 Opus 4.7 跑出了 70%。
微软联合上海交通大学、复旦大学、同济大学等机构提出 SkillOpt 框架,用于自动评估并迭代优化 Agent 的 skill。论文中,该框架通过 harness 闭环让大模型先写 skill,再在独立验证集上跑分,只有分数提升的文本编辑才会保留;其编辑操作包括增加、删除、替换文本。实验显示,GPT-5.5 的直接对话准确率因此提升了 2...
Anthropic 的 Mythos 在真实 curl 代码库中发现了 1 个真实漏洞。360 安全团队的漏洞挖掘 agent 则在更广泛的 OpenClaw 生态中独立发现了 23 个缺陷,其中包括高危远程代码执行漏洞和大规模 prompt-injection 绕过。原文指出,agent 时代的 AI 安全关键不再只是模型能否找出 bu...
DAIR.AI 转引一篇关于长上下文 agent 的论文,提出让语言模型在运行中加入类似“睡眠”的离线巩固步骤:模型会周期性地对最近上下文做 N 次离线递归前向,然后把结果写入 state-space blocks 的 persistent fast weights,并清空 KV cache。这样可把额外计算挪到“睡眠”阶段,同时保持“清...
Anthropic 发表文章,系统总结了如何在 claude.ai、Claude Code 和 Claude Cowork 等产品中约束 Claude 的权限边界,以控制 agent 的“爆炸半径”。文中给出两个方向:一是通过 human-in-the-loop 监督,Anthropic 发现 Claude Code 的权限提示用户会批准...
Artificial Analysis 对 Google 的 Gemini 3.5 Flash 进行了评测,结果显示其输出速度最高约 280 tokens/sec,在速度与智能的帕累托前沿上,明显快于 Gemini 3 Flash。该模型在 agentic 任务上约达到 1650 ELO(GDPVal-AA),但代价是总成本约为 Gemi...
Playad,一个基于多智能体系统的AI营销团队,近日发布并提供完整付费营销周期服务。该系统通过持续使用逐步完善对品牌的理解,并在每个周期中学习以优化广告创意与绩效的关联。公司已融资540万美元,宣称可将广告制作成本降低最高90%,并自动关联创意与绩效数据,目标用户包括每月花费3000至40000美元的广告投放团队。
Anthropic x Forum Ventures 黑客松冠军团队 Affaan Mustafa 和队友使用 Claude Code 用时 8 小时完成了一个产品并获得冠军,奖品为 1.5 万美元 API credits。赛后他们将背后的 AI 编程工作流整理并开源为 ECC(Everything Claude Code)仓库,包含 6...
来自 Meta、Stanford、Google 等实验室的论文提出 AutoResearchClaw(arxiv:2605.20025),讨论如何让自动化研究在 AI 出错、恢复、并在合适时机请求人类介入时表现更好。论文强调将辩论、修复、验证、记忆和选择性人类输入纳入同一个受治理的循环,而不是单纯提高自治程度。作者报告,在 ARC-Ben...
Meta、CMU等实验室发表论文提出Self-Play SWE-RL方法,使编码代理能通过在真实项目中制造和修复bug来自我训练。该方法将学习单位从标记任务转为可执行情境,一个模型版本探索真实代码库、削弱测试、注入有意义的bug并留下测试工件;另一个版本需要修复系统以恢复测试行为。相比于传统方法依赖人类编写的问题描述、拉取请求、测试和注释...
团队提出 KPop,用自适应 binary-KL 区域替代 IcePop 里的固定比例 mask,以匹配每个 token 的噪声强度,从而提升大型 MoE 模型的 RL 训练稳定性和长时程 agentic RL 更新稳定性。该方法宣称无需修改基础设施、无需 routing replay,仅通过一个参数即可生效,并使 Ring-2.6-1T...
Qwen3.7-Max 被称为全球第 2 的 AI 编程模型,在 Code Arena 上得分 1541,仅次于 Claude。其面向生产场景,支持持续 35 小时任务、1000+ 次工具调用,并可将原本 2 周的项目压缩到数小时完成。
Meta、Stanford 和 Illinois 的一篇综述论文提出,AI agents 在把 code 作为主要工作层时表现更好。作者指出,单纯的 LLM 更像文本预测器,长任务中容易丢失状态、掩盖错误,并把计划脆弱地转成动作;他们把围绕模型的系统称为 agent harness,包括工具、记忆、沙箱、检查和反馈回路。论文的核心观点是让...
xAI 的 CLI 工具 Grok Build 开启测试,定位对标 Claude Code 和 Codex。SuperGrok 与 X Premium+ 用户可直接安装并授权账户,按订阅用量使用;其支持 macOS、Linux、Windows,提供交互式 TUI 和 Headless 无人值守两种运行方式。功能上包括 Plan 模式、Al...
Anthropic 的 Claude Design 团队展示了如何用 Claude 自己把设计工具从 0 做到可上线,并打通“自然语言 → 品牌一致的设计 → 生产代码”的流程。团队采用每天与用户对话、每 1–2 天发布、24 小时内修复问题、用实验而不是长期预测的工作方式,同时用 Claude 自建反馈追踪、分析和探索等内部工具。团队还...
开源团队 Onyx 采用一种反直觉的深度研究架构:把负责调度的 orchestrator 的搜索权限完全移除,只允许它拆解问题、撰写任务 brief、评估下级 agent 的中间报告。整个系统保持两层结构,上层调度器最多将复杂问题拆成 6 个研究方向,下层 3 个隔离 research agent 每个最多运行 8 轮“搜索-阅读-思考”...
阿里云开发者团队分享了在高德地图 PC 站 SEO 场景中构建 AI 自主增长系统的实践,系统借鉴 OPC 和 Harness Engineering 思想,通过 Orchestrator、状态机流程、子 Agent 分工、独立评审门禁和 Benchmark 驱动的自进化机制,实现从需求发现到代码上线的全链路自动化。文章给出两层 Benc...
高德地图 PC 站在 SEO 增长场景下,借鉴 Harness Engineering 和 OPC 思路,搭建了一个多 Agent 自主增长系统,覆盖增长机会发现、方案设计、PRD 编写、架构设计、代码实现、测试验证到日常环境发布的完整链路。文章称该系统以「路书」功能做验证,从输入提案到发布日常环境全程 0 人为介入,连续运行 4 小时,...
Anthropic 官宣 Claude 将推出新功能 Memory Files,用户可以在 Memory Files 和经典记忆模式之间二选一。Claude 会在聊天过程中自动写入结构化笔记,并在相关时读取,用户还可以随时浏览和编辑这些笔记。原文将其与此前发现的 “Knowledge Bases” 迭代版作对比,并提到这种机制更接近 Op...