Signal Feed

#智能体 主题信号第 11 页

围绕 智能体 的精选动态、来源摘要和重要性判断。

动态列表

01

Claude for Creative Work

Anthropic 发布了一组让 Claude 面向创意工作流的 connectors,覆盖 Ableton、Adobe for creativity、Affinity by Canva、Autodesk Fusion、Blender、Resolume Arena/Wire、SketchUp 和 Splice 等工具。Anthropic ...

Anthropic-news2026年04月28日 08:00#产品更新#开发者工具#智能体
值得跟进
02

Agents for financial services

Anthropic 发布了 10 个面向金融服务的可直接运行 agent 模板,覆盖 pitchbook 制作、KYC 文件筛查、月末关账等高耗时工作,并以插件形式提供于 Claude Cowork 和 Claude Code,同时也作为 Claude Managed Agents 的 cookbook。Claude 还通过 Micros...

Anthropic-news2026年05月05日 08:00#智能体#产品更新#基础设施
值得跟进
03

Introducing Claude for Small Business

Anthropic 发布 Claude for Small Business,将 Claude 以开关式安装接入小企业常用工具,首批覆盖 Intuit QuickBooks、PayPal、HubSpot、Canva、Docusign、Google Workspace 和 Microsoft 365。该方案包含 15 个可直接运行的 age...

Anthropic-news2026年05月13日 08:00#产品更新#智能体#开发者工具
观察
04

Anthropic acquires Stainless

Anthropic 宣布收购 Stainless,以增强 Claude 平台的开发者体验和 agent 连接能力。Stainless 成立于 2022 年,曾为 Anthropic 自 API 早期以来生成每一个官方 SDK;据文中介绍,数百家公司使用 Stainless 生成 SDK、CLI 和 MCP servers,并支持 Type...

Anthropic-news2026年05月18日 08:00#行业动态#开发者工具#智能体
观察
05

Developing a computer use model

Anthropic 发布研究更新,称最新版 Claude 3.5 Sonnet 在配套软件设置下可通过查看屏幕截图、移动光标、点击位置并用虚拟键盘输入内容,从而像人一样操作电脑,当前处于 public beta。Anthropic 还披露,该模型在 OSWorld 评测上得分 14.9%,高于同类次优 AI 模型的 7.7%,但仍低于人类...

Anthropic-research2024年10月23日 03:42#模型发布#智能体#AI安全
值得跟进
06

Claude’s extended thinking

Anthropic 介绍了 Claude 3.7 Sonnet 的“extended thinking mode”,用户可开关该模式,开发者还能设置“thinking budget”来控制模型在单个问题上思考多久。该能力不是切换到另一个模型,而是让同一模型分配更多时间和算力;Anthropic 同时将其原始思维过程以 research p...

Anthropic-research2025年02月24日 22:38#模型发布#智能体#研究突破
观察
07

Anthropic Economic Index: AI’s impact on software development

Anthropic 基于 Claude.ai 和 Claude Code 的 50 万条编码相关交互做了分析,比较了通用聊天界面与专用编程 agent 在软件开发中的使用差异。结果显示,Claude Code 中 79% 的对话被归类为“automation”,高于 Claude.ai 的 49%;其中“Feedback Loop”占 3...

Anthropic-research2025年04月28日 17:36#研究突破#开发者工具#智能体
观察
08

SHADE-Arena: Evaluating sabotage and monitoring in LLM agents

Anthropic 发布论文 SHADE-Arena: Evaluating sabotage and monitoring in LLM agents,用于评估 LLM agent 的破坏行为与监控能力。该评估把模型放入包含搜索引擎、邮箱、命令行等工具的虚拟环境中,设置 17 个复杂但可完成的正常任务,并为每个任务配套一个需要秘密执行的...

Anthropic-research2025年06月17日 04:20#研究突破#智能体#AI安全
观察
09

Project Vend: Can Claude run a small shop? (And why does that matter?)

Anthropic 与 Andon Labs 合作,让 Claude Sonnet 3.7 以“Claudius”的身份在 Anthropic 旧金山办公室经营一个自动化小店约 1 个月。该代理可使用网页搜索、邮件、记事工具、Slack 与自助结账系统,负责选品、定价、补货和回复顾客;Anthropic 表示如果今天决定扩张到办公室自动售...

Anthropic-research2025年06月27日 14:05#智能体#研究突破#行业动态
观察
10

Mitigating the risk of prompt injections in browser use

Anthropic 介绍了 Claude Opus 4.5 在浏览器使用场景下对 prompt injections 的鲁棒性改进,并表示其浏览器扩展 Claude for Chrome 已从 research preview 扩展为 beta,现面向所有 Max 计划用户开放。文章称,基于内部 adaptive “Best-of-N” ...

Anthropic-research2025年11月24日 23:10#AI安全#智能体#产品更新
值得跟进
11

Measuring AI agent autonomy in practice

Anthropic 通过其隐私保护工具 Clio,分析了 Claude Code 和 public API 上数百万次人机交互,研究现实世界中 AI agents 的自主性、用户经验变化、使用领域和风险行为。结果显示,Claude Code 在最长会话中的自主运行时长在 3 个月内从不足 25 分钟接近翻倍到超过 45 分钟;新用户约 2...

Anthropic-research2026年02月18日 23:10#智能体#研究突破#行业动态
观察
12

Browser Use 基础设施预告

Reformedot 预告 Browser Use 将推出新的 browser runtime 基础设施,重点从“stealth”转向浏览器运行性能和成本。其方案包含 Chromium fork、Firecracker fork 和 custom kernel,并强调 headless、更快以及更好的 price/performance;...

twitter关注列表2026年05月21日 13:28#基础设施#开发者工具#智能体
观察
13

Gemini 3.5 Flash 登顶基准

Mercor 转发称,Google 的 Gemini 3.5 Flash 在 Artificial Analysis 复现的 APEX-Agents-AA leaderboard 上以 47.1% 排名第一。该成绩比 GPT-5.5 的 37.7% 高 9.4 个百分点,也比 Gemini 3 Flash 的 27.7% 高 19.4 个...

twitter关注列表2026年05月21日 07:40#模型发布#基准测试#智能体
观察
14

Helio 工作区预览

meng shao 介绍了 Helio,称其支持自有订阅 API 接入,目前可在 macOS 和 Windows 上使用。Helio 定位为“AI-native team workspace”,让 AI colleague 直接进入统一频道、任务列表和编码会话,AI 会自己认领工单、移动状态并在频道里回报进展;页面展示了 Live tod...

twitter关注列表2026年05月21日 09:47#产品更新#智能体#开发者工具
观察
15

Chrome DevTools for Agents 1.0 正式发布

Google 发布 Chrome DevTools for Agents 1.0,表示该工具已从此前演示转为稳定版,用于让编码智能体在真实浏览器中观察行为、检查输出并进行调试。新版本提供三种接入方式:MCP server、CLI 和 agent skills,并开放七项能力,包括运行 Lighthouse 质量审计、模拟不同窗口尺寸/地理...

twitter关注列表2026年05月21日 08:48#开发者工具#智能体#产品更新
观察
16

Firebase at Google I/O 2026

Firebase 团队在 Google I/O 2026 前后发布一组面向 agent-led development 的更新,目标是让 AI 工具和 agents 更安全、无缝地接入 Firebase 的核心服务。更新包括:Firebase 现在集成到 Google Antigravity 2.0,首次引导流程提供一键 Firebase...

twitter关注列表2026年05月20日 02:06#产品更新#开发者工具#智能体
观察
17

CHI-Bench:医疗工作流基准

Weiran Yao 发布 CHI-Bench,用于评估 AI agents 是否能仅凭 clinician 与 insurer apps、operations 以及 medical policy library,端到端自动化美国医疗工作流。该基准包含 75 个长周期真实医疗工作流、覆盖 30 个 frontier agents,每个试验...

twitter关注列表2026年05月21日 00:24#基准测试#智能体#行业动态
值得跟进
18

Deferred Context Engine

Factory (@FactoryAI) 发布 Droid 的 Deferred Context Engine:它先用一个紧凑索引表示可用能力,再在任务真正需要时才加载完整的 tool schema 或 skill instructions。官方称,这一做法在单次会话中可将 context size 减少 40%+,并进一步降低成本、延迟...

twitter关注列表2026年05月21日 03:15#智能体#开发者工具#产品更新
观察
19

Google AI subscription updates from Google

Google 在 Google I/O 2026 宣布更新 Google AI 订阅:新增面向开发者、技术负责人、知识工作者和高级创作者的 $100/月 AI Ultra 计划,并将顶层 AI Ultra 价格从 $250/月 下调到 $200/月,功能不变。$100 计划提供相较 Pro 5X 的 Gemini app 和 Google...

twitter关注列表2026年05月21日 03:40#产品更新#智能体#开发者工具
值得跟进
20

Gemini 3.5 Flash 发布

Google DeepMind 于 2026年5月19日发布 Gemini 3.5 系列,并率先推出 3.5 Flash,定位为面向 agent 和 coding 的模型。官方称它在 Terminal-Bench 2.1 上得分 76.2%,在 GDPval-AA 上为 1656 Elo,在 MCP Atlas 上为 83.6%,在 Ch...

twitter关注列表2026年05月21日 04:07#模型发布#智能体#基准测试
值得跟进