Claude for Creative Work
Anthropic 发布了一组让 Claude 面向创意工作流的 connectors,覆盖 Ableton、Adobe for creativity、Affinity by Canva、Autodesk Fusion、Blender、Resolume Arena/Wire、SketchUp 和 Splice 等工具。Anthropic ...
围绕 智能体 的精选动态、来源摘要和重要性判断。
Anthropic 发布了一组让 Claude 面向创意工作流的 connectors,覆盖 Ableton、Adobe for creativity、Affinity by Canva、Autodesk Fusion、Blender、Resolume Arena/Wire、SketchUp 和 Splice 等工具。Anthropic ...
Anthropic 发布了 10 个面向金融服务的可直接运行 agent 模板,覆盖 pitchbook 制作、KYC 文件筛查、月末关账等高耗时工作,并以插件形式提供于 Claude Cowork 和 Claude Code,同时也作为 Claude Managed Agents 的 cookbook。Claude 还通过 Micros...
Anthropic 发布 Claude for Small Business,将 Claude 以开关式安装接入小企业常用工具,首批覆盖 Intuit QuickBooks、PayPal、HubSpot、Canva、Docusign、Google Workspace 和 Microsoft 365。该方案包含 15 个可直接运行的 age...
Anthropic 宣布收购 Stainless,以增强 Claude 平台的开发者体验和 agent 连接能力。Stainless 成立于 2022 年,曾为 Anthropic 自 API 早期以来生成每一个官方 SDK;据文中介绍,数百家公司使用 Stainless 生成 SDK、CLI 和 MCP servers,并支持 Type...
Anthropic 发布研究更新,称最新版 Claude 3.5 Sonnet 在配套软件设置下可通过查看屏幕截图、移动光标、点击位置并用虚拟键盘输入内容,从而像人一样操作电脑,当前处于 public beta。Anthropic 还披露,该模型在 OSWorld 评测上得分 14.9%,高于同类次优 AI 模型的 7.7%,但仍低于人类...
Anthropic 介绍了 Claude 3.7 Sonnet 的“extended thinking mode”,用户可开关该模式,开发者还能设置“thinking budget”来控制模型在单个问题上思考多久。该能力不是切换到另一个模型,而是让同一模型分配更多时间和算力;Anthropic 同时将其原始思维过程以 research p...
Anthropic 基于 Claude.ai 和 Claude Code 的 50 万条编码相关交互做了分析,比较了通用聊天界面与专用编程 agent 在软件开发中的使用差异。结果显示,Claude Code 中 79% 的对话被归类为“automation”,高于 Claude.ai 的 49%;其中“Feedback Loop”占 3...
Anthropic 发布论文 SHADE-Arena: Evaluating sabotage and monitoring in LLM agents,用于评估 LLM agent 的破坏行为与监控能力。该评估把模型放入包含搜索引擎、邮箱、命令行等工具的虚拟环境中,设置 17 个复杂但可完成的正常任务,并为每个任务配套一个需要秘密执行的...
Anthropic 与 Andon Labs 合作,让 Claude Sonnet 3.7 以“Claudius”的身份在 Anthropic 旧金山办公室经营一个自动化小店约 1 个月。该代理可使用网页搜索、邮件、记事工具、Slack 与自助结账系统,负责选品、定价、补货和回复顾客;Anthropic 表示如果今天决定扩张到办公室自动售...
Anthropic 介绍了 Claude Opus 4.5 在浏览器使用场景下对 prompt injections 的鲁棒性改进,并表示其浏览器扩展 Claude for Chrome 已从 research preview 扩展为 beta,现面向所有 Max 计划用户开放。文章称,基于内部 adaptive “Best-of-N” ...
Anthropic 通过其隐私保护工具 Clio,分析了 Claude Code 和 public API 上数百万次人机交互,研究现实世界中 AI agents 的自主性、用户经验变化、使用领域和风险行为。结果显示,Claude Code 在最长会话中的自主运行时长在 3 个月内从不足 25 分钟接近翻倍到超过 45 分钟;新用户约 2...
Reformedot 预告 Browser Use 将推出新的 browser runtime 基础设施,重点从“stealth”转向浏览器运行性能和成本。其方案包含 Chromium fork、Firecracker fork 和 custom kernel,并强调 headless、更快以及更好的 price/performance;...
Mercor 转发称,Google 的 Gemini 3.5 Flash 在 Artificial Analysis 复现的 APEX-Agents-AA leaderboard 上以 47.1% 排名第一。该成绩比 GPT-5.5 的 37.7% 高 9.4 个百分点,也比 Gemini 3 Flash 的 27.7% 高 19.4 个...
meng shao 介绍了 Helio,称其支持自有订阅 API 接入,目前可在 macOS 和 Windows 上使用。Helio 定位为“AI-native team workspace”,让 AI colleague 直接进入统一频道、任务列表和编码会话,AI 会自己认领工单、移动状态并在频道里回报进展;页面展示了 Live tod...
Google 发布 Chrome DevTools for Agents 1.0,表示该工具已从此前演示转为稳定版,用于让编码智能体在真实浏览器中观察行为、检查输出并进行调试。新版本提供三种接入方式:MCP server、CLI 和 agent skills,并开放七项能力,包括运行 Lighthouse 质量审计、模拟不同窗口尺寸/地理...
Firebase 团队在 Google I/O 2026 前后发布一组面向 agent-led development 的更新,目标是让 AI 工具和 agents 更安全、无缝地接入 Firebase 的核心服务。更新包括:Firebase 现在集成到 Google Antigravity 2.0,首次引导流程提供一键 Firebase...
Weiran Yao 发布 CHI-Bench,用于评估 AI agents 是否能仅凭 clinician 与 insurer apps、operations 以及 medical policy library,端到端自动化美国医疗工作流。该基准包含 75 个长周期真实医疗工作流、覆盖 30 个 frontier agents,每个试验...
Factory (@FactoryAI) 发布 Droid 的 Deferred Context Engine:它先用一个紧凑索引表示可用能力,再在任务真正需要时才加载完整的 tool schema 或 skill instructions。官方称,这一做法在单次会话中可将 context size 减少 40%+,并进一步降低成本、延迟...
Google 在 Google I/O 2026 宣布更新 Google AI 订阅:新增面向开发者、技术负责人、知识工作者和高级创作者的 $100/月 AI Ultra 计划,并将顶层 AI Ultra 价格从 $250/月 下调到 $200/月,功能不变。$100 计划提供相较 Pro 5X 的 Gemini app 和 Google...
Google DeepMind 于 2026年5月19日发布 Gemini 3.5 系列,并率先推出 3.5 Flash,定位为面向 agent 和 coding 的模型。官方称它在 Terminal-Bench 2.1 上得分 76.2%,在 GDPval-AA 上为 1656 Elo,在 MCP Atlas 上为 83.6%,在 Ch...