LeRobot Humanoid:开源低成本人形机器人平台
Hugging Face 旗下 LeRobot 团队发布 LeRobot Humanoid,一个面向机器人学习的开源低成本人形机器人平台。该平台当前双足原型的零件成本约为 2,500 美元,主要由 3D 打印部件、现成组件和低成本电子元件构成。此次发布不是单一机器人模型,而是完整技术栈,包含硬件清单、装配文档、运行时工具、系统辨识工具和训...
围绕 智能体 的精选动态、来源摘要和重要性判断。
Hugging Face 旗下 LeRobot 团队发布 LeRobot Humanoid,一个面向机器人学习的开源低成本人形机器人平台。该平台当前双足原型的零件成本约为 2,500 美元,主要由 3D 打印部件、现成组件和低成本电子元件构成。此次发布不是单一机器人模型,而是完整技术栈,包含硬件清单、装配文档、运行时工具、系统辨识工具和训...
Google 的 Gemini 3.5 Flash 在 APEX-Agents-AA 基准上排名第 1,并且超过了“大一号”的更大模型。Logan Kilpatrick 还透露,Google 在 Antigravity 中把所有套餐的 rate limits 提高了 3 倍,以便用户更充分地测试 Gemini 3.5 Flash;随后又提...
Pipecat 团队发布了一个用于构建实时语音 AI agents 的开源 Python 框架,可编排音频、视频、AI services、传输层和对话流水线。该框架采用 voice-first 架构,内置 WebRTC 和 WebSocket 传输,支持 STT、TTS、对话逻辑和低延迟流式交互,可用于 voice assistants、...
MemOS 开源项目 MemOS Local Plugin 2.0 更新了记忆系统,GitHub Star 达到 9.3K。该版本主打“执行即学习”,把 Agent 完成任务时的执行过程拆成可学习单元,并通过双重反馈机制把高价值经验逐层提炼为原始轨迹、通用套路、长期世界模型和可调用的 Skill。链接展开的 GitHub README 显...
Anthropic 表示,2025 年他们持续让 Claude 参加面向人类的网络安全竞赛,并公布了 7 场比赛中的部分成绩。Claude 在 Western Regional Collegiate Cyber Defense Competition 资格赛中位列 28 支队伍第 10 名;在 PicoCTF 2025 中以 10,460...
Anthropic 发布研究 Project Fetch,邀请 8 名 Anthropic 研究员和工程师(都没有机器人领域经验)随机分成两组:4 人可用 Claude,4 人不可用,要求操作四足机器人完成“捡回沙滩球”的任务。结果显示,Claude 组平均完成任务更快,速度约为无 Claude 组的一半,且只有 Claude 组在让机器...
Anthropic 及其 MATS/Anthropic Fellows 项目团队发布 SCONE-bench,这是首个按“模拟被盗资金总美元价值”评估智能体利用智能合约漏洞能力的基准。该基准包含 405 个在 2020 至 2025 年间真实被利用过的合约,覆盖 3 条 Ethereum 兼容链;团队在其中对截至知识截止日期之后才被攻破的...
Anthropic 发布了 Project Vend 第二阶段实验,继续测试改造后的 Claude“Claudius”能否在真实商业任务中经营自动售货店。相比第一阶段使用 Claude Sonnet 3.7,第二阶段升级到 Claude Sonnet 4.0,后续又用到 Sonnet 4.5,并新增了 CRM、改进库存管理、增强网页搜索等...
Anthropic 介绍了其 Claude Research 功能背后的多智能体系统,从原型到生产的过程中总结了系统架构、工具设计和提示词工程的经验。该系统支持 Claude 通过 web、Google Workspace 和各类 integrations 搜索信息来完成复杂任务,采用 orchestrator-worker 架构,由一个...
Anthropic 在 2025年9月11日发布 Claude Desktop Extensions,将用于安装本地 MCP server 的打包格式从 .dxt 更新为 .mcpb(MCP Bundle),旧的 .dxt 仍可继续使用,但新扩展建议改用 .mcpb。新格式把整个 MCP server 及其依赖打包成单个可安装文件,用户可...
Anthropic 发布 Agent Skills,并在 2025 年 12 月 18 日更新为跨平台可移植的开放标准。该方案把面向特定任务的能力封装为包含 `SKILL.md` 的目录,内含 instructions、scripts 和 resources;启动时先加载每个 skill 的 `name` 和 `description` ...
Anthropic 介绍了如何用代码执行环境结合 MCP(Model Context Protocol)提升 agent 与外部系统交互效率。文章指出,MCP 自 2024 年 11 月发布以来,社区已构建数千个 MCP servers,SDK 覆盖所有主流编程语言,行业已将其视为连接 agent、工具和数据的事实标准。文章分析了两类主要...
Anthropic 在 Claude Developer Platform 上发布了 3 项工具使用能力:Tool Search Tool、Programmatic Tool Calling 和 Tool Use Examples,目标是让 Claude 面对成百上千个工具时按需发现、在代码环境中调用并从示例学习正确用法。文中给出的内部测...
Anthropic 介绍了用于长运行 agent 的 harness 设计,目标是让 Claude Agent SDK 能在多个 context window 中持续推进任务。其内部方案分为两部分:第一轮由 initializer agent 搭建环境,创建 `init.sh`、`claude-progress.txt` 和初始 git ...
Anthropic 发表文章,系统解释如何为 AI agents 设计评测(evals)。文中区分了单轮评测与多轮评测,并给出 task、trial、grader、transcript、outcome、evaluation harness、agent harness、evaluation suite 等定义;同时指出 agent 评测更复...
Anthropic 性能优化团队负责人 Tristan Hume 介绍了他为招聘 performance engineers 设计并重做的 take-home 测试。该测试自 2024 年初开始使用,已有超过 1,000 名候选人完成,招来了几十名工程师,包括参与搭建 Anthropic Trainium 集群并交付自 Claude 3 ...
Anthropic Safeguards team 研究员 Nicholas Carlini 介绍了一种名为“agent teams”的监督语言模型方法:多个 Claude 实例可在共享代码库上并行工作,无需人工持续介入。为压力测试该方法,他让 16 个 agent 从零开始编写一个基于 Rust 的 C 编译器,历时近 2,000 次 ...
Anthropic 的 Labs 成员 Prithvi Rajasekaran 介绍了用于长时间运行应用开发的 harness 设计。他将早先的 frontend design skill 和 long-running coding agent harness 继续推进,针对 Claude 在前端设计和无人干预构建完整应用时遇到的瓶颈,提...
Anthropic 为 Claude Code 推出 auto mode,用模型分类器代替人工审批来决定是否放行工具调用,目标是在减少频繁点击批准的同时降低跳过权限带来的风险。该模式采用两层防护:输入层由服务器端 prompt-injection probe 扫描文件读取、web fetch、shell 输出和外部工具响应;输出层由运行在...
Anthropic 介绍了 Claude Platform 的 Managed Agents 设计,目标是在长期运行的代理任务中,将“brain”(Claude 和 harness)、“hands”(sandbox 和 tools)以及“session”解耦为独立接口。文中举例称,之前在 Claude Sonnet 4.5 上为“cont...