Signal Feed

#智能体 主题信号第 9 页

围绕 智能体 的精选动态、来源摘要和重要性判断。

动态列表

01

AlphaProof Nexus 解 9 个 Erdős 问题

Google DeepMind 的 AlphaProof Nexus 通过将 LLM 推理与 Lean 形式化验证结合,自动解决了 9 个开放的 Erdős 问题,其中部分问题已悬而未决 56 年;单个问题的成本为“几百美元”。它还证明了 44 个开放的 OEIS 猜想,解决了一个 15 年前的代数几何问题,并在优化理论中发现了一个人类此...

twitter关注列表2026年05月25日 06:17#研究突破#模型发布#智能体
值得跟进
02

AI 解出 9 个开放数学题

原帖称,AI 已经解决了 9 个开放数学问题,其中一些题目已有 50 年历史,并且证明了 OEIS 的 492 个开放猜想中的 44 个。引用的转帖补充称,这是 DeepMind 团队完成的 9 个 Erdős 问题求解,流程是由 LLM 与 Lean agents 自主工作,只有在形式化验证通过后才进入人工审查。

twitter关注列表2026年05月25日 02:06#研究突破#大模型#智能体
值得跟进
03

Firecrawl 推出 parse endpoint

Firecrawl 发布了新的 parse endpoint,可将本地文件或非公开文档转换为适合 AI agents 使用的结构化数据。该接口支持 PDF、DOCX、XLSX、HTML 等格式,输出可选 Markdown、JSON、HTML、摘要、提取链接或元数据,并保留文档结构、阅读顺序和表格。官方称其基于 Rust 的引擎处理速度最高...

twitter关注列表2026年05月24日 21:54#开发者工具#智能体#产品更新
观察
04

Scaling Test-Time Compute for Agentic Codi

Meta 的论文提出,编程智能体在测试时扩展能力时,不应主要依赖更多尝试,而应把每次尝试压缩为可复用的短摘要,再用这些摘要来筛选候选和指导新一轮尝试。论文将完整尝试中的文件读取、shell 命令、错误、部分修复和放弃思路总结为主要假设、部分进展与失败点,并用 tournament 风格的选择方法在小组内比较摘要。作者在 2 个困难编程基准...

twitter关注列表2026年05月23日 22:29#研究突破#智能体#基准测试
观察
05

Natural-Language Agent Harnesses

该论文提出,Agent 的表现不仅取决于 prompt,还更依赖围绕模型的 harness。作者指出,很多 AI agent 的实际行为来自外部控制代码:规划、工具调用、记忆、重试、检查与停止条件等;在长任务中,状态丢失、验证漂移、工具返回部分证据、以及忘记中间产物等问题会导致失败。论文引入 Natural-Language Agent ...

twitter关注列表2026年05月23日 21:26#智能体#研究突破#开发者工具
观察
06

飞书 Claude Code 桥接项目

Zara Zhang 开源了 feishu-claude-code-bridge,用于把飞书/Lark 和本机 Claude Code CLI 打通。该项目支持在飞书中直接发消息指挥 Claude Code、创建和编辑飞书文档、将飞书消息转发给智能体处理,并把处理过程实时同步回飞书;还支持把 Claude Code 绑定到指定 Works...

twitter关注列表2026年05月23日 15:15#开源#开发者工具#智能体
观察
07

Zero to Claude Code 免费课程

Wix VP @IShmool 推出免费课程“Zero to Claude Code”,将零基础、不了解终端的人带到能用 Claude Code 在生产环境交付软件的水平。课程共 14 级、147 课、10 种交互形态,覆盖文件/目录/终端命令/Git、Node.js、API、Skills 与 SKILL.md、MCP 服务器、Subag...

twitter关注列表2026年05月23日 09:31#产品更新#开发者工具#智能体
值得跟进
08

Cursor Composer 2.5 基准

Artificial Analysis 基于 API 定价和 Coding Agent Index 基准,比较了 Cursor Composer 2.5、Claude Code 中的 Opus 4.7(medium reasoning)以及 Codex 中的 GPT-5.5(medium)。结果显示,Composer 2.5 的每任务成本...

twitter关注列表2026年05月23日 04:00#基准测试#开发者工具#智能体
观察
09

OpenAI named a Leader in enterprise coding agents by Gartner

OpenAI 被 Gartner® Magic Quadrant™ 评为 Enterprise AI Coding Agents 的 Leader。OpenAI 表示,Codex 每周使用人数超过 400 万,已被 Cisco、Datadog、Dell Technologies 和 NVIDIA 等企业采用,并在今年早些时候的 Gartn...

OpenAI-news2026年05月22日 08:00#行业动态#产品更新#智能体
观察
10

MiniMax Agent 接入 Perplexity Search

MiniMax_Agent 表示 MiniMax Agent 现已使用 @perplexity_ai Search,并对 3 个 AI-native search provider、700+ 个 agent tasks 做了基准测试。结果显示,相比此前默认的 Serper,Perplexity 在回答质量和 snippet density...

twitter关注列表2026年05月22日 23:20#产品更新#智能体#基准测试
观察
11

Appshots in Codex

OpenAI 的 Codex app 新增 Appshots 功能:按下两个 CMD 键后,会把当前应用的上下文发送给 Codex,包含截图和文本。与普通截图粘贴不同,Appshots 还会传入屏幕外不可见的应用上下文,例如在查看 Google Doc 时,也会把已滚动出屏幕的文本一并传给 Codex。OpenAI 同时让 remote ...

twitter关注列表2026年05月22日 20:33#产品更新#开发者工具#智能体
观察
12

TLMs: Tiny LLMs and Agents on Edge Devices

AI Engineer 转发了 swyx 关于边缘设备上 Tiny LLMs 和 Agents 的分享,内容聚焦 on-device AI 的两种开发路径。文中提到 Function Gemma 具备 2.7 亿参数,在 Pixel 7 上 prefill 速度接近每秒 2,000 tokens;默认情况下,在一组固定 app inten...

twitter关注列表2026年05月22日 06:42#模型发布#开发者工具#智能体
观察
13

Codex 可锁屏使用 Mac

OpenAI Developers 说明 Codex 现在可以在 Mac 锁屏、屏幕关闭且未解锁的情况下安全使用应用;用户还可以从手机远程让 Codex 使用自己的 Mac。原文未给出版本号、价格或其他量化指标。

twitter关注列表2026年05月22日 14:58#产品更新#智能体
观察
14

Codex 更新

OpenAI Developers 发布 Codex 更新,新增 Appshots 功能:在 Mac 上同时按住 Command-Command 可把当前应用窗口附加到 Codex 线程,Codex 会接收该窗口的截图和文本内容,包括屏幕上未直接显示的文本。原帖还说明 Appshots 适用于 Mac 的所有套餐,enterprise 访...

twitter关注列表2026年05月22日 12:20#产品更新#智能体#开发者工具
观察
15

ChatGPT 进 PowerPoint

ChatGPT 现在可以直接在 PowerPoint 里创建、编辑、理解和润色演示文稿,并且保持幻灯片可编辑,不会导出成死图。它还支持在 PowerPoint 里直接生成图片,目前处于 beta,官方正在征集反馈。

twitter关注列表2026年05月22日 08:19#产品更新#智能体#行业动态
值得跟进
16

OpenAI Codex 更新

OpenAI 发布了 Codex 的一波更新。Mac 上新增 Appshots,用户在系统里同时按左右 Command 键即可把当前应用窗口的截图和文字内容发送到 Codex,且可读取屏幕上未直接显示的内容;该功能覆盖所有付费计划,企业版稍后推出。桌面版正式支持 Goal 模式,用户给出目标后,Codex 可持续运行数小时甚至数天,并支持...

twitter关注列表2026年05月22日 04:13#产品更新#开发者工具#智能体
值得跟进
17

AdventHealth advances whole-person care with OpenAI

AdventHealth 正在其跨 9 个州、服务数百万患者的医疗系统中部署 ChatGPT for Healthcare,以减少行政负担并简化临床工作流。该系统最早的可量化场景是利用管理:医生顾问在每个病例上约花 10 分钟处理读取病历、提取要点、核对标准和撰写理由等步骤,AdventHealth 通过 ChatGPT for Heal...

OpenAI-news2026年05月21日 20:00#行业动态#产品更新#智能体
值得跟进
18

Codex Thursday 更新

OpenAI Developers 对 Codex 做了多项更新:新增 Appshots,Mac 用户可按 Command-Command 把应用窗口附加到 Codex thread,Codex 会同时获取截图和窗口文本,包括屏幕外内容;该功能目前已向 Mac 上所有方案开放,enterprise access 即将推出。OpenAI 还...

twitter关注列表2026年05月22日 02:33#产品更新#开发者工具#智能体
观察
19

Qwen3.7-Max 发布

阿里巴巴 Qwen 团队正式发布 Qwen3.7-Max,并通过 Alibaba Model Studio 的 API 和 Qwen Studio 提供服务。该模型定位为“Agent Era”的旗舰模型,强调编程智能体、办公自动化、长周期自主执行和跨框架泛化能力;官方称其在一项内核优化任务中连续运行了 35 小时,完成 1,000+ 次工...

twitter关注列表2026年05月21日 21:28#模型发布#智能体#基准测试
值得跟进
20

EvalScope 支持 Agent 评测

ModelScope Community 的 EvalScope 新增 Agent Evaluation Mode,可将 GSM8K、AIME、IFEval、SWE-Bench 等标准基准通过一行配置转成多轮 agentic 任务。新模式引入 AgentLoop,支持 Function-Calling、ReAct、SWE-Bench 协议...

twitter关注列表2026年05月21日 21:32#开发者工具#智能体#基准测试
观察