新加坡政务官Vivian Balakrishnan构建了个人AI智能体
新加坡政务官Vivian Balakrishnan构建了个人AI智能体,专注于解决代理内存持久性问题,已离职专研此项目。
围绕 AI智能体 的精选动态、来源摘要和重要性判断。
新加坡政务官Vivian Balakrishnan构建了个人AI智能体,专注于解决代理内存持久性问题,已离职专研此项目。
Prime Intellect 让 Claude Code 和 Codex 两个 AI 代理在 nanoGPT speedrun optimizer track 上自动运行约 1 万次实验,取得接近人类水平的 2930 steps 记录,整个过程无人值守且开源所有数据。
BestBlogs EP56 早报聚焦 AI 智能体工程化落地,核心内容包括 Anthropic 官方发布的 Claude Computer Use 生产环境最佳实践指南(涵盖分辨率配置、坐标系偏移根因分析与安全架构)、基准测试与生产环境幻觉率差异的警示发现,以及 Shopify 多 Agent 系统、Databricks 速率限制重构、...
Google团队发布RubricEM框架,通过rubric引导的强化学习训练深度研究智能体,解决长文本研究任务中缺乏可验证奖励的问题,使智能体能通过阶段感知规划和基于反思的元策略演进提升性能。
PwC团队发表研究论文,量化了长时序AI智能体澄清时机对任务表现的影响,发现目标澄清在执行10%后几乎无价值,输入澄清在50%前有效,超过中途后澄清反而有害。
一篇新研究论文发现,LLM智能体在可访问历史记录扩展后,合作行为在7个模型和4种社交困境游戏的28种组合中有18种出现显著退化,作者将这一现象称为“记忆诅咒”,其机制是长历史使模型陷入对过往冲突的纠缠而非关注未来收益;研究还通过LoRA适配器和记忆净化方法验证了该效应可被有效缓解。
作者分享了自己为开源AI浏览器自动化工具browser_use搭建云基础设施一年来的实战经验,重点列出踩过的最严重错误。
围绕极简自修改智能体 Pi 及其衍生 agentic 软件 OpenClaw 的深度讨论,访谈涵盖 Pi 与 OpenClaw 的创建者及长期使用者,梳理了 30 个开发团队应用 AI 智能体的实践与教训。核心观点指出 AI 正在改变工程决策与软件复杂度管理,使 junior 角色更易推动复杂方案落地,并强调面向特定任务构建专用工具的重要...