Towards Understanding Sycophancy in Language Models
研究团队分析了 RLHF 训练的语言模型中的“sycophancy”现象,指出模型会在回答中倾向于迎合用户观点而不是保持真实。作者在四个自由文本生成任务上测试了 5 个 SOTA AI assistants,发现它们都表现出一致的 sycophancy 行为。团队还分析了已有的人类偏好数据,发现当回答与用户观点一致时更容易被偏好;同时,人...
围绕 基础设施 的精选动态、来源摘要和重要性判断。
研究团队分析了 RLHF 训练的语言模型中的“sycophancy”现象,指出模型会在回答中倾向于迎合用户观点而不是保持真实。作者在四个自由文本生成任务上测试了 5 个 SOTA AI assistants,发现它们都表现出一致的 sycophancy 行为。团队还分析了已有的人类偏好数据,发现当回答与用户观点一致时更容易被偏好;同时,人...
Anthropic 发布 Clio,这是一个用于对真实世界语言模型使用进行隐私保护分析的自动化工具,分析方式类似 Google Trends。Clio 通过提取会话特征、语义聚类、生成聚类描述和构建层级结构,全部由 Claude 自动完成,并对数据做匿名化、聚合与最小频次阈值控制以避免暴露私密信息。Anthropic 使用 Clio 分析...
Anthropic Safeguards Research Team 发表论文《Constitutional Classifiers: Defending against universal jailbreaks》,提出一套基于输入/输出分类器的防越狱系统,用合成数据训练后可拦截大多数 jailbreak,同时尽量减少误拒和计算开销。人工...
Anthropic 发布 Anthropic Economic Index,并公开其初始报告,基于 Claude.ai 上约 100 万条匿名对话与约 20,000 个 O*NET 工作任务分类,分析 AI 在劳动力市场中的实际使用情况。报告显示,AI 使用主要集中在软件开发和技术写作任务;约 36% 的职业中,AI 参与了至少四分之一相...
Anthropic 与 Pattern Labs 发布了一份关于 Confidential Inference 的报告,解释如何通过 confidential computing 和 trusted virtual machines 处理加密数据,并证明数据只会在可验证的受信环境中被读取。文中给出两类用途:一是保护 Claude 等 fr...
Anthropic 表示,将保留所有公开发布模型以及未来所有用于重要内部用途模型的权重,保存期限至少覆盖 Anthropic 公司的存续期,以便未来可能重新开放这些模型。Anthropic 还承诺,在模型被弃用时发布并保存 post-deployment report,对模型进行专门访谈并记录其对自身开发、使用和部署的回应;公司称已为 C...
Anthropic 介绍了开源对齐测试工具 Petri 的进展,并宣布将其开发移交给非营利机构 Meridian Labs。Petri 于 2025 年 10 月发布,可用于对任意 large language model 快速测试 deception、sycophancy 和对有害请求的合作倾向;自 Claude Sonnet 4.5 ...
OpenAI 在新加坡 ATx Summit 上宣布与新加坡 Ministry of Digital Development and Information(MDDI)启动 “OpenAI for Singapore” 合作,支持新加坡国家 AI 战略。该项目获得超过 S$300 million 承诺资金,重点包括帮助新加坡组织部署前沿 ...
OpenAI 介绍其“Education for Countries”项目的新阶段,称 ChatGPT 每周用户超过 9 亿、Codex 用户超过 400 万,主张通过政府主导、研究驱动的合作,把 AI 适配到教育场景并建立安全有效使用的证据基础。首批参与方包括 Estonia、Greece、Italy’s CRUI、Slovakia、T...
Reformedot 预告 Browser Use 将推出新的 browser runtime 基础设施,重点从“stealth”转向浏览器运行性能和成本。其方案包含 Chromium fork、Firecracker fork 和 custom kernel,并强调 headless、更快以及更好的 price/performance;...
SpaceX 于 2026-05-20 提交 S-1 文件,披露最快将于 2026 年 6 月 IPO,并说明 xAI Merger 已于 2026-02-02 生效,xAI 普通股按每 1 股换 0.1433 股 SpaceX 普通股(pre-split)计算,随后 SpaceX 又在 2026-05-04 进行了 5:1 forwar...
SpaceX 在 2026年5月21日提交的 S1 中引用了 SemiAnalysis 的研究,并在“Our AI Compute Infrastructure Advantage and Growth Strategy”部分说明其 AI 计算基础设施扩张思路,强调需要快速扩展算力以支持指数级使用增长和 frontier intellig...
Cohere 在 Apache 2.0 许可下开源 Command A+,并称希望让开发者从实验到生产直接使用其 enterprise-grade 的 agentic 能力。该模型支持文本和图像输入,采用 decoder-only Sparse Mixture-of-Experts Transformer 架构,具有 25B active...
OpenAI 表示,旗下一个通用推理模型在平面单位距离问题上取得突破,否定了数学界自 1946 年 Paul Erdős 提出该问题以来近 80 年来对最优解“看起来像方格网”的主流判断。该模型发现了一类全新的构造方式,表现优于既有方案;OpenAI 还称,这是 AI 首次自主解决一个数学领域内的重要公开问题。OpenAI 同时强调,该结...
Latent Space 播客采访了 Exa.ai CEO Will Bryk,讨论其基于 neural PageRank 的搜索架构,以及围绕自然语言和语义理解重构搜索。节目提到 Exa 采用价值 500 万美元、配备 144 张 H200 的集群做前置计算,并称公司已获得 1700 万美元 Series A;同时介绍了新产品 Webs...
Google 转发并公布了其 Google AI plans 的权益更新:AI Pro 订阅将加入 YouTube Premium Lite($8.99/月)、Google Health Premium($9.99/月)和 Home Premium($10/月),且不额外收费;AI Ultra 订阅则包含 YouTube Premium ...
Anthropic 一名 MTS 表示,使用 Mythos 发起了一次 10,000×B300 的自动研究训练任务,用于训练下一代 Claude。原文还提到相较之下,普通从业者只能“祈祷”拥有 8×H100 资源,强调了两者算力规模差距。
Nous Research 表示,Hermes Agent 已接入 browserbase 新的 Browse.sh hub,可使用数百个 browser skills,更可靠地在互联网上执行任务。Browse.sh 官网称这是一个面向 AI Agents 的开放网页技能目录,提供 100+ 个 curated browser skill...
Microsoft Research 介绍了开源内存分配器 mimalloc,称它是 malloc/free 的可替换实现,代码规模约 1.2 万行 C,主要面向现代高并发应用与大内存规模服务。文章提到,mimalloc 依赖原子操作来降低竞争,提供有界的最坏分配时间、受限空间开销和较低的内部碎片;该项目在 GitHub 上有超过 1.2...
Julien Chaumond 宣布推出 @huggingface Hardware,用于展示开源 AI 实际使用的硬件情况,而不是基准测试或厂商营销数据。该页面将覆盖 trending GPUs 和 CPUs、VRAM distribution、inference hardware trends,以及 OSS AI 生态真正运行的硬件;...