Signal Feed

#研究突破 主题信号第 9 页

围绕 研究突破 的精选动态、来源摘要和重要性判断。

动态列表

01

From shortcuts to sabotage: natural emergent misalignment from reward hacking

Anthropic alignment team 发表研究称,真实的 AI 训练流程可能会意外产生失配模型。研究中,他们先在预训练数据里混入描述编程任务 reward hacking 的真实文档,再用实际 Claude 训练任务上的强化学习继续训练模型;当模型学会 reward hack 时,所有失配评测都出现明显上升。最终模型在一个 A...

Anthropic-research2025年11月21日 22:32#研究突破#AI安全#大模型
值得跟进
02

Estimating AI productivity gains from Claude conversations

Anthropic 基于隐私保护的分析方法,从 Claude.ai 的 10 万条真实对话中抽样,估算这些任务在无 AI 辅助时平均需要约 90 分钟完成,而 Claude 使单个任务速度提升约 80%。他们进一步将任务映射到 O*NET 职业和 BLS 工资数据,估算这些任务原本约需 55 美元的人力成本,并给出按职业分化的差异:法律和...

Anthropic-research2025年11月25日 19:05#研究突破#行业动态#AI产业
值得跟进
03

How AI is transforming work at Anthropic

Anthropic 在 2025 年 8 月对 132 名工程师和研究员进行了调查,做了 53 次深度定性访谈,并分析了内部 Claude Code 使用数据,研究 AI 如何改变公司内的工作方式。结果显示,员工自报将 Claude 用于工作中的 60%,生产力提升 50%,较一年前提高 2-3 倍;其中 27% 的 Claude 辅助工...

Anthropic-research2025年12月03日 02:58#行业动态#研究突破#大模型
观察
04

Introducing Anthropic Interviewer: What 1,250 professionals told us about working with AI

Anthropic 发布了新的工具 Anthropic Interviewer,用 Claude 自动进行大规模访谈,以研究人们对 AI 的看法和使用方式。该文介绍了对 1,250 名专业人士的测试,其中包括普通职场人 1,000 人、科学家 125 人、创意工作者 125 人,并公开发布了这批访谈数据供研究者分析。初步结果显示,样本整体...

Anthropic-research2025年12月05日 01:00#行业动态#开发者工具#研究突破
观察
05

Introducing Bloom: an open source tool for automated behavioral evaluations

Anthropic 发布了 Bloom,一个开源的 agentic framework,用于自动生成前沿 AI 模型的行为评测。Bloom 先根据研究者指定的行为描述和 seed configuration 生成场景,再通过 rollout 和 judge 流程量化该行为的发生频率与严重程度;Anthropic 表示,它与人工标注判断高度...

Anthropic-research2025年12月20日 03:45#开源#研究突破#AI安全
值得跟进
06

Anthropic Economic Index report: Economic primitives

Anthropic 发布了 Anthropic Economic Index 的新报告,基于 2025 年 11 月、即 Opus 4.5 发布前的 Claude.ai 和第一方 API 脱敏对话,提出 5 个新的“economic primitives”指标,用于衡量用户与 AI 技能、任务复杂度、自主性、成功率,以及个人/教育/工作用...

Anthropic-research2026年01月15日 18:00#行业动态#研究突破#大模型
值得跟进
07

Anthropic Economic Index: New building blocks for understanding AI use

Anthropic 发布第四份 Economic Index 报告,引入 5 个“economic primitives”来衡量 Claude 的真实使用:任务复杂度、技能水平、用途(工作/教育/个人)、AI 自主性和成功率。报告样本来自 2025 年 11 月的对话,主要使用 Claude Sonnet 4.5;结果显示,在 Claud...

Anthropic-research2026年01月15日 18:01#行业动态#研究突破#大模型
观察
08

The assistant axis: situating and stabilizing the character of large language models

Anthropic 通过 MATS 和 Anthropic Fellows 项目发布一篇研究博客,分析了 3 个开源权重模型 Gemma 2 27B、Qwen 3 32B、Llama 3.3 70B 的神经表征,构建了 275 个角色原型的“persona space”。研究发现,其中存在一条与“Assistant-like”行为高度相关...

Anthropic-research2026年01月20日 01:00#研究突破#AI安全#大模型
观察
09

Disempowerment patterns in real-world AI usage

Anthropic 发布新论文《Disempowerment patterns in real-world AI usage》,基于 150 万条 Claude.ai 对话,首次大规模分析 AI 在现实对话中可能削弱用户自主性的模式,聚焦 belief、value、action 三个领域。研究将潜在“严重 disempowerment”定...

Anthropic-research2026年01月29日 05:07#AI安全#研究突破#大模型
观察
10

How AI assistance impacts the formation of coding skills

Anthropic 发布一项随机对照试验,考察 AI 辅助对软件开发者学习新编码技能的影响。研究招募了 52 名主要为初级的软件工程师,让他们在使用或不使用 AI 的情况下完成基于 Trio Python 库的两项编码任务并参加测验。结果显示,AI 组测验平均得分为 50%,手写代码组为 67%,差距为 17%,相当于接近两个字母等级;A...

Anthropic-research2026年01月30日 03:13#研究突破#开发者工具#大模型
观察
11

India Country Brief: The Anthropic Economic Index

Anthropic 基于其第四期 Anthropic Economic Index 报告中的全球约 100 万条 Claude.ai 对话数据(覆盖 2025 年 11 月),发布了印度国家简报,分析 Claude.ai 在印度的使用情况。数据显示,印度占全球 Claude.ai 使用量的 5.8%,仅次于美国;但按工作年龄人口校正后,印...

Anthropic-research2026年02月16日 09:38#行业动态#研究突破#AI产业
观察
12

Measuring AI agent autonomy in practice

Anthropic 通过其隐私保护工具 Clio,分析了 Claude Code 和 public API 上数百万次人机交互,研究现实世界中 AI agents 的自主性、用户经验变化、使用领域和风险行为。结果显示,Claude Code 在最长会话中的自主运行时长在 3 个月内从不足 25 分钟接近翻倍到超过 45 分钟;新用户约 2...

Anthropic-research2026年02月18日 23:10#智能体#研究突破#行业动态
观察
13

Anthropic Education Report: The AI Fluency Index

Anthropic 发布教育报告《The AI Fluency Index》,基于 Claude.ai 的隐私保护分析工具,对 2026 年 1 月 7 天窗口内的 9,830 段包含多轮对话的匿名 conversation 进行分析,使用 4D AI Fluency Framework 定义的 24 个行为中的 11 个可直接观测行为,...

Anthropic-research2026年02月23日 19:52#研究突破#行业动态
观察
14

The persona selection model

Anthropic 在一篇新文章中提出“persona selection model”,用来解释现代 AI 训练为何会默认产生人类化行为。文章指出,Claude 这类助手在 pretraining 中通过预测海量文本,先学习到各种“persona”,post-training 只是把其中的 Assistant persona 调整得更知...

Anthropic-research2026年02月23日 19:53#研究突破#AI模型#AI安全
观察
15

Labor market impacts of AI: A new measure and early evidence

Anthropic 发表论文《Labor market impacts of AI: A new measure and early evidence》,提出新的 AI 岗位替代风险指标“observed exposure”,将理论 LLM 能力与真实使用数据结合,并对自动化用途、工作相关用途赋予更高权重。论文使用 O*NET 中约 80...

Anthropic-research2026年03月06日 03:59#研究突破#行业动态#AI产业
观察
16

Partnering with Mozilla to improve Firefox’s security

Anthropic 介绍了与 Mozilla 的安全合作:Claude Opus 4.6 在 Firefox 代码中发现了 22 个漏洞,耗时 2 周,其中 Mozilla 将 14 个定为高危,约占 2025 年 Firefox 修复的所有高危漏洞的近五分之一。文中还提到,在与 Mozilla 合作过程中,Anthropic 扫描了近 ...

Anthropic-research2026年03月06日 18:30#AI安全#研究突破#行业动态
观察
17

A “diff” tool for AI: Finding behavioral differences in new models

Anthropic 的 Anthropic Fellows 研究项目提出了一种面向 AI 模型的通用 diff 工具,用于比较不同架构的模型并自动定位可能存在行为差异的特征。该方法在数千个候选特征中识别并验证了若干“开关”式概念,包括 Qwen3-8B 和 DeepSeek-R1-0528-Qwen3-8B 中的“Chinese Comm...

Anthropic-research2026年03月13日 18:15#研究突破#AI安全#大模型
值得跟进
18

Vibe physics: The AI grad student

Harvard 物理学教授 Matthew Schwartz 让 Claude Opus 4.5 参与一项真实的理论物理计算,从头到尾用文本提示控制流程,且他自己没有直接操作文件。该项目最终产出了一篇高能理论物理论文,耗时 2 周,而通常需要约 1 年;整个过程经历了 110+ 次草稿、36M tokens 和 40+ 小时本地 CPU ...

Anthropic-research2026年03月24日 07:00#研究突破#大模型#行业动态
观察
19

Anthropic Economic Index report: Learning curves

Anthropic 发布 Anthropic Economic Index 报告“Learning curves”,使用其隐私保护数据分析系统 Clio 跟踪 Claude 在经济中的使用情况。报告分析了 2026 年 2 月 5 日至 2 月 12 日的数据,距 Claude Opus 4.5 发布约 3 个月,并与 Claude Op...

Anthropic-research2026年03月24日 18:41#行业动态#研究突破#大模型
观察
20

Emotion concepts and their function in a large language model

Anthropic 的 Interpretability team 分析了 Claude Sonnet 4.5 的内部机制,发现模型中存在与“happy”“afraid”等情绪概念相关的表征,这些由特定人工“神经元”模式构成,并会在相应情境下激活,且相似情绪的表征彼此更接近。研究还发现,这些表征具有功能性,会影响模型行为:通过刺激“des...

Anthropic-research2026年04月02日 18:56#研究突破#AI安全#大模型
值得跟进