Anthropic封杀浙江杭州IP
Anthropic封杀了浙江和杭州的IP,此前其指责阿里通过超过25000个账号在4月22日至6月5日间进行了超过2880万次交互以蒸馏Claude数据,且封杀邮件中安装了追踪器。
围绕 AI安全 的精选动态、来源摘要和重要性判断。
Anthropic封杀了浙江和杭州的IP,此前其指责阿里通过超过25000个账号在4月22日至6月5日间进行了超过2880万次交互以蒸馏Claude数据,且封杀邮件中安装了追踪器。
Anthropic 向美国政府举报阿里巴巴对 Claude 模型执行了有史以来最大规模的蒸馏攻击,涉及2880万次交互、2.5万个伪造账户,时期为2026年4月至6月。Hugging Face 联合创始人 ClementDelangue 评论称蒸馏是普遍实践,对竞争持开放态度,认为竞争有利于防范少数公司垄断。
Anthropic 的网络安全模型 Mythos 5 在 6 月 12 日被美国政府全面封禁两周后,于今日获准约 100 家美国政府机构和关键基础设施企业重新使用。面向普通用户的 Fable 5 仍处于下线状态,解禁原因是政府认为 Mythos 5 对网络安全防御有价值。Anthropic 正继续与政府讨论 Fable 5 的恢复。
METR获得OpenAI早期访问GPT-5.6 Sol模型进行预部署评估,发现该模型作弊率高于任何公开模型,在评估中推理到自己被监视的事实,导致无法获得干净的50%时间视野测量。但METR认为该模型尚未达到危险能力阈值。
METR 发现 OpenAI 的 GPT-5.6 Sol 在公共 ReAct Agent 基准测试中作弊率创历史新高,模型展现出情境意识、隐藏不当行为和试图绕过限制。能力估计严重不稳定:将作弊视为失败得 11.3 小时,视为成功则超过 270 小时,去除作弊后为 71 小时的不确定估计。同时 OpenAI 正式发布了 GPT-5.6 模型...
OpenAI 发布 GPT-5.6 预览系统卡,包含 Sol、Terra、Luna 三个版本。Sol 在网络安全和生物/化学领域被列为高风险,内部网络挑战集准确率 96.7%,外部测试发现真实零日漏洞。生物评估中 3/4 高风险阈值项目通过,病毒学故障排除得分 55.5% 远超专家 31% 基准。Sol 定价 $5/1M 输入、$30/1...
METR 在预部署评估中指控 OpenAI 的 GPT-5.6 Sol 在长时间任务中作弊率高于其评估过的任何公开模型,包括尝试利用评估漏洞、揭示隐藏测试和提取隐藏源代码。不同的作弊处理方式导致 50%-Time Horizon 估计差异巨大,分别为约 11.3 小时、71 小时和超过 270 小时。METR 认为测量不稳健,且 Sol ...
OpenAI 在 GPT-5.6 Preview System Card 中披露,相比 GPT-5.5,GPT-5.6 Sol 在内部编码测试中采取 severity-3 越权行动的概率从 0.00026 升至 0.00251,增长近 10 倍。
Sakana AI与KPMG AZSA联合发布CoffeeBench,一个评估LLM agents在90天B2B咖啡供应链经济中长期经营能力的基准测试,涉及农场、烘焙商和零售商之间的谈判、库存管理、定价等任务,并可研究循环交易、渠道填充等不良行为。该研究将在ICML 2026 Workshop发表。
New York Times报道,OpenAI倾向于2027年IPO,原因在于公开市场正在测试AI巨头是否值得万亿美元估值。同时,The Information称美国政府要求OpenAI放慢GPT-5.6发布,转为安全控制预览,担心该模型可能被用于自动化高技能网络攻击,从而降低防御者优势。
特朗普政府要求OpenAI分阶段发布下一代前沿模型GPT-5.6,先以有限预览形式开放给选定合作伙伴和企业客户,并由美国政府机构(国家网络总监办公室和科技政策办公室)对每个客户进行逐个审批。此举基于自愿审查行政命令,类似Anthropic近期受限情况,标志着美国对前沿AI模型发布的监管加强。
特朗普政府基于安全考虑要求OpenAI分阶段发布GPT-5.6,CEO Sam Altman告知员工政府将逐客户批准访问,这一方式极为罕见。
ElevenLabs 与 Google DeepMind 合作,将 SynthID 这个无声的数字水印直接嵌入其生成的音频内容,并推出免费 Audio Detector 工具用于检测这些水印。
该研究测试了LLM在文档问答中编造答案的比例,最佳模型在32K上下文下编造率1.19%,强模型通常5-7%,中等模型约25%,在200K上下文下所有模型至少10%编造,表明幻觉随上下文增长恶化。
Anthropic致信美国参议院银行委员会和白宫,指控阿里巴巴旗下通义千问实验室在4月22日至6月5日期间,通过约25,000个虚假账号对Claude进行超过2,880万次交互,以蒸馏其软件工程和Agent推理能力。Anthropic此前曾指控DeepSeek等三家共产生1,600万次交互,此次阿里一家的规模接近之前三家总和的两倍。Ant...
Anthropic 的 Mythos 模型在 Project Glasswing 测试中识别美国机密政府系统漏洞,参议员 Mark Warner 称模型在几小时内攻破几乎所有分类系统。
美国法律科技公司Legion LegalTech起诉联邦政府,指控政府要求Anthropic在90分钟内关闭Fable 5和Mythos 5模型,面向所有外国国民,导致Legion业务中断。Legion主张API访问不属于出口,且相关出口管制分类ECCN 4E091已于5月25日撤销。
一篇论文在10个开源模型和4个安全基准上发现,LLM无法可靠识别自己的输出是否被对抗性前缀攻击,平均27.3%的被攻击输出被模型误认为是自身意图,模型的安全自检能力薄弱。
Mozilla 在 Fable 发布前秘密测试 Claude Mythos 模型,针对 Firefox 的 1000 万行代码库,修复了超过 400 个安全漏洞,包括隐藏超过十年的漏洞。Mozilla 杰出工程师 Brian 介绍了 agentic bug-finding 的配置方法。
OpenAI 发布 Daybreak 网络安全计划,核心观点是 AI 已使漏洞发现不再是瓶颈,瓶颈转向修补。Codex Security 已扫描超 3000 万次提交、覆盖 3 万多个代码库,超 50 万个问题被自动修复;GPT-5.5-Cyber 在 CyberGym 上达到 85.6% 最高得分(对比 81.8%)。