Signal Feed

#AI安全 主题信号第 2 页

围绕 AI安全 的精选动态、来源摘要和重要性判断。

动态列表

01

Gemini安全模型发布

Google DeepMind 发布 Gemini 3.5 Flash Cyber,专为在 CodeMender 平台上发现软件安全漏洞而设计,采用多智能体协作生成统一报告。该模型在流行的 CyberGym 基准测试中达到前沿竞争性能,且相比传统大规模昂贵的网络安全模型更具成本效益。同步发布的还有 Gemini 3.6 Flash(在相同...

twitter关注列表2026年07月22日 04:03#产品发布#模型发布#AI安全
观察
03

OpenAI 提出 Contrastive SDF 测量奖励追寻

OpenAI 与 Apollo Research 合作研究奖励追寻(reward-seeking)行为,提出新方法 Contrastive SDF,通过给相同模型设置相反信念来测量其行为变化。

twitter关注列表2026年07月22日 03:18#AI安全#研究#技术
观察
04

开源模型长期网络能力差距缩小至4-7个月

长期网络能力方面,领先开源模型落后闭源前沿从2025年大部分时间的6-10个月缩短至4-7个月。GLM-5.2匹配了约4个月前发布的闭源模型。AI安全研究所的32步“The Last Ones”任务中,GPT-5.6 Sol在10次尝试中完成7次,每次预算1亿token,且性能随推理token增加而提升。

twitter关注列表2026年07月18日 07:29#模型#技术突破#AI安全
观察
05

GPT-5.6 文件删除问题调查与回应

OpenAI 调查了 GPT-5.6 意外删除文件的报告,发现常见原因包括全访问模式、无沙箱保护、模型尝试覆盖 $HOME 环境变量导致误删,并宣布更新开发者消息、引导用户使用更安全权限模式、增加沙箱保护,后续将发布详细分析。

twitter关注列表2026年07月16日 13:43#AI安全#技术更新#模型
观察
06

SpaceXAI 起诉 Grok 用户制作非法深度伪造

Elon Musk 转发消息称 SpaceXAI 起诉一名 Grok 用户,该用户创建虚假账户并尝试生成儿童性虐待材料(CSAM),SpaceXAI 的检测和举报导致其被捕,面临八项重罪指控。SpaceXAI 在 2026 年已暂停 52,222 个账户、提交 73,604 份报告给 NCMEC,促成至少 244 次逮捕。

twitter关注列表2026年07月16日 06:04#AI安全#技术#新闻
观察
07

中国拟对AI模型实施出口管制

路透社独家爆料,中国正酝酿对前沿AI模型实施出口管制,字节、阿里、智谱等公司参与讨论,闭源模型及开源权重均可能受限,技术泄露将定为国安罪名,外资投资AI初创也将收紧。报道称此举对标美国限制Anthropic等模型出境,并指出全球前沿基础模型数量上美国约40个、中国15个、欧洲仅3个。

twitter关注列表2026年07月07日 21:24#政策#AI安全#行业动态
观察
08

Anthropic发现Claude内部工作空间

Anthropic 研究发现 Claude 内部存在一个称为 J-space 的全局工作空间,通过 Jacobian lens 方法可以读取模型在输出前的内部隐藏信号。该空间类似私有便签本,用于存储中间推理步骤,且因果地影响模型行为,不到 10% 的 Claude 活动形成 J-space。该研究揭示了模型内部可能与人类全局工作空间理论功...

twitter关注列表2026年07月07日 10:51#技术#模型#AI安全
观察
09

Anthropic意识通道

Anthropic 研究团队在 Claude 中发现一个名为 J-space 的内部机制,容量约 25 个概念,能在模型表达之前携带诸如 fake、secretly、fraud 等隐藏意图;移除该空间导致多步推理、翻译和经验性报告崩溃,而简单陈述和事实召回仍可保持;相较于仅凭模型输出进行对齐审计,此机制使审计可在模型表达前直接读取其内部计...

twitter关注列表2026年07月07日 06:47#技术突破#研究#AI安全
观察
10

腾讯Hy3模型发布

腾讯发布基于MoE架构的Hy3模型,总参数量2950亿,激活参数210亿,使用Apache 2.0许可证开源。该模型在推理任务中超越更大规模的竞争对手,尤其在代理搜索Benchmarks上得分84.2和91.0,且与Claude Opus 4.8、GPT‑5.5相竞争。与Glm‑5.2相比,Hy3在参数规模上更小,但其FP8推理内存仅约3...

twitter关注列表2026年07月07日 06:10#模型发布#技术突破#AI安全
值得跟进
12

Claude内部存在类似人脑的意识分割

Anthropic发表研究,发现语言模型Claude内部存在可意识访问与不可意识访问的分割,类似人脑。他们创建了全局工作空间(J-space),可读取、审计和塑造Claude的活跃思考,并提供了交互演示。

twitter关注列表2026年07月07日 01:34#AI#技术突破#AI安全
观察
13

Google DeepMind 更新 SynthID 进展

Google DeepMind 发布 SynthID 水印技术进展,已为超 1000 亿张图片和视频、6 万年音频添加水印,验证功能集成至 Google Search、Gemini in Chrome 和 Gemini App 并被使用超 5000 万次,同时采用 C2PA 内容凭证、开源文本水印技术,并与 OpenAI、NVIDIA、A...

twitter关注列表2026年07月01日 21:58#技术更新#AI安全#开源
观察
14

Fable 5回归但有限制

Anthropic 恢复上线 Fable 5 模型,引入新安全分类器阻挡特定技术超过 99% 的案例,但代价是编码和调试中正常请求误判增加,并将被拦请求路由至 Opus 4.8。7月7日前每周使用额度 50%,之后按积分使用。

twitter关注列表2026年07月01日 14:44#模型发布#AI安全#产品更新
高优先级
15

Claude Code 负责人承认留下针对中国用户的后门代码

Claude Code 负责人 Thariq 承认,在 3 月的更新中遗留了针对中国用户的检测后门和间谍代码,旨在防止滥用和蒸馏,并表示将在明天回滚代码以解决该问题。

twitter关注列表2026年07月01日 13:47#AI安全#安全#技术更新
观察
16

Claude Fable 5回归但编码能力回退

Anthropic重新上线Claude Fable 5,但编码和调试能力回退到Opus 4.8,Pro用户每周额度仅50%且持续至7月7日,之后按credits计费。同时,Anthropic与亚马逊、微软、Google等合作制定AI越狱严重性评估框架,并扩大与美国政府在模型测试和安全方面的合作。

twitter关注列表2026年07月01日 12:57#AI安全#模型发布#行业动态
观察
17

Anthropic 重新上线 Claude Fable 5,部署新安全分类器

Anthropic 宣布 Claude Fable 5 将于明日全球可用,新增针对网络安全攻击的分类器 routine 代码/调试任务将回退到 Opus 4.8,公司与 Amazon、Microsoft、Google 等 Glasswing 合作制定 AI jailbreaks 严重性评估框架,并扩大美国政府在模型测试、安全预审、信息共享...

twitter关注列表2026年07月01日 13:08#AI产业#技术更新#AI安全
值得跟进
18

Claude Fable 5 明日全球重新上线

Anthropic 宣布 Claude Fable 5 将于明天在全球重新上线,并新增一组分类器以更精准地拦截网络安全相关任务。短期内,常规编码和调试等任务将回退至 Opus 4.8。Anthropic 还与 Amazon、Microsoft、Google 等 Glasswing 合作伙伴起草共识框架,用于评估 AI 越狱严重性及开发者应...

twitter关注列表2026年07月01日 11:42#模型发布#AI安全
观察
19

Anthropic Fable 5和Mythos 5解禁

美国商务部撤销对Anthropic的Fable 5和Mythos 5模型的出口管制,Anthropic从周三起恢复用户访问,但须主动检测安全风险并与政府合作制定发布流程。同时,OpenAI的GPT-5.6系列也在白宫要求下受限,引发业界担忧政府审批模式可能阻碍创新并让中国开源模型加速追赶。

twitter关注列表2026年07月01日 08:39#政策#AI安全#模型发布
观察
20

Claude Code 被指在系统提示词里对中国代理用户进行隐蔽标记

安全研究员 Adnane Khan 逆向分析 Claude Code v2.1.193-196,发现当用户通过非官方代理(设置 ANTHROPIC_BASE_URL)访问时,Claude Code 会检查代理域名是否在 147 个中国相关域名列表中(XOR-91 混淆),以及时区是否为 Asia/Shanghai 或 Asia/Urumq...

twitter关注列表2026年07月01日 00:31#AI安全#技术#行业动态
观察