本期判断
本期 AI 日报聚焦模型在复杂推理任务上的突破,其中 RedNote 的 AI 模型在 IMO 竞赛中获得满分,而 Grok 和 Devin 亦成功反驳或证明了多项长期未决的数学猜想。同时,AI Agent 的实用化进程加速,OpenAI 推出桌面版 ChatGPT Voice 及企业级 Agent 平台 Presence,并扩展了医疗健康功能。硬件方面,AMD MI355X 在推理性能上展现出可匹敌 NVIDIA B200 的实力,预示着 AI 算力竞争的持续升温。
研究突破与模型能力
RedNote AI模型IMO获42分满分
RedNote (小红书母公司) 的 AI 模型 dots-note-3.0 在国际数学奥林匹克竞赛 (IMO) 中获得 42/42 满分,成为首个达成此成就的 AI 系统。该模型直接阅读竞赛文档,通过自然语言推理与 Python 代码执行的代理循环,经草稿测试、自我审查后提交答案,全程无人工改写。其表现超越去年 Google DeepMind 和 OpenAI 的 35/42,且人类参赛者中仅 7 人满分。RedNote 承诺后续开源该模型,获胜变体为 dots3 系列中最小版本。
研究者用GPT-5.6解决6个Erdős问题
研究者 Shouqiao Wang 使用 OpenAI 的 GPT-5.6 Sol Ultra 在 Codex 环境中,于 5 天内提出了 6 个 Erdős 问题的证明方案,成功率为 46% (尝试 13 个)。工作流程包括多次迭代、诊断、新方法、证明草稿、对抗性审计及修复,采用合同式提示明确证明要求、排除弱结果并指定搜索策略。
Grok 4.5 反驳30年图论猜想
Elon Musk 宣布 Grok 4.5 通过 Capy 在 8 分钟内反驳了开放约 30 年的 Graffiti Conjecture 284。该猜想此前未被解决,此举展示了 Grok 在复杂数学推理方面的能力。
Devin 破解三个未解决数学猜想
AI 编程助手 Devin 在一天内破解了三个未解决的数学猜想:驳斥了开放约 40 年的 Graffiti 猜想 154,证明了同样开放约 40 年的 Graffiti 猜想 39 和 40,并驳斥了开放约 20 年的 Brandt's Regular Supergraph Problem。
LLM知识注入:超网络缩放定律
Nace AI 研究团队发布论文,提出使用超网络 (hypernetwork) 将知识注入大语言模型,无需修改模型核心参数。该方法通过超网络将自然语言事实转换为 LoRA 权重,附加在冻结的模型上,且最强结果表明目标模型越大泛化越好。
长上下文推理:复制惰性与强化学习
研究人员发现,即使在强推理模型中,长上下文下模型会无差别复制输入文本的惰性,导致准确率下降。他们提出一种基于证据感知的强化学习奖励机制,通过惩罚复制无关内容、奖励关注关键文本,将准确率提升最多 4.6 个百分点。
编码代理规划胜率提升:Harness Handbook
Harness Handbook 论文提出使用静态分析和 LLM 辅助的 BGPD 流程,构建从运行时行为到源码位置的映射。在 60 个修改请求上,规划胜率从 28.3% 提升至 38.3% 和从 26.7% 提升至 45.6%,规划器 token 使用下降 12.7% 和 8.6%。文件级和符号级 F1 在 24 个对比中全面优于 GPT-5.5 和 Opus 4.8 参考计划,定位失败减少最多 25.9 个百分点。
模型发布与更新
微软MAI-Image-2.5-Pro和MAI-Voice-2-Flash公测
微软宣布 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash 模型进入公开预览。MAI-Image-2.5-Pro 提供最高保真度图像,定价为文本输入每百万 token 5 美元、图像输入每百万 token 8 美元、图像输出每百万 token 106 美元。MAI-Voice-2-Flash 速度是 MAI-Voice-2 的 2 倍,成本降低 32%,定价为每百万字符 15 美元,并集成 Dynamics 365 Contact Center,可降低 GPU 成本最高 89%。
AntLing发布Ling-3.0-flash MoE模型
AntLingAGI 发布 Ling-3.0-flash 混合推理 MoE 模型,总参数量 124B,每个 token 仅激活 5.1B 参数。该模型在多数基准测试中匹敌或超越其 1T 参数的旗舰模型,并在 Nous Portal 免费提供一周。
阿里Qwen-Audio-3.0-TTS文本转语音模型
阿里巴巴推出了 Qwen-Audio-3.0-TTS 文本转语音模型,提供实时版和高质量版两个版本,支持细粒度标签控制、自然语言指令、16 种语言和 noise 鲁棒输出,最长 3 分钟长语音,并已登顶 Artificial Analysis TTS 排行榜。
京东开源JoyAI-VL-Interaction视频交互模型
京东开源了 8B 参数的 JoyAI-VL-Interaction 模型,专为实时视觉驱动交互设计。在 26 个视频理解基准上平均得分 57.53,超过 Qwen3-VL-8B-Instruct 3.37 分。模型每秒处理直播视频并决定是否发言或保持沉默,交互时序通过时间对齐数据和强化学习学习,无需外部检测器。开源内容包括训练配方、数据和部署系统。
PaddlePaddle开源HPD-Parsing文档解析器
PaddlePaddle 在 ModelScope 上开源发布 1B 参数文档解析器 HPD-Parsing (Apache 2.0),采用层级并行解码。在 OmniDocBench v1.6 上得分 94.91% 报告为端到端统一解析器 SOTA,吞吐达 4752 TPS,较最快对比解析器高 1.62 倍、较自回归基线高 3.06 倍,长文档延迟降低 5.80 倍。
Sonilo发布音频模型Sound Effects 1.0
Sonilo 发布了视频原生音频模型 Sound Effects 1.0,可自动从视频同步音频,支持三分钟输入并可根据文本生成独立音频素材。该模型与现有 Video2Music 和 Text2Music 工具集成,Fal 独家提供 Day Zero API,并在基准测试中声称超越领先模型。
Dreamina Seedance 2.0 4K视频模型更新
BytePlus 旗下 Dreamina 发布 Seedance 2.0 4K 视频生成模型,原生 4K 分辨率,支持文本、图像、视频、音频参考输入及视频编辑扩展,通过 BytePlus ModelArk API 运行。导演 Neill Blomkamp 使用该模型创作了 13 分钟科幻恐怖短片 Nightborne,并计划用于长片制作。
平台与工具更新
OpenAI推出桌面ChatGPT Voice与Agent
OpenAI 在 macOS 和 Windows 桌面应用中推出 ChatGPT Voice 功能,基于 GPT-Live 模型,支持用户通过语音控制电脑并协调多个 agents 执行任务(如 Slack 操作、Spotify 控制)。该功能已面向 Plus、Pro、Business、Edu 和 Enterprise 计划用户逐步上线,是首次为 ChatGPT 用户开放连接器接入能力。
OpenAI Presence企业级Agent平台
OpenAI 推出面向企业的语音与聊天 AI Agent 平台 Presence,具备策略、护栏、升级规则和模拟评测等闭环系统。其自有电话支持已能独立解决 75% 的来电问题,并在 10 天内将人工转接率降低 15 个百分点。目前仅面向符合条件的企业限量开放。
Google DeepMind发布Gemini 3.5 Flash Cyber
Google DeepMind 开发 Gemini 3.5 Flash Cyber 以提升代码漏洞检测效率。该模型通过测试自家代码库(如 Google Chrome 和 Android 代码库),展现出捕捉标准模型忽略的复杂漏洞能力,专门为安全团队设计。
Cursor Router智能模型路由成本减半
Cursor 推出 Router,基于 60 万+ 线上请求训练分类器,根据查询内容、上下文、任务复杂度等自动选择模型,在保持用户满意度的同时,将成本降低 30-60%。Intelligence 模式用户满意度接近 Fable,成本低约 60%;Balance 模式满意度高于 Opus 4.8,成本低约 36%。单次 commit 成本:Intelligence $6.76、Balance $4.63,对比 Fable 5 的 $12.69 和 Opus 4.8 的 $7.34。
Offloop发布多智能体调度框架D1
Offloop 发布了多智能体调度框架 D1,通过小型调度模型控制 Agent 动作、停止时机及人工介入。该框架旨在消除多代理系统的冗余工作,在 GDPval 基准测试中表现优于 Claude Code 和 Codex,并在处理任务遇到瓶颈时能自动升级至人工处理。
ChatGPT推出健康功能连接Apple Health
OpenAI 开始向美国用户滚动推出 ChatGPT 健康功能,支持连接 Apple Health 与医疗记录。该功能基于 GPT‑5.5 Instant 与 GPT‑5.6 Sol 两代模型,经数百名医师评估,且不使用连接的医疗数据进行模型训练或广告定位。每周有超过 3 亿人进行健康相关提问。
Atomic Agent开源本地智能体发布
Atomic 发布开源本地智能体 Atomic Agent,基于 llama.cpp 运行 Qwen、Gemma、Llama 模型,通过 ARIA 快照操作浏览器、编辑文件、执行 shell 命令,具备持久化跨会话记忆。它采用稳定前缀缓存降低成本及 TurboQuant 将 KV 缓存压缩 6.4 倍,在 GAIA Level 1 基准上以 37 任务通过超越 Hermes 的 31 任务,支持 macOS、Windows、Linux。
The Stack v3发布:最大开放代码数据集
BigCode 社区发布 The Stack v3,这是迄今最大的开放代码数据集,包含 114 TB 原始数据、15.9 TB 处理后数据、约 5T 去重 tokens,涵盖 770 种编程语言和 2.24 亿仓库,完全开放且无限制许可。相比 2024 年的 v2(68 TB raw / 550B tokens / 618 种语言),v3 在规模、语言覆盖和使用便利性上大幅提升,并重新爬取了截至 2025 年 8 月的最新 commit。
Claude安全插件beta版发布
Anthropic 发布 Claude Security 插件(beta 版) for Claude Code,可在终端通过一行命令实现代码提交前的漏洞扫描。插件采用多智能体协作进行架构盘点、威胁建模、漏洞挖掘和独立验证,提供 Medium、High、Max 三种深度,其中 Max 模式会推翻自身发现以减少误报。输出仅提供漏洞说明和补丁方案,不自动修改代码。
VibeGamer游戏AI角色设计框架开源
karminski 团队在 GitHub 上开源了 VibeGamer,这是一个旨在协助游戏策划师设计独特而有趣的 AI 角色的框架。该项目包括 AI 未来事件预测、生成 OST(原声音乐)、使用 Stable Diffusion 生成环境设计的功能模块,原始提交包含了 Hugging Face Inference 接口和 Colab 集成等技术实现细节。
基础设施与硬件
AMD MI355X推理性能接近NVIDIA B200
MiniMax 团队宣布 AMD MI355X GPU 现已达到与 Nvidia B200 相当的 MiniMax-M3 推理性能。他们发布了两份技术博客,详细介绍了为该公司 428B MSA 稀疏 MoE 多模态基础模型提供的 ATOM+ATOMesh 全栈协同优化方案,包括 EAGLE3 猜测解码、MSA 对齐的 Page-16 KV 缓存(支持 1M 超长上下文)和分层 FP8 量化等。
NVIDIA Vera Rubin NVL72对比GB200分析
Semianalysis 对 NVIDIA 的 Vera Rubin NVL72 和 GB200 NVL72 进行了推理总拥有成本和架构对比分析。分析涉及 Rubin LUT Based Tensor Core、Feynman 设计、机架规模性能、每兆瓦性能、每美元性能以及 PyTorch、vLLM、OpenAI Triton 等软件改进,旨在提供全面的性能与成本评估。
商业与市场
Elon Musk愿景:构建超意识文明
Elon Musk 在演讲中表达了对构建意识最大化传播的科幻未来文明的追求,同时提及 Starship 火箭的量产频率目标。他还提到童年时看《星球大战》的经历对其人生观的深远影响,反映了技术巨头对 AI 与太空探索方向的宏大愿景。
X旗下Grok月活用户增长117%
X 公司的 Grok 在过去一年全年用户月活增加了 117%,实现超过一倍增长。此增长速度显示出 Grok 强劲的市场接受度,数据来源于 X 公司内部统计。
月之暗面K3开源引发纳斯达克震荡
月之暗面团队用 300 人开发出 2.8 万亿参数的开源模型 K3(896 专家 MoE,每次激活 16 个,Delta Attention,自研优化器),并在 Arena 前端盲测中排名第一,输入价格为 $3,输出价格为 $15。发布后纳斯达克跌 1%,同时月之暗面启动港股 IPO 筹备。
硅谷公司敦促勿切断中国开源AI模型
近 200 家硅谷公司(包括 Proton 和 Y-Combinator)联合敦促特朗普政府不要切断对中国开源权重 AI 模型的访问,警告此举可能损害美国下一代初创企业的发展。
Google Gemma 4下载量突破3亿
Google Gemma 宣布 Gemma 4 模型下载量已突破 3 亿次。这一数据体现了 Gemma 4 在全球开发者社区中的广泛应用和受欢迎程度。
AIHOT月活用户突破60万
AIHOT 月活突破 60 万,站点完成 UI 升级,交互更流畅。后端实现数百信源 5 分钟抓取、数据清洗、结构化、预筛选、聚类展示,至少 10 个大模型环节,累计数百轮数据回测与标注。创始人表示永久免费,未来将持续开发新功能。
AI医疗索赔代理投入生产
某 PE 支持的医疗账单平台在四个月内部署了七个生产级 AI 代理,用于处理真实医疗索赔并确保零 PHI 泄露。通过构建包含 34 个动态变量的丰富化层、固定架构和严格的输出模式验证,实现了可靠的生产运行。
应用与落地
ApolloGo获香港无人驾驶试驾许可
Apollo Go 获得香港运输署 Level 4 无人驾驶试驾许可,将于 7 月 27 日启动,实现无驾驶员操作。累计安全驾驶里程超 24 万公里,试验区域已扩展至北屯湾、九龙湾、港岛东部,首次在右驾市场推进 Level 4 完全无人驾驶技术应用。
LiveX将Physical AI用于NBA比赛
LiveX 与 NVIDIA 合作在 NBA 夏季联赛中部署 AI 设备,实现粉丝定制服装、虚拟试穿和自拍功能。该系统通过摒弃传统试衣间和排队流程,实现即时个性化体验,具备可重复且可扩展的物理 AI 应用模式。
AI安全与伦理
英美政府评估Kimi K3网络安全能力
英美政府安全机构联合发布报告,对比 Kimi K3 与美国前沿模型的网络安全能力。Kimi K3 在模拟攻击中平均步骤 17,而美国最强模型达 28.5;在 ExploitBench 中,Kimi K3 评分 32.2%,美国领先模型 76.2%,GLM-5.2 为 24.4%。
Agent身份与访问管理挑战
探讨有效无限数量代理管理的安全性问题,包括权限继承、生命周期管理、审计实践等技术挑战。报告强调,当前 IAM 体系无法应对代理的爆发性扩张特性,需要新的安全范式。
基准与评测
GPT-Live延迟评测显示一致性提升
Agora Media Lab 测量了 GPT-Live 的端到端延迟,发现其最大改进来自一致性而非原始速度。中位数响应仅改进 205ms,但延迟标准差从 489ms 降至 104ms,表明模型响应的稳定性大幅提高。