Digest Issue

AI HOT 早报

本期 AI 日报聚焦模型在复杂推理任务上的突破,其中 RedNote 的 AI 模型在 IMO 竞赛中获得满分,而 Grok 和 Devin 亦成功反驳或证明了多项长期未决的数学猜想。同时,AI Agent 的实用化进程加速,OpenAI 推出桌面版 ChatGPT Voice 及企业级 Agent...

50条精选信号
8个情报板块
morning简报时段
2026年07月24日 00:02生成时间

本期判断

本期 AI 日报聚焦模型在复杂推理任务上的突破,其中 RedNote 的 AI 模型在 IMO 竞赛中获得满分,而 Grok 和 Devin 亦成功反驳或证明了多项长期未决的数学猜想。同时,AI Agent 的实用化进程加速,OpenAI 推出桌面版 ChatGPT Voice 及企业级 Agent 平台 Presence,并扩展了医疗健康功能。硬件方面,AMD MI355X 在推理性能上展现出可匹敌 NVIDIA B200 的实力,预示着 AI 算力竞争的持续升温。

研究突破与模型能力

01

RedNote AI模型IMO获42分满分

RedNote (小红书母公司) 的 AI 模型 dots-note-3.0 在国际数学奥林匹克竞赛 (IMO) 中获得 42/42 满分,成为首个达成此成就的 AI 系统。该模型直接阅读竞赛文档,通过自然语言推理与 Python 代码执行的代理循环,经草稿测试、自我审查后提交答案,全程无人工改写。其表现超越去年 Google DeepMind 和 OpenAI 的 35/42,且人类参赛者中仅 7 人满分。RedNote 承诺后续开源该模型,获胜变体为 dots3 系列中最小版本。

#RedNote#小红书#rohanpaul_ai
02

研究者用GPT-5.6解决6个Erdős问题

研究者 Shouqiao Wang 使用 OpenAI 的 GPT-5.6 Sol Ultra 在 Codex 环境中,于 5 天内提出了 6 个 Erdős 问题的证明方案,成功率为 46% (尝试 13 个)。工作流程包括多次迭代、诊断、新方法、证明草稿、对抗性审计及修复,采用合同式提示明确证明要求、排除弱结果并指定搜索策略。

#kimmonismus#rohanpaul_ai
03

Grok 4.5 反驳30年图论猜想

Elon Musk 宣布 Grok 4.5 通过 Capy 在 8 分钟内反驳了开放约 30 年的 Graffiti Conjecture 284。该猜想此前未被解决,此举展示了 Grok 在复杂数学推理方面的能力。

#Elon Musk
04

Devin 破解三个未解决数学猜想

AI 编程助手 Devin 在一天内破解了三个未解决的数学猜想:驳斥了开放约 40 年的 Graffiti 猜想 154,证明了同样开放约 40 年的 Graffiti 猜想 39 和 40,并驳斥了开放约 20 年的 Brandt's Regular Supergraph Problem。

#rohanpaul_ai
05

LLM知识注入:超网络缩放定律

Nace AI 研究团队发布论文,提出使用超网络 (hypernetwork) 将知识注入大语言模型,无需修改模型核心参数。该方法通过超网络将自然语言事实转换为 LoRA 权重,附加在冻结的模型上,且最强结果表明目标模型越大泛化越好。

#Nace AI#rohanpaul_ai
06

长上下文推理:复制惰性与强化学习

研究人员发现,即使在强推理模型中,长上下文下模型会无差别复制输入文本的惰性,导致准确率下降。他们提出一种基于证据感知的强化学习奖励机制,通过惩罚复制无关内容、奖励关注关键文本,将准确率提升最多 4.6 个百分点。

#rohanpaul_ai
07

编码代理规划胜率提升:Harness Handbook

Harness Handbook 论文提出使用静态分析和 LLM 辅助的 BGPD 流程,构建从运行时行为到源码位置的映射。在 60 个修改请求上,规划胜率从 28.3% 提升至 38.3% 和从 26.7% 提升至 45.6%,规划器 token 使用下降 12.7% 和 8.6%。文件级和符号级 F1 在 24 个对比中全面优于 GPT-5.5 和 Opus 4.8 参考计划,定位失败减少最多 25.9 个百分点。

#omarsar0

模型发布与更新

01

微软MAI-Image-2.5-Pro和MAI-Voice-2-Flash公测

微软宣布 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash 模型进入公开预览。MAI-Image-2.5-Pro 提供最高保真度图像,定价为文本输入每百万 token 5 美元、图像输入每百万 token 8 美元、图像输出每百万 token 106 美元。MAI-Voice-2-Flash 速度是 MAI-Voice-2 的 2 倍,成本降低 32%,定价为每百万字符 15 美元,并集成 Dynamics 365 Contact Center,可降低 GPU 成本最高 89%。

#Microsoft Research#testingcatalog
02

AntLing发布Ling-3.0-flash MoE模型

AntLingAGI 发布 Ling-3.0-flash 混合推理 MoE 模型,总参数量 124B,每个 token 仅激活 5.1B 参数。该模型在多数基准测试中匹敌或超越其 1T 参数的旗舰模型,并在 Nous Portal 免费提供一周。

#AntLingAGI#NousResearch
03

阿里Qwen-Audio-3.0-TTS文本转语音模型

阿里巴巴推出了 Qwen-Audio-3.0-TTS 文本转语音模型,提供实时版和高质量版两个版本,支持细粒度标签控制、自然语言指令、16 种语言和 noise 鲁棒输出,最长 3 分钟长语音,并已登顶 Artificial Analysis TTS 排行榜。

#Alibaba Qwen
04

京东开源JoyAI-VL-Interaction视频交互模型

京东开源了 8B 参数的 JoyAI-VL-Interaction 模型,专为实时视觉驱动交互设计。在 26 个视频理解基准上平均得分 57.53,超过 Qwen3-VL-8B-Instruct 3.37 分。模型每秒处理直播视频并决定是否发言或保持沉默,交互时序通过时间对齐数据和强化学习学习,无需外部检测器。开源内容包括训练配方、数据和部署系统。

#JD#ModelScope2022
05

PaddlePaddle开源HPD-Parsing文档解析器

PaddlePaddle 在 ModelScope 上开源发布 1B 参数文档解析器 HPD-Parsing (Apache 2.0),采用层级并行解码。在 OmniDocBench v1.6 上得分 94.91% 报告为端到端统一解析器 SOTA,吞吐达 4752 TPS,较最快对比解析器高 1.62 倍、较自回归基线高 3.06 倍,长文档延迟降低 5.80 倍。

#PaddlePaddle#ModelScope2022
06

Sonilo发布音频模型Sound Effects 1.0

Sonilo 发布了视频原生音频模型 Sound Effects 1.0,可自动从视频同步音频,支持三分钟输入并可根据文本生成独立音频素材。该模型与现有 Video2Music 和 Text2Music 工具集成,Fal 独家提供 Day Zero API,并在基准测试中声称超越领先模型。

#Sonilo#testingcatalog
07

Dreamina Seedance 2.0 4K视频模型更新

BytePlus 旗下 Dreamina 发布 Seedance 2.0 4K 视频生成模型,原生 4K 分辨率,支持文本、图像、视频、音频参考输入及视频编辑扩展,通过 BytePlus ModelArk API 运行。导演 Neill Blomkamp 使用该模型创作了 13 分钟科幻恐怖短片 Nightborne,并计划用于长片制作。

#BytePlus#Dreamina#testingcatalog

平台与工具更新

01

OpenAI推出桌面ChatGPT Voice与Agent

OpenAI 在 macOS 和 Windows 桌面应用中推出 ChatGPT Voice 功能,基于 GPT-Live 模型,支持用户通过语音控制电脑并协调多个 agents 执行任务(如 Slack 操作、Spotify 控制)。该功能已面向 Plus、Pro、Business、Edu 和 Enterprise 计划用户逐步上线,是首次为 ChatGPT 用户开放连接器接入能力。

#OpenAI#testingcatalog#guinnesschen
02

OpenAI Presence企业级Agent平台

OpenAI 推出面向企业的语音与聊天 AI Agent 平台 Presence,具备策略、护栏、升级规则和模拟评测等闭环系统。其自有电话支持已能独立解决 75% 的来电问题,并在 10 天内将人工转接率降低 15 个百分点。目前仅面向符合条件的企业限量开放。

#OpenAI#BestBlogs
03

Google DeepMind发布Gemini 3.5 Flash Cyber

Google DeepMind 开发 Gemini 3.5 Flash Cyber 以提升代码漏洞检测效率。该模型通过测试自家代码库(如 Google Chrome 和 Android 代码库),展现出捕捉标准模型忽略的复杂漏洞能力,专门为安全团队设计。

#Google DeepMind
04

Cursor Router智能模型路由成本减半

Cursor 推出 Router,基于 60 万+ 线上请求训练分类器,根据查询内容、上下文、任务复杂度等自动选择模型,在保持用户满意度的同时,将成本降低 30-60%。Intelligence 模式用户满意度接近 Fable,成本低约 60%;Balance 模式满意度高于 Opus 4.8,成本低约 36%。单次 commit 成本:Intelligence $6.76、Balance $4.63,对比 Fable 5 的 $12.69 和 Opus 4.8 的 $7.34。

#Cursor#shao__meng
05

Offloop发布多智能体调度框架D1

Offloop 发布了多智能体调度框架 D1,通过小型调度模型控制 Agent 动作、停止时机及人工介入。该框架旨在消除多代理系统的冗余工作,在 GDPval 基准测试中表现优于 Claude Code 和 Codex,并在处理任务遇到瓶颈时能自动升级至人工处理。

#Offloop#kimmonismus#omarsar0
06

ChatGPT推出健康功能连接Apple Health

OpenAI 开始向美国用户滚动推出 ChatGPT 健康功能,支持连接 Apple Health 与医疗记录。该功能基于 GPT‑5.5 Instant 与 GPT‑5.6 Sol 两代模型,经数百名医师评估,且不使用连接的医疗数据进行模型训练或广告定位。每周有超过 3 亿人进行健康相关提问。

#OpenAI
07

Atomic Agent开源本地智能体发布

Atomic 发布开源本地智能体 Atomic Agent,基于 llama.cpp 运行 Qwen、Gemma、Llama 模型,通过 ARIA 快照操作浏览器、编辑文件、执行 shell 命令,具备持久化跨会话记忆。它采用稳定前缀缓存降低成本及 TurboQuant 将 KV 缓存压缩 6.4 倍,在 GAIA Level 1 基准上以 37 任务通过超越 Hermes 的 31 任务,支持 macOS、Windows、Linux。

#Atomic#testingcatalog
08

The Stack v3发布:最大开放代码数据集

BigCode 社区发布 The Stack v3,这是迄今最大的开放代码数据集,包含 114 TB 原始数据、15.9 TB 处理后数据、约 5T 去重 tokens,涵盖 770 种编程语言和 2.24 亿仓库,完全开放且无限制许可。相比 2024 年的 v2(68 TB raw / 550B tokens / 618 种语言),v3 在规模、语言覆盖和使用便利性上大幅提升,并重新爬取了截至 2025 年 8 月的最新 commit。

#BigCode#eliebakouch
09

Claude安全插件beta版发布

Anthropic 发布 Claude Security 插件(beta 版) for Claude Code,可在终端通过一行命令实现代码提交前的漏洞扫描。插件采用多智能体协作进行架构盘点、威胁建模、漏洞挖掘和独立验证,提供 Medium、High、Max 三种深度,其中 Max 模式会推翻自身发现以减少误报。输出仅提供漏洞说明和补丁方案,不自动修改代码。

#Anthropic#AYi_AInotes
10

VibeGamer游戏AI角色设计框架开源

karminski 团队在 GitHub 上开源了 VibeGamer,这是一个旨在协助游戏策划师设计独特而有趣的 AI 角色的框架。该项目包括 AI 未来事件预测、生成 OST(原声音乐)、使用 Stable Diffusion 生成环境设计的功能模块,原始提交包含了 Hugging Face Inference 接口和 Colab 集成等技术实现细节。

#karminski

基础设施与硬件

01

AMD MI355X推理性能接近NVIDIA B200

MiniMax 团队宣布 AMD MI355X GPU 现已达到与 Nvidia B200 相当的 MiniMax-M3 推理性能。他们发布了两份技术博客,详细介绍了为该公司 428B MSA 稀疏 MoE 多模态基础模型提供的 ATOM+ATOMesh 全栈协同优化方案,包括 EAGLE3 猜测解码、MSA 对齐的 Page-16 KV 缓存(支持 1M 超长上下文)和分层 FP8 量化等。

#MiniMax AI
02

NVIDIA Vera Rubin NVL72对比GB200分析

Semianalysis 对 NVIDIA 的 Vera Rubin NVL72 和 GB200 NVL72 进行了推理总拥有成本和架构对比分析。分析涉及 Rubin LUT Based Tensor Core、Feynman 设计、机架规模性能、每兆瓦性能、每美元性能以及 PyTorch、vLLM、OpenAI Triton 等软件改进,旨在提供全面的性能与成本评估。

#SemiAnalysis

商业与市场

01

Elon Musk愿景:构建超意识文明

Elon Musk 在演讲中表达了对构建意识最大化传播的科幻未来文明的追求,同时提及 Starship 火箭的量产频率目标。他还提到童年时看《星球大战》的经历对其人生观的深远影响,反映了技术巨头对 AI 与太空探索方向的宏大愿景。

#Elon Musk
02

X旗下Grok月活用户增长117%

X 公司的 Grok 在过去一年全年用户月活增加了 117%,实现超过一倍增长。此增长速度显示出 Grok 强劲的市场接受度,数据来源于 X 公司内部统计。

#X#Grok
03

月之暗面K3开源引发纳斯达克震荡

月之暗面团队用 300 人开发出 2.8 万亿参数的开源模型 K3(896 专家 MoE,每次激活 16 个,Delta Attention,自研优化器),并在 Arena 前端盲测中排名第一,输入价格为 $3,输出价格为 $15。发布后纳斯达克跌 1%,同时月之暗面启动港股 IPO 筹备。

#月之暗面#AYi_AInotes
04

硅谷公司敦促勿切断中国开源AI模型

近 200 家硅谷公司(包括 Proton 和 Y-Combinator)联合敦促特朗普政府不要切断对中国开源权重 AI 模型的访问,警告此举可能损害美国下一代初创企业的发展。

#Proton#Y-Combinator#SophiaCai99
05

Google Gemma 4下载量突破3亿

Google Gemma 宣布 Gemma 4 模型下载量已突破 3 亿次。这一数据体现了 Gemma 4 在全球开发者社区中的广泛应用和受欢迎程度。

#Google Gemma
06

AIHOT月活用户突破60万

AIHOT 月活突破 60 万,站点完成 UI 升级,交互更流畅。后端实现数百信源 5 分钟抓取、数据清洗、结构化、预筛选、聚类展示,至少 10 个大模型环节,累计数百轮数据回测与标注。创始人表示永久免费,未来将持续开发新功能。

#AIHOT#berryxia
07

AI医疗索赔代理投入生产

某 PE 支持的医疗账单平台在四个月内部署了七个生产级 AI 代理,用于处理真实医疗索赔并确保零 PHI 泄露。通过构建包含 34 个动态变量的丰富化层、固定架构和严格的输出模式验证,实现了可靠的生产运行。

#rohanpaul_ai

应用与落地

01

ApolloGo获香港无人驾驶试驾许可

Apollo Go 获得香港运输署 Level 4 无人驾驶试驾许可,将于 7 月 27 日启动,实现无驾驶员操作。累计安全驾驶里程超 24 万公里,试验区域已扩展至北屯湾、九龙湾、港岛东部,首次在右驾市场推进 Level 4 完全无人驾驶技术应用。

#Apollo Go#Baidu_Inc
02

LiveX将Physical AI用于NBA比赛

LiveX 与 NVIDIA 合作在 NBA 夏季联赛中部署 AI 设备,实现粉丝定制服装、虚拟试穿和自拍功能。该系统通过摒弃传统试衣间和排队流程,实现即时个性化体验,具备可重复且可扩展的物理 AI 应用模式。

#LiveX#NVIDIA

AI安全与伦理

01

英美政府评估Kimi K3网络安全能力

英美政府安全机构联合发布报告,对比 Kimi K3 与美国前沿模型的网络安全能力。Kimi K3 在模拟攻击中平均步骤 17,而美国最强模型达 28.5;在 ExploitBench 中,Kimi K3 评分 32.2%,美国领先模型 76.2%,GLM-5.2 为 24.4%。

#Kimi.ai#rohanpaul_ai
02

Agent身份与访问管理挑战

探讨有效无限数量代理管理的安全性问题,包括权限继承、生命周期管理、审计实践等技术挑战。报告强调,当前 IAM 体系无法应对代理的爆发性扩张特性,需要新的安全范式。

#realmadhuguru

基准与评测

01

GPT-Live延迟评测显示一致性提升

Agora Media Lab 测量了 GPT-Live 的端到端延迟,发现其最大改进来自一致性而非原始速度。中位数响应仅改进 205ms,但延迟标准差从 489ms 降至 104ms,表明模型响应的稳定性大幅提高。

#Agora Media Lab#rohanpaul_ai