Digest Issue

AI HOT 早报

本期日报聚焦新一代AI模型的密集发布与平台能力升级。Kimi K3和Thinking Machines的Inkling模型以万亿级参数和长上下文能力引领模型边界,而Google Gemini API则强化了代理管理功能。同时,xAI开源Grok Build以应对隐私挑战,DeepSeek披露年营收并...

40条精选信号
5个情报板块
morning简报时段
2026年07月17日 00:01生成时间

本期判断

本期日报聚焦新一代AI模型的密集发布与平台能力升级。Kimi K3和Thinking Machines的Inkling模型以万亿级参数和长上下文能力引领模型边界,而Google Gemini API则强化了代理管理功能。同时,xAI开源Grok Build以应对隐私挑战,DeepSeek披露年营收并计划IPO,行业在技术突破与商业化双向加速。

模型发布

01

Kimi K3模型发布:2.8T参数、1M上下文

Kimi.ai发布Kimi K3大模型,参数达2.8万亿,上下文窗口1百万token,原生多模态。采用Delta Attention使百万token解码提速6.3倍,Attention Residuals将训练效率提升25%(成本增2%)。该模型在前端代码Arena得分1679,并计划于2026年7月27日开源权重。

#Kimi.ai#Moonshot
02

Thinking Machines发布Inkling开源模型

Mira Murati旗下Thinking Machines发布Inkling开源模型,采用975B总参数、41B激活参数的MoE架构,支持1M上下文,在45T数据上训练,原生支持文本、图像、音频多模态。Apache 2.0授权,提供12B Small预览版。基准测试中,Inkling在IFBench达79.8%,FORTRESS Benign达95.9%,并在Terminal Bench上以1/3 token量匹敌Nemotron 3 Ultra。

#Thinking Machines#Mira Murati
03

Google Gemini Omni Flash登顶视频生成榜

Google发布Gemini Omni Flash多模态模型,在Artificial Analysis视频排行榜上,文本到视频和图像到视频生成均位居第一,击败ByteDance的Seedance 2.0。该模型支持文本、图像、视频输入,可生成720p 24FPS 3-10秒视频,定价为$0.10/秒。

#Google
04

SenseNova-U1-Infographic-V3信息图生成模型发布

SenseNova团队推出SenseNova-U1-Infographic-V3模型,基于8B参数MoT检查点,采用原生多模态NEO-unify架构。该模型在T2I任务上性能优于Qwen-Image-2.0和Z-Image,并在BizGenEval+IGenBench基准测试中排名靠前,支持10种编辑任务,采用Apache 2.0许可证。

#SenseNova#ModelScope
05

LingBot-VLA 2.0:60K小时机器人数据训练模型

LingBot-VLA 2.0是一款开源的具身模型,通过60K小时精选的机器人和人类数据训练,支持从单臂机器人到人形平台的多种机器人配置,显著提升了机器人在复杂长期任务上的性能。

#omarsar0
06

Hy-Embodied-VLM-1.0具身模型发布

Hy-Embodied-VLM-1.0在ModelScope发布,采用Apache 2.0许可证。该模型总参数约30B,每个token仅激活约3B,在38个具身基准测试中排名第一19个、第二11个,平均性能较Hy-Embodied-0.5 MoT-2B提升8.4%。

#ModelScope
07

Google Gemma 4 31B实时语音代理超越GPT‑4.1

Google Gemma团队将Gemma 4 31B模型部署在LiveKit推理平台,首次音频延迟为354ms,首次token生成时间为192ms。该模型在tau2bench工具使用基准上获得76.9%成功率,首次超越GPT‑4.1。

#Google Gemma
08

NVIDIA发布Nemotron 3 Embed 8B登顶RTEB

NVIDIA发布Nemotron 3 Embed 8B嵌入模型,在RTEB检索基准测试中获得总榜首位,该基准主要评估真实任务中的检索准确率。

#NVIDIA AI
09

Qwen-Audio-3.0-Realtime实时语音交互模型发布

阿里通义实验室发布Qwen-Audio-3.0-Realtime实时语音交互模型,具备高表现力共情对话、流畅双工交互和Agentic工具调用能力,在Artificial Analysis评测的Speech Reasoning子项中位列第一。

#阿里通义实验室
10

Arena新增事实核查评分,影响模型排名

Arena在其排行榜中新增基于真实用户对话的事实核查评分。启用事实权重后,GPT‑5.5在文本竞赛中上升13名,Muse Spark下降13名;而在搜索竞赛中GPT‑5.5-search登顶,Gemini grounding跌至第13名。

#Arena

智能体、平台与工具

01

xAI开源Grok Build Agent,应对隐私危机

xAI将Grok Build Agent平台代码以Apache 2.0协议开源,并重置所有用户用量限制,删除了此前保留的所有编码数据。此举旨在回应此前Grok Build CLI被曝上传整个Git仓库至Google Cloud的隐私争议。其80万行代码库涵盖agent loop、文件工具、shell执行、网络搜索、终端接口等核心模块。

#xAI#SpaceXAI
02

Gemini API新增管理代理功能

Google发布Gemini API管理代理更新,新增免费层可用性、预算警报功能和计划执行触发器。免费层支持无账单开发,通过max_total_tokens参数控制预算,并通过cron调度实现自动化任务。

#Google AI Devs
03

Raft 1.0发布:多智能体长期协作平台

Raft发布1.0版本,将多智能体系统转变为具有独立记忆、角色和共享线程的长期协作者,智能体可相互审查工作。Raft内部超过100个命名智能体处理99%的工作,beta阶段有超过20000名构建者,平均每个人类对应约4个智能体。

#Raft
04

Pipecat开源框架:构建实时语音AI代理

Pipecat是一个用于构建实时语音AI代理的开源Python框架,支持语音识别、文本转语音、对话逻辑和实时交互。它集成了WebRTC和WebSocket传输,兼容Deepgram、OpenAI、Anthropic等多种AI服务,适用于语音助手、AI伴侣等场景。

#Pipecat#Sumanth_077
05

DoorDash CLI有限Beta发布

DoorDash宣布开放CLI工具dd-cli的有限beta版本,允许AI代理直接从命令行搜索商店、查找优惠、下单和结账。早期访问面向美国和加拿大的macOS开发者,需通过waitlist申请。

#DoorDash
06

Boris Cherny:自动化赋能AI Agent开发

Boris Cherny指出在AI Agent时代,将领域知识编码为基础设施(如CLAUDE.md、REVIEW.md、skills、lint规则、CI步骤)比以往更关键。他主张团队应编写这些文件使Agent能零上下文高效工作,让非工程师也能有效贡献代码。

#Boris Cherny#steipete

研究突破

01

GPT-5.6 Sol Pro解决统计学长期猜想

Edgar Dobriban使用GPT-5.6 Sol Pro在90分钟内解决统计学长期猜想,证明Benjamini-Hochberg程序不能控制相关高斯双尾检验的FDR(在0.01名义水平下实际FDR > 0.0104)。此前GPT-5.5在20小时内未能解决该问题。

#Edgar Dobriban#polynoamial
02

MiniMax AI Trader周收益28.89%超越多模型

MiniMax AI通过AI Trader实现28.89%的周收益,达到新月度高点并排名第一,同时超越GPT-5.5、DeepSeek V4 Pro、Qwen和Kimi等主要模型表现。

#MiniMax AI#questflow
03

AI宣称解决19个Erdős问题

Przemek Chojecki声称GPT模型(主要是GPT-5.5 Pro)在四月解决了19个Erdős问题,其中3个新宣称由GPT-5.6 Sol Ultra在七月完成。部分解决方案尚未正式验证。

#Przemek Chojecki
04

Microsoft OAT:智能体调试新方法

Microsoft及合作者提出OAT(Offline Attribution via Trajectories),这是一种轻量级归因器,仅在成功轨迹上训练,利用神经控制微分方程建模成功动态。该方法将故障归因转化为成功模式的一类学习,无需标注错误步骤或失败数据。

#Microsoft#omarsar0
05

ICML 2026研究可复现性挑战赛

Gradio与@askalphaxiv合作举办ICML 2026可复现性挑战,要求参赛者挑选论文部署agent并构建开放工件库,最高奖励4000美元GPU额度,旨在推动科研成果的透明度和可信度。

#Gradio#askalphaxiv
06

H800s万亿令牌级训练与推理优化

最新分析指出,前沿模型训练数据量已扩展至30-45T令牌,通过多芯片优化(如64芯片优化)、MXFP4精度和静态形状等架构设计,数千块H800芯片足以完成训练,大幅提升训练效率,并影响RAM需求。

#EMostaque

商业与投资

01

DeepSeek年营收4-5亿美元,拟2027年IPO

DeepSeek年化收入达4-5亿美元,主要来自API销售,毛利率超70%。公司计划于2027年在上海科创板IPO,并启动第二轮融资,允许直接股权投资并通过QFLP结构接受境外美元。

#DeepSeek#The Information
02

AI行业进展集锦播客节目推荐

有用户推荐一档AI行业进展集锦播客节目,该节目涵盖技术突破、行业动态及访谈内容,并提供官方YouTube资源链接,为从业者提供了获取最新资讯的途径。

#swyx

AI安全与伦理

01

SpaceXAI起诉Grok用户制作儿童色情

Elon Musk证实SpaceXAI起诉一名Grok用户,该用户创建虚假账户并尝试生成儿童性虐待材料(CSAM),导致其被捕面临八项重罪指控。SpaceXAI在2026年已暂停52,222个账户,提交73,604份报告给NCMEC,促成至少244次逮捕。

#Elon Musk#SpaceXAI
02

OpenAI调查GPT-5.6文件意外删除问题

OpenAI正调查GPT-5.6意外删除文件的报告,常见原因为全访问模式、无沙箱保护及模型尝试覆盖$HOME环境变量。OpenAI将更新开发者消息,引导使用更安全权限模式,并增加沙箱保护,后续将发布详细分析。

#OpenAI#thsottiaux