Digest Issue

AI HOT 早报

本期日报聚焦Kimi K3模型的全面发布,该模型以2.8万亿参数、1M上下文及多模态能力在前端代码竞技场登顶,并在写作和代理任务中超越多个顶尖竞品,且成本更低,标志着国产大模型在关键能力上取得突破。同时,LiveKit部署Google Gemma 4 31B模型,在实时语音应用中显著降低延迟和成本;...

44条精选信号
5个情报板块
morning简报时段
2026年07月18日 00:01生成时间

本期判断

本期日报聚焦Kimi K3模型的全面发布,该模型以2.8万亿参数、1M上下文及多模态能力在前端代码竞技场登顶,并在写作和代理任务中超越多个顶尖竞品,且成本更低,标志着国产大模型在关键能力上取得突破。同时,LiveKit部署Google Gemma 4 31B模型,在实时语音应用中显著降低延迟和成本;NVIDIA发布Nemotron 3 Embed新版本;中国国家主席习近平在世界AI大会强调开源AI与全球共治,显示出AI领域的技术竞争与政策博弈持续升温。

Kimi K3 发布专题

01

Kimi K3 2.8T参数及多模态技术全面升级

Moonshot AI发布Kimi K3模型,总参数2.8万亿,采用896选16的MoE稀疏架构(仅激活1.8%专家),支持100万token上下文及原生多模态。引入Kimi Delta Attention使百万token解码速度提升6.3倍,Attention Residuals以低于2%额外成本提升训练效率25%。在Frontend Code Arena以1679分登顶(超越Claude Fable 5和GPT-5.6 Sol),在7个前端细分赛道中6项第一。在内部写作基准测试中以2840 Elo分超越Fable 5,在AutomationBench-AA中排名第一。API定价为输入$3/百万tokens,输出$15/百万tokens,缓存$0.30/百万tokens。Kimi K3在人工智能指数(AAI)中获得57分,接近Opus 4.8和GPT-5.5。其权重计划于2026年7月27日开源。技术报告显示其实现自主芯片设计、GPU编译器和训练内核自优化,并加速计算天体物理学工作流。尽管在特定第三方代码生成测试中表现不佳(耗时75.6分钟,仅成功1/3任务,81%推理token),但在成本效率上,生成复古游戏成本为$0.28,远低于Opus 4.8的$0.54。

#Moonshot AI#Kimi.ai#Artificial Analysis
02

月之暗面GTC演讲揭示Kimi K2.5扩展技术细节

月之暗面在GTC 2026宣布开源三个替代Transformer基础组件:MuonClip优化器(数据效率接近翻倍)、Kimi Linear线性注意力(3:1混合全注意力,首个全面超越全注意力的架构)、Attention Residue残差连接(提升24% Token效率)。同时披露Agent Swarm支持100-300个并行Agent,以及早期融合多模态训练中视觉任务反向提升文本推理能力。

#Moonshot AI#Yang Zhilin

模型发布与更新

01

NVIDIA Nemotron 3 Embed 8B登顶RTEB并发布新版本

NVIDIA开源Nemotron 3 Embed 8B模型,在RTEB评测中以78.5%凭借32k上下文、多语种及代码检索能力夺得首位。同时发布1B与Blackwell NVFP4版本,后者吞吐量翻倍、BF16精度保持99%+。该模型提升了检索效率,使智能代理更早获取证据,减少下游token消耗。

#NVIDIA AI
02

Meta AI发布VideoChat3:82FPS实时视频多模态模型

Meta AI团队发布VideoChat3,采用Zeros-R架构在RTX 3090/L40 NVIDIA显卡上实现82FPS实时处理的视频多模态大模型,技术突破显存瓶颈(支持10M/T框架和3小时视频输入)。模型包含20亿参数的基本配置,在与Meta AudioGen、Microsoft VALL-E的基准测试中展示GPU显存使用率优化,显存占用率降低35%。

#Meta AI
03

RoboTTT机器人模型上下文扩展至8000步

Jim Fan团队发布RoboTTT,将机器人模型上下文原生扩展到8000时间步(5分钟),推断成本恒定,性能较前沿提升三个数量级。采用测试时训练技术,内部小模型持续压缩历史,实现无限学习。在电路板组装任务中,机器人能从人类视频一次性模仿学习并在线自我纠错。上下文缩放实验表明,8K步预训练性能优于1K步62%,且未饱和。

#Jim Fan
04

InternVLA-A1.5发布四检查点,刷新多项机器人基准

InternVLA-A1.5新模型在ModelScope上发布了四个检查点,包含2.69B参数的基础版本及LIBERO、RoboTwin 2.0、DOMINO的任务特定版本。该模型在六项仿真基准赛中报告了最佳整体成绩,分别为LIBERO 98.9、LIBERO-Plus 84.8、RoboTwin 2.0 93.2。训练集覆盖1.2M机器人回合、861M帧和3M多模态样本,采用可学习的潜在前瞻性令牌捕获未来动态。

#ModelScope
05

Astribot发布Lumo-2机器人基础模型,推理加速2.71倍

Astribot发布了40亿参数的Lumo-2机器人基础模型,推理速度比前代快2.71倍,支持人类视频和多机器人身体。该模型在105个未见物体上表现更好,并在22项涵盖运动预测、记忆、物理推理、长期任务、精细手部控制的真实操作任务中表现最佳,已在20多个复杂家庭任务的真实机器人上验证。

#Astribot
06

Runway Agent 2.0在Physion-Arc视频基准中全面领先

Physion Labs发布Physion-Arc 1.0基准测试,独立人类评估Runway、Luma、MiniMax等六款AI视频代理。Runway Agent 2.0在叙事连贯性、电影语言和制作质量三项核心维度全部排名第一。

#RunwayML
07

Grok 4.5成本效率卓越,任务成本远低于竞品

Artificial Analysis数据显示,Grok 4.5每次任务成本仅0.31美元,而Claude Fable 5为2.75美元、Claude Opus 4.8为1.80美元、GPT-5.6 Sol为1.04美元、Kimi K3为0.95美元,Grok 4.5成本分别低约9倍、6倍、3倍和3倍;在FrontierSWE上,Grok 4.5每个任务的总token消耗比Fable 5少6倍,性能仍接近顶端。

#Artificial Analysis#Elon Musk

智能体与平台

01

LiveKit优化部署Google Gemma 4 31B,实时语音表现超越GPT-4.1

LiveKit在自家推理平台LiveKit Inference上部署Google Gemma 4 31B模型,在实时语音应用中实现接话延迟比GPT-4.1低5.2倍(192毫秒对1006毫秒)、成本约六分之一(省83%)的效果;酒店前台场景测试中任务完成率达88%,超过GPT-4.1(73%)和Gemini 2.5 Flash(64%);Gemma 4支持140多种语言,其中35种以上开箱即用;现有LiveKit Agents用户可通过单行配置迁移至Gemma 4 31B。

#LiveKit#Google Gemma
02

Anthropic Claude Managed Agents支持500项技能扩容

Anthropic在Claude 3系列推出新特性,实现代理系统技能数量扩展至500项,增强自定义化程度。更新后的API参数文档显示请求头需包含v20240201标识符。相较Claude 2的100技能限制,新版本实现10倍扩容。

#Anthropic
03

EverMind与MiniMax合作,构建Raven持久记忆代理系统

EverMind与MiniMax合作,其模型MiniMax被集成到Raven系统中。Raven基于EverOS构建,具备持久记忆、长上下文处理、多代理协作及可复用技能特性,能够执行深度研究、高性能编码等复杂任务。

#EverMind#MiniMax AI
04

MemoHarness:LLM控制层优化的新方法

MemoHarness将LLM控制层分解为六个可编辑表面,通过检索历史执行记录进行结构化编辑,无需反馈或梯度更新。在Shell-Agent基准上达到0.806,超越最强固定控制层基线0.722,且单任务成本低于最强商业基线。

#Omar Sar
05

Cursor团队通过自动化AI研究加速模型迭代

Cursor团队在约一年内构建了外循环收集用户反馈、内循环优化训练过程的系统,使Composer 2.5成为最受欢迎模型并与SpaceXAI联合训练Grok 4.5。该系统通过大量真实交互数据、限制网络访问、维护CursorBench任务集,实现模型自我加速迭代并应对评估作弊问题。

#Cursor#Shao Meng

研究突破

01

AI说服力远超人类:说服捐赠效果达三倍

在一系列包含20000次对话和7000名参与者的实验中,AI模型在说服力上超越了人类冠军辩手和专业募捐者。AI的优势来自速度和信息量,无限制时AI说服捐赠货币的效果是专业募捐者的近三倍。

#Cyntro
02

Sakana AI提出无反向传播的Dale原理神经网络训练法

Sakana AI发表论文《Diffusing Blame》,提出一种训练神经网络的方法,该网络严格遵循Dale原理(每个神经元要么兴奋要么抑制),无需反向传播。该方法基于Error Diffusion扩展,通过模数错误路由在图像分类和强化学习任务上取得有竞争力的结果,且不需要权重传输。

#Sakana AI

商业与政策

01

Databricks完成1880亿美元估值融资,AI产品贡献17亿美元

Databricks CEO Ali Ghodsi宣布公司以1880亿美元估值融资,年化收入达69亿美元(同比增长80%),其中AI产品(AI Gateway、Genie)贡献17亿美元。

#Databricks
02

习近平在世界AI大会阐述AI全球治理愿景,反对技术限制

中国国家主席习近平在上海2026世界人工智能大会致辞,反对美国主导的AI技术限制,倡导开源AI与全球共治。他警告以国家安全为由泛化限制将让强国垄断技术获取权,并承诺未来5年为发展中国家伙伴提供5000个AI研究、培训与合作名额,旨在将开源AI定位为产业政策与外交工具。

#Xi Jinping#Rohan Paul
03

Replit用内部工具取代三款SaaS产品,核心团队效率提升三倍

Replit将三款七位数SaaS产品替换为内部工具,包括销售CRM、告警分类/根因分析工具(成本降至原价的10%)、自动化渗透测试工具(发现更多漏洞),核心工程师团队输出量翻三倍。支持工程师处理难题速度提高60%,数据分析能力普及化。

#Replit
04

AI代码替代趋势分析:系统集成是核心阻力

作者和Tobi Lutke分析AI代码替代趋势,指出大量低效人力资源可能被AI替代,核心阻力是系统集成而非技术瓶颈。认为替代阻力不是技术瓶颈,而是与现有人工工作质量和流程的适配问题。

#Daniel Miessler
05

Aionic Labs成立,专注时间序列语言模型(TSLMs)

Robert Jakob和Thomas Kaar在苏黎世创立Aionic Labs公司,获得SPRIN-D Next Frontier AI initiative支持,专注开发Time-Series Language Models (TSLMs)用于连接传感器数据与自然语言决策。公司计划在制造、医疗、能源等行业启动TSLM试点项目,并构建OpenTSLM和TimeNet开源社区。

#Aionic Labs