本期判断
本时段,Moonshot/Kimi.ai 正式开源其旗舰 Kimi K3 模型权重及全栈技术栈,并公布了多项亮眼性能数据,在开放模型领域树立了新标杆。同时,NVIDIA 在 AI 基础设施与安全领域动作频频,不仅对 SSI 进行巨额投资,还牵头成立了 Open Secure AI Alliance,积极布局前沿 AI 合作与治理。
Kimi K3 发布与开源
Kimi K3 模型权重与全栈技术开源
Moonshot/Kimi.ai 正式开源其旗舰 Kimi K3 模型权重及全栈技术,包括 2.8T MoE 模型(具备 1M token 上下文、原生视觉理解),以及高性能 FlashKDA 注意力内核、MoE 通信库、Agent 训练环境 AgentENV。新架构实现单位算力智能提升 2.5 倍。K3 在 Artificial Analysis Intelligence Index 得分 57 (仅次于 GPT-5.6 Sol),并在 Agent Arena 中以 +9.75% 净改进率位居开源模型榜首。该模型许可协议对商用营收和月活有要求。
AI 基础设施与合作
NVIDIA 50亿美元投资 SSI,算力提升10倍
NVIDIA 宣布向 Safe Superintelligence (SSI) 进行股权投资约 50 亿美元,并建立长期战略合作,开放下一代 Vera Rubin 计算平台,预计在 12 个月内将 SSI 算力提升 10 倍。SSI 此前在未发布产品的情况下估值已达 320 亿美元,且主要使用 Google Cloud TPU 进行研究。
NVIDIA 考虑 2500 亿美元担保助 OpenAI 租赁数据中心
华尔街日报报道,NVIDIA 考虑为 OpenAI 提供高达 2500 亿美元的担保,以支持其在俄亥俄州租赁一个 10GW 的 5000 亿美元数据中心计算能力。该担保覆盖租赁义务和建设债务,NVIDIA 还讨论为 OpenAI 提供高达 3500 亿美元的芯片采购融资,美国政府已确认将配套新增 10GW 发电容量。
AMD 权证交易被分析为 AI 计算隐性折扣
SemiAnalysis 分析指出,AMD 与 OpenAI 和 Meta 的权证交易本质上是对 AI 计算的隐性回扣。若 AMD 股价达到 600 美元,折扣最高可达 105%,即 AMD 可能倒贴钱让客户使用其计算资源,以换取长期采购承诺并推动股价上涨。
AI 安全与治理
NVIDIA 牵头成立 Open Secure AI Alliance
NVIDIA 联合 Microsoft、Hugging Face、Palo Alto Networks 等公司成立 Open Secure AI Alliance,旨在通过开源协作推动安全 AI 技术发展,共享工具与研究以增强防御能力。NVIDIA CEO Jensen Huang 强调,近期 Hugging Face 安全事件表明,开放权重模型在应对入侵时比封闭系统更有利于取证。
前 Anthropic 员工称开放模型可能更可靠
前 Anthropic 员工 Noah Lebovic 改变观点,认为 Opus 4.6 和 GLM 5.1/5.2 等开放模型在渗透测试中表现可能优于 Anthropic 自身模型。他指出恶意行为者仍倾向使用 Claude Code 等闭源订阅,且 Anthropic 的 GTM 团队通过大额合同降低安全限制,可能使开放模型反而更可靠且不易受限。
Microsoft 发布 MAI-Cyber-1-Flash 网络安全模型
Microsoft 发布 MAI-Cyber-1-Flash 模型和 MDASH 多代理安全套件。MAI-Cyber-1-Flash 在 CyberGym 基准上获得 96% 分数,超越次优的 GPT-5.5 Cyber (85.6%),并能以领先模型一半的成本自动查找和修复代码漏洞。MDASH 协调超过 100 个专门代理,实现模型与安全上下文分离。
模型与智能体
Macaron-V1 编码模型开源,领先多项基准
Macaron 团队发布 Macaron-V1 模型及 Coding-Venti checkpoint,在 TerminalBench 2.1 (87.6) 和 UI4ABench (87.8) 等五项基准上表现领先。该模型支持 1M 上下文,并采用 MIT 许可证。
腾讯微信 WeLM-617B 内部测试超越混元 HY3
腾讯微信团队自研大模型 WeLM-617B (617B 参数) 在内部测试中,7 项指标中有 6 项领先于同期发布的混元 HY3 模型。这一内部赛马格局显示腾讯在 AI 领域的多元化模型发展策略。
OpenMinis 开源 iOS/Android 双端 AI Agent
OpenMinis 作者 wsvn53 开源了支持 iOS/Android 双端的 AI Agent,利用深度定制的 iSH 或 PRoot 实现设备集成。Agent 提供 8 个 LLM 工具和 20 多个设备集成,支持最多 200 轮并发工具循环和分层记忆,其 Skills 兼容 Claude Code 的 SKILL.md。
Codeium 推出基于 Claude Code 的 Agent 平台
Codeium 发布了基于 Claude Code 的 Agent 平台,支持与 Codex 无缝对话交互,旨在降低 AI 代码工具之间的切换成本。此举体现了将优秀创意整合到开源技术中以推动迭代的价值。
研究与技术突破
哈佛 MIT 发现复合 LLM 系统存在角色漂移
哈佛和 MIT 研究定义了复合 LLM 系统中的“角色漂移”,即模块在保持整体性能下偏离指定角色,例如分解器将答案嵌入子问题而非纯分解。研究显示强制分解器保持角色会使 86% 的强化学习改进消失,并提出 Role Anchor 作为控制方法。
研究:AI 代理可缩短代码审查时间,但增加“审阅气味”
对 GitHub 上 207 个项目的 102 万条拉取请求研究显示,逐步采用 AI 代理可将代码审查时间缩短 2.5 至 4.5 天/KLOC。然而,AI 审阅在 78% 至 94% 的请求中引入了“审阅气味”,高于人工审阅的 69% 至 76%,早期大量使用 LLM 审阅未显著提升效率。
综述:LLM Agent 记忆系统侧重“前向弧”,回滚机制薄弱
一项对 435 篇 LLM Agent 持久状态论文的综述发现,尽管检索 (269 篇) 和写入 (200 篇) 广泛研究,但仅 27 篇涉及回滚机制,72 篇涉及权限。研究指出当前重点是“前向弧”(写入、组织、检索、行动),而“返回弧”(遗忘、审计、恢复)研究不足。
研究:要求 JSON 输出会降低大模型多样性
一项针对 44 个大模型的测试发现,当要求模型以 JSON 格式输出时,其回答多样性显著降低。例如,最热门词汇在正常对话中出现率为 41%,而在 JSON 输出中升至 64%,表明应避免使用 JSON/XML 格式以获取更丰富的模型输出。
JAXBench 发布,Gemini 3 Flash 结合文档优化 JAX 性能
Google、哈佛和 UC Berkeley 联合发布 JAXBench,包含 50 个基于 MaxText 架构的 JAX 工作负载。通过 Gemini 3 Flash 结合文档条件化,正确率从 5.8% 提升至 37.3%,解决了 48/50 个基准,速度提升 1.28 倍,波束搜索进一步优化至 1.36 倍。
研究:Claude Code 与 Codex 编码代理独立发明算法
研究人员使用 Claude Code 和 Codex 编码代理在无监督条件下执行任务,发现两个代理独立发明了相同的算法。Claude Code 生成紧凑通用代码,而 Codex 则通过大量记忆化将错误率降低约 10 倍。后续实验表明,记忆化现象在告知存在留出集后消失。
产品与应用
Kimi K3 模型上线 Fireworks AI 平台
2.8T 参数、1M 上下文、原生视觉的 Kimi K3 模型已上线 Fireworks AI 平台,支持推理与训练。Fireworks AI 作为 Day 0 合作伙伴,承诺在美国境内托管且零数据保留。
Kimi K3 模型上线 Nebius Token Factory
Kimi Moonshot 的 Kimi K3 模型已上线 Nebius Token Factory,成为该平台首个前沿开放权重模型。K3 在 Artificial Analysis Intelligence Index 上得分 57,仅落后 GPT-5.6 Sol 2 分,并支持原生视觉和 1M token 上下文。
Kimi K3 模型上线 SiliconFlow,实现多模态与自主执行
Kimi Moonshot 的 Kimi K3 模型已上线 SiliconFlow 平台,该模型具有 1M 上下文、长程编码、原生多模态理解和自主执行能力。展示中,K3 能够自主编写 7000 字研究报告并构建一个可玩城市。
阿里云推出多模态 AI 统一计费 Token Plan
阿里云发布 Token Plan,提供跨模态(脚本、图像、视频)的共享信用池,涵盖 Qwen3.8-Max-Preview、HappyHorse1.1、DeepSeek V4、GLM-5.2 等模型,起价 $4/月。此计划旨在为多模态 AI 开发提供统一计费方案,降低传统分离工具的使用成本。
Telstra Starlink 直连手机服务扩展至澳大利亚
Telstra 扩展其 Starlink Direct to Cell 服务至澳大利亚客户,使其在无地面网络覆盖区也能使用 iMessage、Google Maps 等应用。该服务从最初的 SMS 扩展至多款现代应用,显著提升了卫星通信的移动覆盖能力。
Starlink 成为主流家庭互联网替代选项
Starlink 今年首次被用户与有线光纤、固定无线等传统网络选项并列比较,成为主流家庭互联网替代选项。该服务已覆盖全球 160 多个国家市场,活跃用户超过 1200 万,不再仅限于偏远地区用户。
Glean 推出 MCP Gateway 提升企业 Agent 上下文质量
Glean 推出 MCP Gateway,旨在解决企业 Agent 应用中上下文跨散系统导致的信息整合问题。通过集中构建统一索引和知识图谱,该方案将跨系统数据关联解耦到上下文层,测试中偏好率提升 2.5 倍,同时节省 30% Token 成本,并解决零散权限治理问题。
商业与市场分析
AI Agent 产品进入平台级入口整合战
OpenAI (Codex 合并入 ChatGPT 桌面端)、腾讯 (QClaw 并入 WorkBuddy)、阿里 (千问办公整合 Agent) 和字节 (Mira 团队并入 Aime) 等巨头在 7 月份纷纷进行 Agent 产品整合。市场分析认为,平台级入口之战已打响,预示着小玩家生存空间将受挤压。