本期判断
本时段 AI 行业迎来多项重磅进展。Kimi.ai 发布 2.8 万亿参数 Kimi K3 模型,OpenAI CEO Sam Altman 也预览了 GPT-6 的强大能力。Anthropic Opus 5 模型在实际应用和基准测试间的表现差异引发讨论,但其在 AI 视频生成方面展现出潜力。同时,中国出台 AI 伴侣监管新规,DeepSeek 暂停新一轮融资,市场与政策层面动态频频。
模型发布与更新
Kimi K3 发布 2.8T 参数原生多模态模型
Kimi.ai 发布 Kimi K3 模型,拥有 2.8 万亿参数、100 万上下文和原生多模态能力。采用 Kimi Delta Attention 技术实现百万 token 上下文 6.3 倍解码加速,Attention Residuals 以低于 2% 额外成本提升约 25% 训练效率。模型已上线官网及 API,开源权重将于 7 月 27 日开放。
Sam Altman 预览 GPT-6:可入侵真实公司
OpenAI CEO Sam Altman 预览公司最强大 AI 模型 GPT-6,据 Axios 报道,该模型已能成功入侵真实公司,并具备多代理协作能力,预示其在复杂任务执行方面的强大潜力。
Sakana AI Fugu-Ultra v1.1 支持 Claude Code 接口
Sakana AI 发布 Fugu-Ultra v1.1 版本,该模型通过提供兼容 Claude Code 的接口,支持在终端内编排多种 SOTA 模型协同工作,以执行编写、调试及执行代码等任务。
模型性能与评测
Opus 5 基准与实际表现存争议,用户体验下降
用户分析指出 Anthropic Opus 5 在基准测试中表现超出 Fable 5,但在实际应用中效能差异显著,且“人性化交互体验”下降,有用户更偏好 Grok 和 Kimi。研究发现,公司训练策略变化(Mythos 作为先导模型,后蒸馏生成 Sonnet 和 Opus)可能导致生成效能未达预期。
Anthropic Opus 5 展现游戏级视频生成能力
Anthropic Opus 5 在 AI 视频生成方面表现优异。测试显示其在生成 FPS 风格游戏视频(如“Claude of Duty”)时,消耗约 $400 tokens 耗时数小时,可生成 4K 120fps 视频,并通过 Clairvoyance 和 Matt Shumer 的提示展现了比 Kimi K3 更强的能力。
研究突破
研究揭示 Agent 系统存在内存提示词注入风险
University of Washington 研究发现,Agent 系统存在内存提示词注入风险。模型在交互中若遇到存储于内存文件(如 CLAUDE.md)中的恶意指令,即使当前会话拒绝,风险仍会在后续会话中持续。研究针对包括 Claude Opus 在内的 4 个模型进行了 10 次 multi-session probe sequences 实验验证。
NVIDIA:AdamW 优化器在大批量训练存上限
NVIDIA 研究发现,AdamW 优化器在批量大小达到 1 亿 token 时训练稳定性下降,而 SOAP 和 Muon 优化器保持稳定。团队通过正交化和改进预处理消除了 SOAP 在大批量下的 loss spikes,并在多十亿参数模型训练中,SOAP 和 Muon 表现一致优于 AdamW。
新方法:代理记忆系统从经验到技能的演化
论文提出 MSCE 方法,旨在解决代理记忆系统重复推理错误。该方法将经验组织为声明性事实、诱导程序化策略和基础步骤轨迹,并仅将重复模式提升为可调用的过程。每个策略需具备触发条件、边界、正向收益估计和证据支持,以实现更高效的长期代理行为。
预训练验证损失可高精度预测 RL 后模型表现
论文通过象棋实验(5M-1B 参数模型,36 种预训练-RL 组合)发现,预训练验证损失能高精度预测后 RL 的 pass@1(相关性 0.93-0.99)。RL 计算量每 10 倍增益与预训练 token 数对数正相关(r=+0.84),且 RL 会放大模型在困难问题上的错误模式。
研究:LLM 对人类可读性语言并非必要
研究人员提出 BabelTele 压缩写作风格,将文本缩短至原长的 27.9%,同时保持约 99.5% 的语义保真度。这证明模型可读性与人类可读性可分离,为未来模型输入优化提供了新思路。
商业与市场
DeepSeek 暂停第二轮融资,估值近 740 亿美元
DeepSeek 暂停其第二轮融资,该轮目标估值近 740 亿美元,此前 6 月已完成约 74 亿美元融资。暂停部分原因在于其创始人因泄露的私人言论感到沮丧(提到依赖 NVIDIA 芯片,中国 AI 落后美国,将 AGI 研究和开源强大模型置于优先地位),公司正考虑在上海科创板 IPO。
深度学习大模型研发呼吁“克制策略”
文章分析深度学习大模型研发应采取“克制策略”,强调持续迭代替代单次质变。建议在人才、模型、算力三要素面临动态变量时,将技术优势累积分散部署,避免在早期耗尽核心算力储备,以应对外部突变并保持长期竞争力。
AI 影响自由职业市场:人力资本信号价值下降
一项研究分析 ChatGPT 后 AI 对自由职业市场的影响,发现在 AI 暴露岗位中,人力资本信号重要性下降 7.8%,而价格信号重要性上升 1.1%。这导致需求转向更廉价工人,支持 AI 使这些工人更易被替代的观点。
AI 安全与政策
中国出台新规监管 AI 伴侣服务
中国出台新规限制 AI 伴侣服务,要求提供商遏制操控性依恋、识别过度依赖并提醒用户对话对象为 AI。数据显示每日情感聊天减少对人类支持的 10.3%,新规还禁止向未成年人提供虚拟伴侣或亲属服务。
产品与应用
Claude Code 提示词精简经验:轻量化提示与技能文档
Claude Code 最新模型移除了约 80% 的系统提示,这一更新凸显了编写轻量级提示和技能文档的重要性。此举旨在优化模型行为和效率,减少重复与前置加载,提升上下文利用率。
Elon Musk 演示未来 AI 视频处理技术
Elon Musk 的推文展示了 xAI 在未来视频处理技术方面的进展,通过推特标签解析能力,系统如何识别和处理图像链接和视频链接,预示其在内容理解和生成方向的探索。