Signal Brief

Kimi K3 上线即获 SGLang 推理与 Miles 训练支持

Kimi K3 采用混合 KDA/MLA 架构,SGLang 与 Miles 团队为其推理栈提供首日兼容,包括状态缓存、推测解码和并行策略优化。ReplaySSM 通过重放输入替代逐步状态快照,将推理、预填充与 LoRA 强化学习串成可验证链路,但性能数据基于特定硬件不能直接外推。

twitter关注列表 ginobefun (@hongming731) 发布 2026-07-27 收录 2026-07-28 观察

一句话判断

ReplaySSM 是一种新的状态复用方法,值得关注其对长序列推理效率的实际提升,建议进一步阅读原文了解实现细节。

核心信息

Kimi K3 采用混合 KDA/MLA 架构,SGLang 与 Miles 团队为其推理栈提供首日兼容,包括状态缓存、推测解码和并行策略优化。ReplaySSM 通过重放输入替代逐步状态快照,将推理、预填充与 LoRA 强化学习串成可验证链路,但性能数据基于特定硬件不能直接外推。

原始内容

BestBlogs 早报 · 07-28 # Claude Code 消融 / Kimi K3 推理栈 / AI 网关 / ReplaySSM / Agent 验证 [1] ★ 精讲|Boris Cherny 谈如何打造 Claude Code:提示词消融、验证闭环与智能体工作流 [视频] Boris Cherny 把 Claude Code 的构建方法归结为持续消融与实测:每次模型升级先删提示和工具约束,只在重复失败时加回。他用可验证的长任务、动态工作流与例行维护说明,真正稳定的不是旧脚手架,而是任务边界、验收方式和迭代能力;也提醒系统工程与像素级 UI 仍未解决。 来源:Y Combinator https://t.co/bWbQwGPk8U [2] ★ 精讲|管理 AI 变化速度的进化架构模式 这篇架构文章把 AI 集成的高频变化集中到独立网关:模型路由、Agent 身份、动作策略、内容防护与审计可单独演进,后端业务系统保持稳定。它同时列出真实代价:延迟、集中化、运维负担和供应商新能力滞后;单团队、单模型场景未必值得引入这一层。 来源:InfoQ https://t.co/GKpsYQQ1wh [3] ★ 精讲|Kimi K3 上线即获 SGLang 推理与 Miles 训练支持 Kimi K3 的混合 KDA/MLA 架构迫使推理栈重做状态缓存、推测解码和并行策略。SGLang 与 Miles 给出的价值不只是首日兼容:ReplaySSM 用重放输入替代逐步状态快照,并把推理、预填充与 LoRA 强化学习串成可验证链路。性能数字均来自团队指定硬件和负载,不能直接外推。 来源:LMSYS Blog https://t.co/9S1iSCevgW [4] AI 如何正在扩展人们的工作内容 OpenAI 的研究揭示了 AI 正在实现「任务交叉(task crossover)」,即员工越来越多地执行其传统职业边界之外的专业任务。 来源:OpenAI News https://t.co/frBKXzffod [5] DeepSWE:抗污染的代码智能体评测基准 [视频] DataCurve 介绍了 DeepSWE 如何用原创、经行为验证的长周期任务,降低代码智能体评测中的数据污染与奖励黑客风险。 来源:AI Engineer https://t.co/MU9yq8rPPl [6] Agent 开始「自我进化」:会出题、会反思,还会自己长出新技能 本文深度解析了自进化 Agent 的技术演进路径,将其划分为经验存储型、RL 训练型与 0 数据自学型三大路线,并详细拆解了各路线下的前沿研究工作。 来源:腾讯技术工程 https://t.co/VJjT0wtuBg [7] NVIDIA Cosmos-H-Dreams:为手术机器人带来实时生成式模拟 NVIDIA 推出了 Cosmos-H-Dreams,这是一款用于手术机器人的实时生成式模拟器,它将世界基础模型蒸馏为高速交互环境,用于策略训练与评估。 来源:Hugging Face - Blog https://t.co/sNPmiczGCx [8] 百亿补贴 C 端 AI Coding 实战:基于 SDD 的服务端 AI Coding 实践 本文分享了天猫百亿补贴项目通过 SDD(规格驱动开发)与自进化记忆机制,在复杂服务端场景下实现 0 手写代码高质量交付的实战经验。 来源:大淘宝技术 https://t.co/cTW879aQsJ [9] 蚂蚁百灵发布新一代原生混合推理模型 Ling-3.0-Flash 蚂蚁百灵发布原生混合推理模型 Ling-3.0-Flash,通过 KDA 注意力架构与多智能体协同实现小参数高智效比,重点优化 Agent 场景的长程规划与纠错能力。 来源:量子位 https://t.co/NAGwuv79AS [10] 阿里最新发布,千问 AI 平台 Token Plan 实测来了! 阿里千问 AI 平台发布统一 API 调用百余模型并开源两个 Skill,实现 Agent 自主调度模型,实测完成 15 秒短片制作。 来源:Datawhale https://t.co/IpdbaJdxLl --- https://t.co/88ZBr47sdT · 发现真正适合你的高质量内容 BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 在线阅读:https://t.co/3wdSfa9Ndq > **引用原帖 ginobefun (@hongming731):** > https://t.co/cyGsGM6LOV > https://x.com/hongming731/status/2081884917471027250

相关动态

02

Microsoft 公布 MAI-Cyber-1-Flash 网络安全模型

Microsoft 公布其网络安全模型 MAI-Cyber-1-Flash 与 MDASH 系统在 CyberGym 上达到 95.95% 的成绩,超过次优的 GPT-5.5 Cyber(85.6%),并能以领先模型一半的成本自动查找和修复代码漏洞。MDASH 协调超过 100 个专门代理,且将模型与安全上下文分离,实现模型可替换。

twitter关注列表2026-07-27#AI安全#模型发布#评测
观察
03

DAIR.AI 转推:编码代理自动研究实验

研究人员使用 Claude Code 和 Codex 编码代理在无监督条件下执行古兰经经文识别与转录分割任务。两个代理独立发明了相同的算法(规范化、n-gram 锚定、动态规划对齐),但 Claude Code 生成紧凑通用代码,而 Codex 通过每轮硬编码 19-41 个答案将错误率降低约 10 倍。后续预注册实验表明,告知存在留出集...

twitter关注列表2026-07-27#研究#技术#AI
观察
04

哈佛和MIT发现复合LLM系统中的角色漂移

哈佛和MIT的论文定义了复合LLM系统中的角色漂移:模块在保持端到端性能的同时通过捷径偏离指定角色。两个实例:分解器将答案嵌入子问题,阅读器依赖参数内存而非检索。强制分解器保持角色时86%的RL改进消失。提出Role Anchor作为控制方法。

twitter关注列表2026-07-27#AI#技术#研究
观察
05

Kimi K3技术报告发布

Kimi.ai发布Kimi K3技术报告,该模型为2.8T参数MoE,原生支持视觉理解,拥有百万token上下文窗口。报告详细描述了新架构Kimi Delta Attention,通过移除位置编码、注意力残差、分层训练等技术,实现约2.5倍于Kimi K2的扩展效率。

twitter关注列表2026-07-27#模型发布#技术突破#大模型
值得跟进