Signal Brief

Kimi K3登顶前端代码榜

Moonshot AI发布Kimi K3,2.8万亿参数MoE架构、百万上下文窗口、原生多模态,于Frontend Code Arena以1679分登顶,超越Claude Fable 5与GPT-5.6 Sol,在7个前端细分赛道拿下6个第一;模型将于7月27日开放权重,API定价输入每百万toke...

twitter关注列表 AYi (@AYi_AInotes) 发布 2026-07-17 收录 2026-07-17 值得跟进

一句话判断

首个定价对标前沿闭源模型的中国开放权重模型,架构针对长上下文智能体编码深度优化,7月27日开放权重后值得接入智能体技术栈验证实战表现。

核心信息

Moonshot AI发布Kimi K3,2.8万亿参数MoE架构、百万上下文窗口、原生多模态,于Frontend Code Arena以1679分登顶,超越Claude Fable 5与GPT-5.6 Sol,在7个前端细分赛道拿下6个第一;模型将于7月27日开放权重,API定价输入每百万tokens 15美元,对标前沿闭源模型价格区间;架构创新包括KDA混合线性注意力使百万token下解码提速6.3倍,AttnRes注意力残差提升训练效率约25%,在Terminal Bench、Automation Bench、BrowseComp等智能体场景领先Fable 5,但在DeepSWE等综合指标上Fable 5更稳。

原始内容

谁能想到Claude和GPT双头统治的时代,居然就这么被中国模型撕开了口子。 Kimi K3登顶Frontend Code Arena总榜第一,1679分同时力压Claude Fable 5与GPT-5.6 Sol。 从上一代第18名直冲榜首,整整跃升17个名次,完成了同级模型里绝无仅有的跨越式爆发。 7个前端细分赛道拿下6个第一,品牌营销参考设计数据分析消费产品模拟工具内容创建全线领跑,仅游戏赛道暂居第二。 这不是刷题库的纸面跑分,是全球开发者匿名盲测投出来的真实战力,代码质量交互体验全维度硬碰硬。 更炸裂的是完整模型权重7月27日前就会开放,顶级前端编码能力直接无差别下放给所有开发者。 当开放权重的中国模型能在核心开发赛道正面打赢闭源顶流,维持多年的双巨头格局是不是真的要改写了。 #KimiK3 #Moonshot #AI大模型 #前端开发 #开源AI https://video.twimg.com/amplify_video/2077980897169600514/vid/avc1/960x960/vj4cm84m1CiLlr9R.mp4?tag=25 > **引用原帖 AYi (@AYi_AInotes):** > Kimi K3 今日正式发布,Moonshot 官方官宣,2.8万亿参数 MoE 架构,百万上下文窗口,原生多模态能力,7月27日开放模型权重。 > 网上已有声音称其在多项基准测试中超越 Fable,翻完官方基准数据图后会发现,这是选择性解读的结论。 > 真实情况是,K3 在 Terminal Bench 2.1 得分88.3对比84.6,Automation Bench 得分30.8对比29.1,BrowseComp 得分91.2对比88.0,这几个特定智能体场景上确实领先。 > 但在 DeepSWE,FrontierSWE,GDPval-AA v2 Elo,AA-Briefcase Elo,CharXiv 这些更综合的智能体指标上,Fable 5 整体表现依然更稳定。 > 它并非实现全面超越,而是在自身定义的长上下文智能体编码赛道上打出了存在感。 > 但基准测试表现并不是这条新闻里最值得关注的部分。 > 最有价值的信息藏在定价策略里。 > K3 的 API 定价为输入每百万 tokens 15美元,这个价格对应的档位,正处于 GPT-5.5 和 Claude Opus 系列的价格区间,这不是开源模型的低价路线,而是前沿闭源模型的定价标准。 > 一款中国开放权重模型,主动放弃了低价这张传统王牌。 > Moonshot 将价格拉至前沿模型区间,等于公开传递出一个信号,我们不比拼性价比高低,我们比拼在长周期智能体编码场景下的价值匹配度。 > 这是第一次出现这样的转向,此前中国模型的主流路线是能力强,价格低,加开源的性价比打法,K2 系列走的正是这条路径。 > K3 切换了一条完全不同的路线。 > 这条路不再是性价比路线,而是场景定价路线,底层逻辑彻底改变,不再是我比 Fable 便宜所以你该选我,而是在长上下文智能体编码这个特定场景下,我的价值值得你支付前沿模型的价格。 > 这个转变不是营销话术的更新,而是将产品信心押注在了一个狭窄但高价值的垂直赛道上。 > 看看他们为这个赛道做的底层布局就知道。 > 两项架构级创新支撑起这个定位,KDA 混合线性注意力,在百万 token 上下文下解码速度最高提升6.3倍,AttnRes 注意力残差,训练效率提升约25%,额外成本不到2%。 > 这两项创新不是为了炫技的纸面突破,每一项都精准命中长上下文智能体的核心痛点,Transformer 架构在百万 token 下推理太慢,训练成本太高,KDA 解决推理速度问题,AttnRes 解决训练效率问题,合在一起解决的核心问题是,让一个2.8T参数的模型,在需要长时间记忆和多步迭代的智能体工作流里,能稳定运行,跑得够快,成本可控。 > 这就是他们敢把定价拉到前沿区间的核心底气。 > 不是参数规模更大所以更值钱,而是在长上下文智能体编码这个即将成为主战场的赛道上,他们的架构为场景量身定制,通用架构做不到同等效率。 > 这个赌注自然存在风险。 > Fable 5 在很多通用智能体任务上表现依然更稳,K3 的优势集中在自身定义的赛道范围内,如果市场不为专门为智能体编码优化的模型品类买单,每百万输出15美元的价格很难长期站稳。 > 但这个方向的判断是对的。 > 中国 AI 这些年一直在走同一条路径,硬件受限倒逼架构创新,快速开源用开放生态反哺迭代,K2 系列验证了这条路能够跑通,K3 则把这个模式做了升级,不只是在受限硬件上做出好模型,更是做出好模型之后,敢于在定价上和前沿闭源模型站在同一起跑线。 > 这对正在搭建智能体系统的开发者来说,信号非常实际。 > 7月27日权重开放后,你能拿到一个真正前沿规模,为长时程智能体场景定制的基座模型,百万上下文加 KDA 加速加持,SWE Marathon 42.0 领先,Automation Bench 30.8 领先,把它接入自己的智能体技术栈运行自进化工作流,做长上下文蒸馏,完成复杂认知任务的结构化输出,这些事以前要么用闭源 API 成本太高,要么用开源模型上下文长度和速度跟不上。 > K3 是第一个同时提供前沿智能体编码能力,百万上下文,开放权重,可商用的选项。 > 最后做一个总结。 > Moonshot 将 K3 的定价拉至前沿区间,不是一个简单的价格决策,而是一份明确的定位声明,中国开放权重模型不再只是高性价比的替代品,它们开始要求在自己擅长的赛道上,和闭源前沿模型平起平坐。 > 这个诉求能不能被市场接受,要看7月27日权重开放后的实际落地表现。 > 但有一点已经非常清晰,在长周期智能体编码这条赛道上,有一家中国公司认为自己的产品,不再需要靠低价来获取市场。 > https://x.com/AYi_AInotes/status/2077966965029630366

相关动态

01

Mind Lab 开源长文本强化学习项目

Mind Lab 开源了一个长文本强化学习(RL)项目,支持 2M tokens 的长上下文。相比以往需要数千个 GPU 的 1M 上下文研究,该项目仅需 8 个 GPU 即可完成,大幅降低了超长上下文研究的算力门槛。

twitter关注列表2026-07-17#开源#技术突破#模型
观察
02

BestBlogs 早报 · 07-18

月之暗面发布Kimi K3,2.8万亿参数,896选16的Stable LatentMoE,上下文100万token,接近Fable-5但仍落后最强闭源模型,完整权重7月27日前开源;VentureBeat调查显示54%企业已发生AI代理安全事件;xAI开源Grok Build(84万行Rust代码)并残留上传用户代码痕迹;Cursor评...

twitter关注列表2026-07-17#AI#模型发布#开源
观察
04

Astribot发布Lumo-2

Astribot发布了40亿参数的Lumo-2机器人基础模型,推理速度比前代快2.71倍,支持人类视频和多机器人身体。该模型在105个未见物体上取得更好结果,并在22项涵盖 motion prediction、memory、physical reasoning、long tasks、fine hand control的真实操作任务中表现最...

twitter关注列表2026-07-17#技术#模型发布#AI
观察
05

杨植麟在 GTC 2026 演讲:如何扩展 Kimi K2.5

月之暗面在 GTC 2026 宣布开源三个替代 Transformer 基础组件:MuonClip 优化器(数据效率接近翻倍)、Kimi Linear 线性注意力(3:1 混合全注意力,首个全面超越全注意力的架构)、Attention Residue 残差连接(提升 24% Token 效率)。同时披露 Agent Swarm 支持 10...

twitter关注列表2026-07-17#技术突破#模型发布#开源
观察