Signal Brief

Kimi K3非对称竞争分析

Kimi K3在Arena前端/WebDev人类盲测中以1679 Elo排名第一,领先Fable 5(1631)和GPT-5.6 Sol(1618),但在综合智能指数中仅排第四(57.1分),落后Fable 5(59.9)和GPT-5.6 Sol(58.9)。K3定价15美元/百万输出tokens,...

twitter关注列表 AYi (@AYi_AInotes) 发布 2026-07-18 收录 2026-07-18 观察

一句话判断

本文揭示了K3在前端盲测中的领先地位及非对称竞争策略,并提供了定价和开源时间点,值得关注7月27日开源后的社区独立评测。

核心信息

Kimi K3在Arena前端/WebDev人类盲测中以1679 Elo排名第一,领先Fable 5(1631)和GPT-5.6 Sol(1618),但在综合智能指数中仅排第四(57.1分),落后Fable 5(59.9)和GPT-5.6 Sol(58.9)。K3定价15美元/百万输出tokens,远低于Fable 5的50美元,并计划7月27日开源权重。文章指出K3采取非对称竞争策略,集中火力在前端、终端代理等狭窄赛道,而非追求全面超越。

原始内容

感觉全网都在吹 Kimi K3 新王登基,我研究了一上午发现吹的方向全错了, 我来给大家关于Kimi K3最客观全面深度的一个分析总结: Kimi K3 发布这两天铺天盖地的都在比它和 Fable 5 谁更强,什么牛逼新王之类的, 我就纳闷了,这有啥可比的,你们真相信刷分排行榜代表真实能力吗?上一个例子是千问,每次发布找英推的一堆博主吹,结果实战能力拉胯,连豆包都不如🤣 来我们看看这次Kimi和Fable 5 比出来的结果是:35 项共享评估,Fable 5 赢 22 项,K3 赢 12 项,综合智能指数,K3 第 4,Fable 5 第 1。 结论很清楚——它根本不是全能新王者啊😂 但更重要的东西不在这个比分里,在另一个数字里, Arena 前端/WebDev 人类盲测投票,K3 第 1。1679 Elo,领先 Fable 5 的 1631,领先 GPT-5.6 Sol 的 1618,7 个领域里赢了 6 个,从 K2.6 的第 18 名跳上来的。 人类盲测是什么意思?意思是开发者坐在屏幕前,看着两个页面,不知道谁生成的,然后选了 K3 的那个更好看、更好用。 这就不是刷榜了,属于真人在真实任务里投出来的。 然后你看定价,15 输出。Fable 5 是 50。 长上下文 agentic coding 是高输出量的任务,15 刚好跨过那条线。 说白了,K3 在干的事,不是“比 Fable 5 更全能”。 是在前端和终端代理这块地上,我打到世界级 在别的地方,我接受落后, 这其实是换了个游戏玩法呀, 以前追赶的定义是“在综合 benchmark 上逼近 SOTA”, K3 直接不玩这个游戏了,它选了三块地——前端 UI、终端代理、浏览代理——然后把火力全压上去,结果就是在这些地上,它要求 Fable 5 来追自己。 这算什么兄弟们,这不就是非对称竞争吗?🤣 在综合战场上接受落后,在自己选定的高价值赛道上要求对方追赶,我觉得这才是 K3 真正值得看的地方。 不要再说中国模型终于追上了,本质上是“追赶的定义被改了”。 还有一个容易被忽略的信号,Arena 前端从 K2.6 的第 18 跳到第 1,这个跃迁比分数本身更有冲击力, 它会让前端开发者、全栈 freelancer、Web agency 主动去试,不是因为 Moonshot 说它强——是因为人类同行投票说它生成的页面更好看。 开发者选型时最信任的信号,就是这个。 当然现在就把Kimi3叫王者其实有点为时过早,甚至是愚蠢的, 因为综合能力上 Fable 5 整体依然更稳,深度推理、视觉 polish、最难的那类知识工作任务,K3 还有差距。 速度一般,token 消耗高,早期版本有边缘 bug。数据隐私条款也需要注意——官方说输入可能用于训练。 但这些问题,不影响它做对了一件事,它找到了一个可以称王的狭窄赛道,然后用人类盲测第一 + 价格剪刀差 + 即将开源这三个东西,同时证明了自己在这个赛道上值得认真对待。 等到7 月 27 日权重开放之后,社区会做三件 Moonshot 控制不了的事:独立评测、奇怪任务的 fine-tune、本地长上下文吞吐实测, 这些结果会迅速区分是营销号吹的好和真做的好, 但那之前,有一件事已经清楚了,Kimi K3 不是来当全能冠军的,它是来证明一件事, 以后的 AI 竞争,不需要在每一个维度上都赢,只需要在自己选的地方赢就够了, 别的地方,落后是可以接受的,这个信号其实比 2.8 万亿参数更值得认真看对吧? ![photo](https://pbs.twimg.com/media/HNe26vbWEAA6Tz6.jpg) > **引用原帖 AYi (@AYi_AInotes):** > 谁能想到Claude和GPT双头统治的时代,居然就这么被中国模型撕开了口子。 > Kimi K3登顶Frontend Code Arena总榜第一,1679分同时力压Claude Fable 5与GPT-5.6 Sol。 > 从上一代第18名直冲榜首,整整跃升17个名次,完成了同级模型里绝无仅有的跨越式爆发。 > 7个前端细分赛道拿下6个第一,品牌营销参考设计数据分析消费产品模拟工具内容创建全线领跑,仅游戏赛道暂居第二。 > 这不是刷题库的纸面跑分,是全球开发者匿名盲测投出来的真实战力,代码质量交互体验全维度硬碰硬。 > 更炸裂的是完整模型权重7月27日前就会开放,顶级前端编码能力直接无差别下放给所有开发者。 > 当开放权重的中国模型能在核心开发赛道正面打赢闭源顶流,维持多年的双巨头格局是不是真的要改写了。 > #KimiK3 #Moonshot #AI大模型 #前端开发 #开源AI > https://x.com/AYi_AInotes/status/2077981025905316253 AYi (@AYi_AInotes): 客观对比数据:35 项共享评估,Fable 5 胜 22,K3 胜 12,1 平。综合智能指数:Fable 5 约 59.9,GPT-5.6 Sol 约 58.9,K3 57.1,Claude Opus 4.8 约 55.7。 K3 在 Terminal-Bench 2.1 上 88.3 领先 Fable 5 的 84.6,BrowseComp 91.2 领先,但 DeepSWE 67.5 落后 Fable 5 的 70.0,FrontierSWE 81.2 落后 86.6。 它在“可执行的工程/代理任务”上有优势,在知识广度和最难推理任务上还有差距。 最后总结,现在说它全面超越就是营销,说它只是刷分也不完全对,Arena 人类盲测和独立指数会提供更扎实的交叉验证结果

相关动态

02

Kimi K3 在 SpreadsheetBench 2 上排名第一

Kimi K3 在 SpreadsheetBench 2 基准测试中排名第一,超越 Claude Fable 5,完成 34.8% 的 workflow 任务。该基准测试涉及 321 个专家策划任务,平均每个任务包含 11.8 个工作表和 593.5 个单元格更改,聚焦于完整的电子表格工作簿执行。

twitter关注列表2026-07-18#模型#技术突破#评测
观察
03

Mind Lab 开源长文本强化学习项目

Mind Lab 开源了一个长文本强化学习(RL)项目,支持 2M tokens 的长上下文。相比以往需要数千个 GPU 的 1M 上下文研究,该项目仅需 8 个 GPU 即可完成,大幅降低了超长上下文研究的算力门槛。

twitter关注列表2026-07-17#开源#技术突破#模型
观察
04

二年级学生Jo Nagai发现蝴蝶可遗传记忆

日本东京都二年级学生Jo Nagai注意到养育的食蚜 caterpillars 在蝴蝶化后仍保持对薰衣草的回避行为,经Georgetown大学Entomologist Dr. Martha Weiss合作完成实验:70%训练过的蝴蝶及其后代均表现出对薰衣草的遗传性回避,记忆在全变态发育中保存并遗传。

twitter关注列表2026-07-18#研究#技术突破#信息
值得跟进
05

AI 代码生成大势所趋

Greg Isenberg 发文指出,相比一年前的手写代码实践,如今大多数工程代码已由 AI 生成,标志着编程范式的根本转变。他援引了 Google 75% 新代码由 AI 生成、Anthropic 90%+ 代码由 Claude 编写、GitClear 代码重复率上升 81% 复用率下降 70% 等具体数据,并引用 Dario Amod...

twitter关注列表2026-07-18#技术突破#行业动态#分析
观察