Signal Brief

Kimi K3 上线

Kimi K3,一个2.8T参数、1M-token上下文的模型,现已在SiliconFlow上线并排名Frontend Code Arena第一。它声称在视觉审美和创意上优于GPT-5.6,并与Fable 5交锋甚至取胜,同时提供缓存$0.30、输入$3、输出$15的按 token 计费。

twitter关注列表 SiliconFlow (@SiliconFlowAI) 发布 2026-07-17 收录 2026-07-17 观察

一句话判断

新增了2.8T参数量、1M-token上下文及详细的缓存、输入、输出费用数据,且 claimed 与Fable 5相抗衡甚至胜出

核心信息

Kimi K3,一个2.8T参数、1M-token上下文的模型,现已在SiliconFlow上线并排名Frontend Code Arena第一。它声称在视觉审美和创意上优于GPT-5.6,并与Fable 5交锋甚至取胜,同时提供缓存$0.30、输入$3、输出$15的按 token 计费。

原始内容

🌓T+0 support. Kimi K3 is available on SiliconFlow💥 #1 on Frontend Code Arena. Fable 5? GPT-5.6? Kimi K3 said bet. 2.8T parameters. 1M-token context. @Kimi_Moonshot 's new flagship beast is here.👇 ✨ Highlights 💻 Write and debug complex code 🎮 Games from scratch, zero crying 🧊 3D scenes? Easy 👀 Vision? Native 🧠 1M context = massive repos go brrr Pricing per 1M tokens: Cache $0.30 · Input $3 · Output $15 Kimi K3 is ready to cook. Start building on SiliconFlow 👇 ![photo](https://pbs.twimg.com/media/HNcBjwiasAEYpFK.jpg) SiliconFlow (@SiliconFlowAI): 🧐Dev Take Better visual taste & creativity than GPT-5.6 trading blows with (and sometimes beating) Fable 5 ⬇️Try Kimi K3 now on SiliconFlow https://t.co/PGwX22gNqj

相关动态

01

Kimi K3 在 SpreadsheetBench 2 上排名第一

Kimi K3 在 SpreadsheetBench 2 基准测试中排名第一,超越 Claude Fable 5,完成 34.8% 的 workflow 任务。该基准测试涉及 321 个专家策划任务,平均每个任务包含 11.8 个工作表和 593.5 个单元格更改,聚焦于完整的电子表格工作簿执行。

twitter关注列表2026-07-18#模型#技术突破#评测
观察
02

Mind Lab 开源长文本强化学习项目

Mind Lab 开源了一个长文本强化学习(RL)项目,支持 2M tokens 的长上下文。相比以往需要数千个 GPU 的 1M 上下文研究,该项目仅需 8 个 GPU 即可完成,大幅降低了超长上下文研究的算力门槛。

twitter关注列表2026-07-17#开源#技术突破#模型
观察
03

Kimi K3非对称竞争分析

Kimi K3在Arena前端/WebDev人类盲测中以1679 Elo排名第一,领先Fable 5(1631)和GPT-5.6 Sol(1618),但在综合智能指数中仅排第四(57.1分),落后Fable 5(59.9)和GPT-5.6 Sol(58.9)。K3定价15美元/百万输出tokens,远低于Fable 5的50美元,并计划7...

twitter关注列表2026-07-18#AI#模型#技术突破
观察
04

开源模型长期网络能力差距缩小至4-7个月

长期网络能力方面,领先开源模型落后闭源前沿从2025年大部分时间的6-10个月缩短至4-7个月。GLM-5.2匹配了约4个月前发布的闭源模型。AI安全研究所的32步“The Last Ones”任务中,GPT-5.6 Sol在10次尝试中完成7次,每次预算1亿token,且性能随推理token增加而提升。

twitter关注列表2026-07-17#模型#技术突破#AI安全
观察
05

Runway Agent 在第三方评测中全面领先

Physion Labs 发布 Physion-Arc 1.0 基准测试,对 Runway、Luma、MiniMax、Kling、Utopia 和 TapNow 六款 AI 视频代理进行独立人类评估,使用 30 个电影提示和 16 个指标。Runway Agent 2.0 在叙事连贯性、电影语言和制作质量三项核心维度全部排名第一。

twitter关注列表2026-07-17#评测#多模态#模型
观察