Signal Brief

月之暗面300人做出开源大模型K3,引发纳斯达克震荡

文章对比了OpenAI(4500人扩至8000人)与月之暗面(300人、无传统层级)的组织哲学。月之暗面用300人开发出2.8万亿参数的开源模型K3(896专家MoE,每次激活16个,Delta Attention,自研优化器),Arena前端盲测第一,输入$3输出$15。发布后纳斯达克跌1%,同时...

twitter关注列表 AYi (@AYi_AInotes) 发布 2026-07-23 收录 2026-07-23 观察

一句话判断

本文揭示了月之暗面以极小团队和低价开源模型冲击闭源商业模式,值得跟踪其开源权重发布和港股IPO进展。

核心信息

文章对比了OpenAI(4500人扩至8000人)与月之暗面(300人、无传统层级)的组织哲学。月之暗面用300人开发出2.8万亿参数的开源模型K3(896专家MoE,每次激活16个,Delta Attention,自研优化器),Arena前端盲测第一,输入$3输出$15。发布后纳斯达克跌1%,同时月之暗面启动港股IPO筹备。

原始内容

damn,简直就是AI圈最离谱的对比,OpenAI4500员工,年底冲8000人,月之暗面300人就干出了全球最大开源模型。 这条冷知识不是段子,是两家最头部的 AI 公司正用完全相反的组织哲学在跑同一条赛道。 OpenAI 四千五百人,年底要扩到八千,硅谷标准的大厂配置,研究工程产品安全政策销售全线铺开。 Kimi 母公司月之暗面三百人,没有传统部门,没有总监 VP 层级,几乎没有 KPI 和 OKR,联合创始人可以直接跟任何人沟通,平均年龄不到三十岁,刻意控制规模,认为盲目扩人对创新是致命的。 三百人做出了两万八千亿参数的 K3,目前公开最大的开源模型之一,架构是极端稀疏的 MoE,八百九十六个专家每次只激活十六个,用 Delta Attention 混合线性注意力把百万 token 上下文解码速度拉起来,自研优化器比业界标准更省算力,原生多模态加强 agent 能力,用更少的人和更聪明的架构去追前沿。 而 OpenAI 的模型架构基本不公开,研发体系靠的是全球顶尖人才的密度和规模。 这两种路线同时存在于同一个赛道,一个是硅谷式的相信规模堆人堆算力,一个是中国式的精兵路线相信架构创新比堆人更有效。 规模可以复制,架构很难复制,但反过来说,架构的天花板可能来得更早,规模的耐力可能跑得更远。 AI 竞争的本质不是谁的人更多,也不是谁的参数更大,甚至也不是谁暂时的排名更高,本质上是谁能用自己的方式活到终局,而这两种方式正被推到同一个竞技场上接受检验。 > **引用原帖 AYi (@AYi_AInotes):** > Kimi要去香港上市了,一次发布同时完成了三件事:产品更新、市场重定价、IPO 预路演,喵的真是一场伟大的操盘!!! > K3发布前脚刚砸跌纳斯达克1%,然后转头Kimi就启动港股IPO筹备,一场发布干了几个亿路演的活,真特么牛逼,背后有高人哈哈,来一起回顾这场牛逼的操盘吧: > 7 月 17 日凌晨,月之暗面发了 Kimi K3,2.8 万亿参数,Arena 前端代码排名第一,即将开源。 > 然后 24 小时内发生了两件事, > 第一件,华尔街半导体股开盘重挫,纳斯达克跌了 1%,标普 500 跌了 1%,CNN 和彭博社的报道标题里,中国 AI 模型冲击美股是关键词。 > 第二件,《投资界》报道说 Kimi 已通知投资者调整公司架构,筹备赴港 IPO,最快 6 个月内完成港股上市。 > 别人的股价在跌,自己的股价准备开始。 > 这两件事放在一起,是不是比 2.8 万亿参数精彩多了, > 一个中国开源模型的 Arena 排名,能直接变成纳斯达克 1% 的跌幅,不是因为 K3 全面超越了谁,它在综合智能指数上排第四,Fable 5 在 35 项评估里赢了 22 项,并不是新王者。 > 那华尔街在怕什么呢? > 我觉得怕的不是这个模型本身,他们怕的其实是前沿能力 + 开放权重 + 中国公司这个组合,对闭源 AI 万亿美元资本支出的那个底层假设,突然给了一个反面例证。 > 那个假设很简单:最先进的 AI 能力是稀缺的,稀缺就应该贵,贵就需要巨额资本支出,巨额资本支出会带来长期的定价权。 > K3 在这个假设上钻了一个空子, > Arena 前端人类盲测第一,输入 $3,输出 $15,Fable 5 的输出是 $50,权重 7 月 27 日开放,之后任何人可以自己部署、微调、塞进私有工作流。 > 如果,注意是如果啊兄弟们,$15 的输出价格就能拿到人类盲测投票第一的前端 coding 能力,而且权重马上开源,那花几千亿美元训练闭源模型、然后收 $50 输出费用的商业模式,是在修一条收费高速公路,还是在一座即将免费的桥旁边建收费站。 > 华尔街的反应不是说这个模型太强了,是担心这个定价让整个投资回报率的算术变得不好看了。 > 这是第一层,第二层更有意思, > Kimi 通知投资者调整架构,启动赴港 IPO,从短期不着急上市到筹备港股上市,不到一年。 > 这个时间窗口的选择显然不是偶然, > Arena 前端第一 + 华尔街震动 + CNN/彭博头版,这套组合给了 Moonshot 一个全球定价时刻,在它走向公开市场之前,让全世界的投资者都知道了它的名字,而且不是在中国 AI 追赶者的叙事里,是在能让纳斯达克跌 1% 的叙事里。 > IPO 需要的是一个让承销商可以讲的故事,K3 在 24 小时内把这个故事递到了全球财经媒体的头版上。 > 别人花几个亿做路演,Moonshot 用一次模型发布就做到了。 > 以前 AI 模型发布的受众是开发者和从业者,现在它的受众包括华尔街交易员、半导体分析师和港股承销商。 > AI 模型发布正在从技术事件变成宏观事件。 > 这个转变一旦成立,以后每一家前沿 AI 公司的新模型发布,都不会只是开发者社区的节日,它会像上市公司的财报,不只是我们做到了什么,更是这个做到的事,让谁的假设失效了。 > K3 不是第一个触发这个转变的模型,但它是第一个让发布即冲击这个范式变得如此清晰可见的。 > 一个中国公司,把开源模型的 Arena 排名推到前端第一,然后让大洋彼岸的半导体股跌了 1%,再趁势启动自己的 IPO 筹备,感觉有点像在上演一场关于定价权的公开争夺🤔。。。。 > 而争夺定价权最好的方式通常不是发论文,最好的方式就是让你的产品发布,直接变成别人股价的变量。 > https://x.com/AYi_AInotes/status/2078414146941440128

相关动态

03

Offloop 发布多智能体调度框架 D1

Offloop 发布了多智能体框架 D1,通过小型调度模型控制 Agent 动作、停止时机及人工介入。在基准测试中,D1 在 GDPval 表现优于 Claude Code 和 Codex,并在处理任务遇到瓶颈时能自动升级至人工处理。

twitter关注列表2026-07-23#技术#产品发布#大模型
观察
05

京东开源 JoyAI-VL-Interaction 实时视频交互模型

京东开源了 8B 参数的 JoyAI-VL-Interaction 模型,专为实时视觉驱动交互设计。在 26 个视频理解基准上平均得分 57.53,超过 Qwen3-VL-8B-Instruct 3.37 分。模型每秒处理直播视频并决定是否发言或保持沉默,交互时序通过时间对齐数据和强化学习学习,无需外部检测器。开源内容包括训练配方、数据和...

twitter关注列表2026-07-23#模型发布#技术突破#开源
观察