Signal Brief

美国团队发布 Inkling 大模型

美国团队 Thinking Machines 发布了 Inkling,这是一款采用 975B/A41B MoE 架构的多模态大模型,已开源完整参数。基准测试中 Inkling 在 IFBench(79.8% vs Claude 63.5%)和 FORTRESS Benign(95.9% vs Cla...

twitter关注列表 meng shao (@shao__meng) 发布 2026-07-16 收录 2026-07-16 观察

一句话判断

原文提供详细的横向对比数据和完整基准结果,建议阅读了解 Inkling 的相对优势。

核心信息

美国团队 Thinking Machines 发布了 Inkling,这是一款采用 975B/A41B MoE 架构的多模态大模型,已开源完整参数。基准测试中 Inkling 在 IFBench(79.8% vs Claude 63.5%)和 FORTRESS Benign(95.9% vs Claude 55.1%)上超越部分闭源模型;在 SWEBench Verified 等测试中则优于 Nemotron 3 Ultra、Kimi K2.5,但整体仍逊色于 GLM 5.2。

原始内容

美国开源模型 +1 来自 Thinking Machines (OpenAI 前 CTO @miramurati 的团队) 开源发布多模态模型 Inkling,975B/A41B MoE 架构 https://t.co/BvBUZVTNVC 在开源模型中的位置 · 强于 Nemotron 3 Ultra、Kimi K2.5 · 与 Kimi K2.6 / DeepSeek V4 Pro 互有胜负:Inkling 在 IFBench、FORTRESS、SWEBench Verified 略胜;在 HLE、SimpleQA、Terminal Bench 略输 · 整体略弱于 GLM 5.2:GLM 5.2 在 HLE、AIME、SWEBench Pro、Terminal Bench、MCP Atlas、Tau 3 都更强,是当前开源组的"事实王者" 与闭源模型的差距 · 在 agentic coding / 综合推理 / 事实性 上,Claude Fable 5 和 GPT 5.6 Sol 明显领先一代(SWEBench Verified 95% vs 77.6%,HLE-with-tools 64.5% vs 46%,SimpleQA 71.6% vs 43.9%) · 在 指令遵循 + 不过度拒绝 上,Inkling 反超部分闭源(IFBench 79.8% > Claude 63.5%;FORTRESS Benign 95.9% >> Claude 55.1%) ![photo](https://pbs.twimg.com/media/HNUL_uuaEAAaMHw.jpg) > **引用原帖 Thinking Machines (@thinkymachines):** > Today, we are introducing Inkling. > Inkling reasons efficiently across text, image, and audio modalities. We are making the full weights available. > https://t.co/Ghebq5mG30 > Available today for fine-tuning on Tinker. Play with it in the Inkling Playground. 🧵 > https://x.com/thinkymachines/status/2077454609551921208

相关动态

01

Kimi K3 在 SpreadsheetBench 2 上排名第一

Kimi K3 在 SpreadsheetBench 2 基准测试中排名第一,超越 Claude Fable 5,完成 34.8% 的 workflow 任务。该基准测试涉及 321 个专家策划任务,平均每个任务包含 11.8 个工作表和 593.5 个单元格更改,聚焦于完整的电子表格工作簿执行。

twitter关注列表2026-07-18#模型#技术突破#评测
观察
02

Mind Lab 开源长文本强化学习项目

Mind Lab 开源了一个长文本强化学习(RL)项目,支持 2M tokens 的长上下文。相比以往需要数千个 GPU 的 1M 上下文研究,该项目仅需 8 个 GPU 即可完成,大幅降低了超长上下文研究的算力门槛。

twitter关注列表2026-07-17#开源#技术突破#模型
观察
03

BestBlogs 早报 · 07-18

月之暗面发布Kimi K3,2.8万亿参数,896选16的Stable LatentMoE,上下文100万token,接近Fable-5但仍落后最强闭源模型,完整权重7月27日前开源;VentureBeat调查显示54%企业已发生AI代理安全事件;xAI开源Grok Build(84万行Rust代码)并残留上传用户代码痕迹;Cursor评...

twitter关注列表2026-07-17#AI#模型发布#开源
观察
04

Kimi K3 编码代理评测

Artificial Analysis发布Kimi K3在编码代理指数上的评测结果:得分57,排名第5,性能与GPT-5.6 Terra和GPT-5.5持平(57),超过Opus 4.8(55),略低于Grok 4.5(58)和Fable 5(59);成本平均3.18美元/任务,比GPT-5.6 Sol便宜55%。

twitter关注列表2026-07-17#AI模型#评测
观察