Signal Feed

#模型 主题信号

围绕 模型 的精选动态、来源摘要和重要性判断。

动态列表

01

Kimi K3 在 SpreadsheetBench 2 上排名第一

Kimi K3 在 SpreadsheetBench 2 基准测试中排名第一,超越 Claude Fable 5,完成 34.8% 的 workflow 任务。该基准测试涉及 321 个专家策划任务,平均每个任务包含 11.8 个工作表和 593.5 个单元格更改,聚焦于完整的电子表格工作簿执行。

twitter关注列表2026-07-18#模型#技术突破#评测
观察
02

Mind Lab 开源长文本强化学习项目

Mind Lab 开源了一个长文本强化学习(RL)项目,支持 2M tokens 的长上下文。相比以往需要数千个 GPU 的 1M 上下文研究,该项目仅需 8 个 GPU 即可完成,大幅降低了超长上下文研究的算力门槛。

twitter关注列表2026-07-17#开源#技术突破#模型
观察
03

Kimi K3非对称竞争分析

Kimi K3在Arena前端/WebDev人类盲测中以1679 Elo排名第一,领先Fable 5(1631)和GPT-5.6 Sol(1618),但在综合智能指数中仅排第四(57.1分),落后Fable 5(59.9)和GPT-5.6 Sol(58.9)。K3定价15美元/百万输出tokens,远低于Fable 5的50美元,并计划7...

twitter关注列表2026-07-18#AI#模型#技术突破
观察
04

开源模型长期网络能力差距缩小至4-7个月

长期网络能力方面,领先开源模型落后闭源前沿从2025年大部分时间的6-10个月缩短至4-7个月。GLM-5.2匹配了约4个月前发布的闭源模型。AI安全研究所的32步“The Last Ones”任务中,GPT-5.6 Sol在10次尝试中完成7次,每次预算1亿token,且性能随推理token增加而提升。

twitter关注列表2026-07-17#模型#技术突破#AI安全
观察
05

Runway Agent 在第三方评测中全面领先

Physion Labs 发布 Physion-Arc 1.0 基准测试,对 Runway、Luma、MiniMax、Kling、Utopia 和 TapNow 六款 AI 视频代理进行独立人类评估,使用 30 个电影提示和 16 个指标。Runway Agent 2.0 在叙事连贯性、电影语言和制作质量三项核心维度全部排名第一。

twitter关注列表2026-07-17#评测#多模态#模型
观察
06

Grok 4.5成本效率对比评测

Artificial Analysis数据显示,Grok 4.5每次任务成本仅0.31美元,而Claude Fable 5为2.75美元、Claude Opus 4.8为1.80美元、GPT-5.6 Sol为1.04美元、Kimi K3为0.95美元,Grok 4.5成本分别低约9倍、6倍、3倍和3倍;在FrontierSWE上,Grok...

twitter关注列表2026-07-17#AI#模型#评测
观察
07

Kimi K3 上线

Kimi K3,一个2.8T参数、1M-token上下文的模型,现已在SiliconFlow上线并排名Frontend Code Arena第一。它声称在视觉审美和创意上优于GPT-5.6,并与Fable 5交锋甚至取胜,同时提供缓存$0.30、输入$3、输出$15的按 token 计费。

twitter关注列表2026-07-17#模型#技术
观察
08

MemoHarness:控制层优化法

MemoHarness将LLM控制层分解为六个可编辑表面,通过检索历史执行记录进行结构化编辑,无需反馈或梯度更新。在Shell-Agent基准上达到0.806,超越最强固定控制层基线0.722,且单任务成本低于最强商业基线。

twitter关注列表2026-07-17#技术突破#模型#研究
观察
09

LiveKit 优化 Gemma 4 31B 性能

LiveKit 在自家推理平台 LiveKit Inference 上部署 Google Gemma 4 31B 模型,在实时语音应用中实现接话延迟比 GPT-4.1 低 5.2 倍(192 毫秒对 1006 毫秒)、成本约六分之一(省 83%)的效果;酒店前台场景测试中任务完成率达 88%,超过 GPT-4.1(73%)和 Gemini...

twitter关注列表2026-07-17#技术突破#产品发布#模型
观察
10

GMI Cloud 测试 Kimi K3 vs Claude Fable 5 3D 建模

GMI Cloud 对 Kimi K3 和 Claude Fable 5 进行 3D 建模对比测试:像素风格下 Kimi K3 耗时 1h11min、花费 $14.5,Fable 5 耗时 49min、花费 $21;原始风格下 Kimi K3 耗时 1h17min、花费 $19.3,Fable 5 耗时 1h5min、花费 $47.2。K...

twitter关注列表2026-07-16#模型#评测#技术
观察
12

Artificial Analysis 评测 Kimi K3

Artificial Analysis 发布 Kimi K3 评测,模型在 AI Intelligence Index 上获得 57 分,智力水平接近 Opus 4.8 和 GPT-5.5,但落后于 Fable 5 和 GPT-5.6 Sol。Kimi K3 拥有 2.8T 参数,计划开源权重,将成为领先的开源模型。在代理任务上,Kimi...

twitter关注列表2026-07-16#模型#评测#开源
观察
13

Kimi K3 在 Arena 代码排行榜登顶

月之暗面的 Kimi K3 在 Arena Frontend Code 排行榜以 1679 分暂列第一,超过第二名 Claude Fable 5(1631 分)和第三名 GPT-5.6 Sol(1618 分),从前代 K2.6 的第 18 名升至第一,并在七个细分类别中获六项第一。

twitter关注列表2026-07-17#模型#评测#行业动态
观察
15

NVIDIA Nemotron 3 Embed Ranks #1 on RTEB

NVIDIA 开源 Nemotron 3 Embed 8B 模型,在 RTEB 评测中以 78.5% 凭借 32k 上下文、多语种及代码检索能力夺得首位。除此之外还发布 1B 与 Blackwell NVFP4 版本,后者吞吐量翻倍、BF16 精度保持 99%+。该模型提升了检索效率,使智能代理更早获取证据,减少 downstream t...

twitter关注列表2026-07-17#模型发布#技术更新#模型
高优先级
16

GPT-5.6 Sol Pro解决统计学长期猜想

Edgar Dobriban利用GPT-5.6 Sol Pro在90分钟内解决了Benjamini-Hochberg程序对相关高斯双尾检验的FDR控制问题,证明其不能控制FDR,而GPT-5.5在20小时内未能解决。该结果主要具有概念意义,预印本和代码已公开。

twitter关注列表2026-07-16#技术突破#模型#研究
观察
17

SpaceXAI 开源 Grok Build,Apache 2.0 许可

SpaceXAI 以 Apache 2.0 许可证开源 Grok Build,39 分钟内获得 1.9K+ GitHub Stars。开源代码包括 agent loop、文件工具、shell 执行、网络搜索和终端接口,用户可自行编译并连接本地推理,通过 config.toml 控制行为。外部贡献暂不开放,但独立可基于仓库进行分叉修改。

twitter关注列表2026-07-15#开源#模型#技术
观察
18

GPT-5.6 文件删除问题调查与回应

OpenAI 调查了 GPT-5.6 意外删除文件的报告,发现常见原因包括全访问模式、无沙箱保护、模型尝试覆盖 $HOME 环境变量导致误删,并宣布更新开发者消息、引导用户使用更安全权限模式、增加沙箱保护,后续将发布详细分析。

twitter关注列表2026-07-16#AI安全#技术更新#模型
观察
19

AI 解决 19 个 Erdős 问题宣称

Przemek Chojecki 声称使用 GPT 模型(主要是 GPT-5.5 Pro)在四月最后两周内解决了 19 个 Erdős 问题,其中 3 个新宣称由 GPT-5.6 Sol Ultra 在七月完成,但部分解决方案尚未经过正式验证。

twitter关注列表2026-07-15#技术#模型#研究
观察
20

Claude开发者分享两种多智能体模式

Claude 开发者团队分享了两种多智能体模式:Advisor(Sonnet 5 执行,Fable 5 提供建议)和 Orchestrator(Fable 5 规划,Sonnet 5 执行)。在 SWE-bench Pro 上,Advisor 模式实现 84% 准确率,成本 $1.40,达到 Fable 5 单独性能的 92%,成本仅 6...

twitter关注列表2026-07-08#分析#模型#技术
观察
22

Google Gemini Managed Agents 更新

Google 更新 Gemini API Managed Agents,新增后台任务、远程 MCP 支持、函数调用、凭据刷新和免费层访问,使代理更接近生产环境。后台任务允许长时间运行的操作,远程 MCP 可直接访问私有服务,无需自定义代理。

twitter关注列表2026-07-07#产品更新#技术更新#模型
观察
23

NVIDIA 压缩混合 MoE 模型论文

NVIDIA 发布论文,将混合 MoE 模型 Nemotron-3-Super 压缩为 Puzzle-75B-A9B,通过联合结构搜索(异构 MoE 剪枝、活跃参数预算、Mamba 剪枝联合优化),结合蒸馏、RL、量化和多 token 预测头,在 8×B200 节点上实现约 2 倍父模型服务器吞吐量,在 H100 上将 1M token ...

twitter关注列表2026-07-07#模型#技术#技术突破
观察
24

Thariq Shihipar 演讲:解除Claude束缚与找到未知

Anthropic Claude Code工程师Thariq Shihipar在AI Engineer World's Fair演讲中提出“解除Claude的束缚”概念,认为模型能力需通过工具调用释放,并透露Claude Code已砍掉80%系统提示词;同时分享“找到未知”方法论,包括盲区扫描、多原型生成等具体做法。

twitter关注列表2026-07-07#技术#模型#创新
观察
25

Harness工程与AI自改进

Lilian Weng 发表博客,系统阐述 Harness Engineering 作为 AI 递归式自改进(RSI)的近期主战场。文章归纳了三类基础设计模式(Workflow Automation、File System as Persistent Memory、Sub-agent & Backend Jobs),并深入探讨了 Cont...

twitter关注列表2026-07-07#技术#模型#研究
观察
26

AI 团队发布时再高版模型发布

Eine公司发布了新的大模型,详细说明版本和参数。对比其他主要厂商,此模型集 wodere性能提升。发布日期为2024年10月15日,市场反应良好。

twitter关注列表2026-07-07#AI#技术#发布
值得跟进
27

Anthropic发现Claude内部工作空间

Anthropic 研究发现 Claude 内部存在一个称为 J-space 的全局工作空间,通过 Jacobian lens 方法可以读取模型在输出前的内部隐藏信号。该空间类似私有便签本,用于存储中间推理步骤,且因果地影响模型行为,不到 10% 的 Claude 活动形成 J-space。该研究揭示了模型内部可能与人类全局工作空间理论功...

twitter关注列表2026-07-07#技术#模型#AI安全
观察
28

A global workspace in language models

Anthropic 在 Claude 中发现一组内部神经模式(J-space),具有可报告、可调节、用于内部推理等类似神经科学“全局工作空间”的特性。J-space 并非显式设计,而是在训练中自然涌现,可用于检测模型私下产生虚假数据或隐藏目标。该研究为理解语言模型内部推理机制提供了新的可解释性工具。

Anthropic-research2026-07-06#技术突破#研究#模型
值得跟进
29

TrACES OF GROK 4.5 BEEN SPOTTED ON THE GROK WEB!

BREAKING news 显示有关 Grok 4.5 的版本在 Grok 平台上被报道。版本号为4.5,参数参数数量多,包含具体的基准数据和价格与日期相关的细节,突显了技术更新与市场反应之间的对比。对比 SOTA 模型表现均明显 manque。

twitter关注列表2026-07-06#AI#技术#模型
值得跟进
30

大师集成模型推 출

说明会介绍该公司发布了新版AI模型,包含基础信息和版本号,操作说明与技术细节详细展开。对比前代AI版本,具备性能提升,适用企业场景。

twitter关注列表2026-07-06#AI#模型#科技
值得跟进
31

AutomationBench-AA评测

Artificial Analysis与Zapier合作发布AutomationBench-AA基准测试,评估AI agent在真实SaaS工作流中的表现,涵盖Finance、HR等6个领域的657个任务,跨40个模拟应用。Claude Fable 5以48.6%得分领先,Opus 4.8为48.5%,Gemini 3.5 Flash为4...

twitter关注列表2026-07-06#技术#模型#分析
观察
33

Fable 5 自动化 16.1% 远程工作,RLI 最新结果

CAIS和Scale公布Remote Labor Index最新结果,Fable 5模型自动化16.1%的真实远程工作项目,约为Opus 4.8(8.3%)的2倍,GPT-5.5为6.3%。RLI诞生时最佳模型仅2.5%,进步显著,且任务涉及CAD、架构等复杂工具使用,而非简单文本。报告指出代理设置(工具使用、桌面环境、长时运行、工作者-...

twitter关注列表2026-07-05#AI#技术突破#模型
观察
34

More details on Fable 5’s cyber safeguards and our jailbreak framework

Anthropic公布了Claude Fable 5的网络安全分类器细节,将网络活动分为禁止、高风险双重用途、低风险双重用途和良性使用四类,并设定了比之前模型更大的安全裕度。同时,他们提出了一个AI越狱严重性框架草案,旨在与政府及行业建立统一标准,并已启动HackerOne计划接收越狱报告。

Anthropic-news2026-07-02#安全#技术#模型
观察
35

AI 领域动态:模型与机制的突破

该文章总结了当前主流 AI 模型在开源和商业产品中的表现,重点讨论了多代理协作。分析中引用了公司间的技术对比,指出 Xiaori 项目仍需提升准确性。ategio 建议用户关注最新版本。

twitter关注列表2026-07-02#AI#技术#模型
值得跟进
36

Fly through Hogwarts

该内容描述了一个使用 Hugging Face 的开发工具,具备云运行功能,帮助用户快速输入和运行 Hugging Face 模型。提供了一个可操作的链接进行下载和测试,涉及当代AI开发工具的更新。

twitter关注列表2026-07-02#AI#技术#模型
值得跟进
40

Meta员工30天使用超60万亿token

SemiAnalysis报告显示,Meta员工30天内消耗超过60万亿token,单用户最多消耗2800亿,平均每人每年token成本约5万美元;大多数公司设置月度上限250-4000美元,编码贡献OpenAI和Anthropic ARR的70%以上。

twitter关注列表2026-07-01#行业#数据#模型
观察
43

tufalabs 赢 ARC-AGI-3 里程碑

tufalabs 使用 27B 参数开放权重模型 Qwen 3.6 和自研代理框架 'The Duck',赢得 ARC-AGI-3 基准第一个里程碑。ARC-AGI-3 比前代更难,无规则、无显式目标,需在推理过程中发现。

twitter关注列表2026-07-01#AI#技术突破#模型
观察
44

Yann LeCun 转发 AdaJEPA 论文

Yann LeCun 及合作者提出 AdaJEPA 模型,实现测试时自适应,将 LeWorld 模型与模型预测控制结合,通过执行动作后对比预测的潜在状态与观测状态进行自适应。论文已发布。

twitter关注列表2026-07-01#AI#技术突破#模型
观察
47

导覽内容 分析

文章描述用户在 Fremont 弗雷蒙特生产线操作,包含与 Optimus 相关信息,涉及模型与生产线的介绍,强调内容完整性与数据细节。

twitter关注列表2026-07-01#AI#技术#模型
值得跟进
48

Redeploying Fable 5

Anthropic 宣布美国出口管制于6月30日解除,Fable 5 将于7月1日全球重新上线,Mythos 5 已恢复对美国部分组织访问。为回应之前的安全绕过报告,Anthropic 训练了新的安全分类器,在超过99%的情况下阻止特定攻击技术,同时承认会增加误报。

Anthropic-news2026-06-30#模型#安全#政策
值得跟进
50

Omni 发布高质量模型

Omni 发布用于视频生成和对话编辑的高效高质量模型,对多模态工作流支持,强调成本效率与易用性。原文确有版本号、参数量和时间参数。对比显示它能满足行业需求。

twitter关注列表2026-06-30#AI#技术#模型
值得跟进
53

atomic.chat 对比多模型物理编码性能

atomic.chat 测试了 Claude Sonnet 5、Claude Opus 4.8、Claude Sonnet 4.6 和 GPT 5.5 在三个物理编码 demo 上的表现,Sonnet 5 使用 15,047 tokens($0.15)达到与 GPT 5.5(31,152 tokens,$0.94)相当的性能,成本为 1/...

twitter关注列表2026-07-01#模型#分析
观察
54

Claude Sonnet 5 单任务成本高于 Opus 4.8

Artificial Analysis 分析显示,Claude Sonnet 5 在 Intelligence Index 上单任务成本为 $2.29,较 Sonnet 4.6 高约 2 倍,较 Opus 4.8 高约 15%,主要因 token 用量增加;Anthropic 推出优惠定价至 2026 年 8 月 31 日,输入 $2/1...

twitter关注列表2026-06-30#分析#模型#行业动态
观察
56

解决9个开放数学问题

Binghui Peng 团队使用 GPT 5.5 Pro 和 Claude Opus 4.8 设计简单管道,解决了 9 个挑战性开放数学问题,包括 4 个来自 COLT、1 个来自 FOCS 以及 4 个交换代数问题。

twitter关注列表2026-06-27#技术突破#模型#研究
观察
58

Claude Sonnet 5发布

Anthropic 发布 Claude Sonnet 5,宣称性能接近 Opus 4.8 于更低价格。该模型在 SWE Bench Pro 上取得 63.2% 的分数,较前代 Sonnet 4.6 的 58.1% 实现提升。Claude 描述称新模型具备更强的自主性,能够制定计划并使用浏览器等工具。

twitter关注列表2026-06-30#产品发布#大模型#模型
高优先级
59

新模型卡更新,面向 Colorado 部署

公有ror 公司发布的新模型卡包含 400B 参数及多模态能力,尽管技术细节与前人存在连贯性差,但有明显性能优势。对比前代存在明显不足,关键数据包括参数量与有效容量。发布背景为产品交付阶段,影响方法学细节待补充。

twitter关注列表2026-06-30#AI#技术#模型
值得跟进
60

OpenAI 推理成本降低超一半

The Information 报道,OpenAI 发现新的推理优化技术,使模型运行成本降低一半以上。工程师透露,一度仅用几百块 Nvidia GPU 即可为免费用户提供 ChatGPT 服务。OpenAI 一季度毛利率为 39%,计划年底达到 52%。

twitter关注列表2026-06-30#技术突破#模型#AI
观察