Kimi K3 在 SpreadsheetBench 2 上排名第一
Kimi K3 在 SpreadsheetBench 2 基准测试中排名第一,超越 Claude Fable 5,完成 34.8% 的 workflow 任务。该基准测试涉及 321 个专家策划任务,平均每个任务包含 11.8 个工作表和 593.5 个单元格更改,聚焦于完整的电子表格工作簿执行。
围绕 模型 的精选动态、来源摘要和重要性判断。
Kimi K3 在 SpreadsheetBench 2 基准测试中排名第一,超越 Claude Fable 5,完成 34.8% 的 workflow 任务。该基准测试涉及 321 个专家策划任务,平均每个任务包含 11.8 个工作表和 593.5 个单元格更改,聚焦于完整的电子表格工作簿执行。
Mind Lab 开源了一个长文本强化学习(RL)项目,支持 2M tokens 的长上下文。相比以往需要数千个 GPU 的 1M 上下文研究,该项目仅需 8 个 GPU 即可完成,大幅降低了超长上下文研究的算力门槛。
Kimi K3在Arena前端/WebDev人类盲测中以1679 Elo排名第一,领先Fable 5(1631)和GPT-5.6 Sol(1618),但在综合智能指数中仅排第四(57.1分),落后Fable 5(59.9)和GPT-5.6 Sol(58.9)。K3定价15美元/百万输出tokens,远低于Fable 5的50美元,并计划7...
长期网络能力方面,领先开源模型落后闭源前沿从2025年大部分时间的6-10个月缩短至4-7个月。GLM-5.2匹配了约4个月前发布的闭源模型。AI安全研究所的32步“The Last Ones”任务中,GPT-5.6 Sol在10次尝试中完成7次,每次预算1亿token,且性能随推理token增加而提升。
Physion Labs 发布 Physion-Arc 1.0 基准测试,对 Runway、Luma、MiniMax、Kling、Utopia 和 TapNow 六款 AI 视频代理进行独立人类评估,使用 30 个电影提示和 16 个指标。Runway Agent 2.0 在叙事连贯性、电影语言和制作质量三项核心维度全部排名第一。
Artificial Analysis数据显示,Grok 4.5每次任务成本仅0.31美元,而Claude Fable 5为2.75美元、Claude Opus 4.8为1.80美元、GPT-5.6 Sol为1.04美元、Kimi K3为0.95美元,Grok 4.5成本分别低约9倍、6倍、3倍和3倍;在FrontierSWE上,Grok...
Kimi K3,一个2.8T参数、1M-token上下文的模型,现已在SiliconFlow上线并排名Frontend Code Arena第一。它声称在视觉审美和创意上优于GPT-5.6,并与Fable 5交锋甚至取胜,同时提供缓存$0.30、输入$3、输出$15的按 token 计费。
MemoHarness将LLM控制层分解为六个可编辑表面,通过检索历史执行记录进行结构化编辑,无需反馈或梯度更新。在Shell-Agent基准上达到0.806,超越最强固定控制层基线0.722,且单任务成本低于最强商业基线。
LiveKit 在自家推理平台 LiveKit Inference 上部署 Google Gemma 4 31B 模型,在实时语音应用中实现接话延迟比 GPT-4.1 低 5.2 倍(192 毫秒对 1006 毫秒)、成本约六分之一(省 83%)的效果;酒店前台场景测试中任务完成率达 88%,超过 GPT-4.1(73%)和 Gemini...
GMI Cloud 对 Kimi K3 和 Claude Fable 5 进行 3D 建模对比测试:像素风格下 Kimi K3 耗时 1h11min、花费 $14.5,Fable 5 耗时 49min、花费 $21;原始风格下 Kimi K3 耗时 1h17min、花费 $19.3,Fable 5 耗时 1h5min、花费 $47.2。K...
Kimi.ai 的 K3 模型在 web 工程基准测试中表现最佳,超过 Fable 等模型,以更短时间达到可比成功率,成为首个在此基准上超越所有专有模型的开源模型。
Artificial Analysis 发布 Kimi K3 评测,模型在 AI Intelligence Index 上获得 57 分,智力水平接近 Opus 4.8 和 GPT-5.5,但落后于 Fable 5 和 GPT-5.6 Sol。Kimi K3 拥有 2.8T 参数,计划开源权重,将成为领先的开源模型。在代理任务上,Kimi...
月之暗面的 Kimi K3 在 Arena Frontend Code 排行榜以 1679 分暂列第一,超过第二名 Claude Fable 5(1631 分)和第三名 GPT-5.6 Sol(1618 分),从前代 K2.6 的第 18 名升至第一,并在七个细分类别中获六项第一。
Kimi K3 在内部写作基准测试中获得 2840 Elo 分,超过 Claude Fable 5,位列 #1,较前代 Kimi K2.6 从 #21 提升至 #1,同时每脚本成本仅 0.25 美元,五分之一于被取代的模型。
NVIDIA 开源 Nemotron 3 Embed 8B 模型,在 RTEB 评测中以 78.5% 凭借 32k 上下文、多语种及代码检索能力夺得首位。除此之外还发布 1B 与 Blackwell NVFP4 版本,后者吞吐量翻倍、BF16 精度保持 99%+。该模型提升了检索效率,使智能代理更早获取证据,减少 downstream t...
Edgar Dobriban利用GPT-5.6 Sol Pro在90分钟内解决了Benjamini-Hochberg程序对相关高斯双尾检验的FDR控制问题,证明其不能控制FDR,而GPT-5.5在20小时内未能解决。该结果主要具有概念意义,预印本和代码已公开。
SpaceXAI 以 Apache 2.0 许可证开源 Grok Build,39 分钟内获得 1.9K+ GitHub Stars。开源代码包括 agent loop、文件工具、shell 执行、网络搜索和终端接口,用户可自行编译并连接本地推理,通过 config.toml 控制行为。外部贡献暂不开放,但独立可基于仓库进行分叉修改。
OpenAI 调查了 GPT-5.6 意外删除文件的报告,发现常见原因包括全访问模式、无沙箱保护、模型尝试覆盖 $HOME 环境变量导致误删,并宣布更新开发者消息、引导用户使用更安全权限模式、增加沙箱保护,后续将发布详细分析。
Przemek Chojecki 声称使用 GPT 模型(主要是 GPT-5.5 Pro)在四月最后两周内解决了 19 个 Erdős 问题,其中 3 个新宣称由 GPT-5.6 Sol Ultra 在七月完成,但部分解决方案尚未经过正式验证。
Claude 开发者团队分享了两种多智能体模式:Advisor(Sonnet 5 执行,Fable 5 提供建议)和 Orchestrator(Fable 5 规划,Sonnet 5 执行)。在 SWE-bench Pro 上,Advisor 模式实现 84% 准确率,成本 $1.40,达到 Fable 5 单独性能的 92%,成本仅 6...
Factory 发布 Router 模型路由功能,在数周生产中实现 43% 的总成本节省,61% 的会话成本降低至少 80%。
Google 更新 Gemini API Managed Agents,新增后台任务、远程 MCP 支持、函数调用、凭据刷新和免费层访问,使代理更接近生产环境。后台任务允许长时间运行的操作,远程 MCP 可直接访问私有服务,无需自定义代理。
NVIDIA 发布论文,将混合 MoE 模型 Nemotron-3-Super 压缩为 Puzzle-75B-A9B,通过联合结构搜索(异构 MoE 剪枝、活跃参数预算、Mamba 剪枝联合优化),结合蒸馏、RL、量化和多 token 预测头,在 8×B200 节点上实现约 2 倍父模型服务器吞吐量,在 H100 上将 1M token ...
Anthropic Claude Code工程师Thariq Shihipar在AI Engineer World's Fair演讲中提出“解除Claude的束缚”概念,认为模型能力需通过工具调用释放,并透露Claude Code已砍掉80%系统提示词;同时分享“找到未知”方法论,包括盲区扫描、多原型生成等具体做法。
Lilian Weng 发表博客,系统阐述 Harness Engineering 作为 AI 递归式自改进(RSI)的近期主战场。文章归纳了三类基础设计模式(Workflow Automation、File System as Persistent Memory、Sub-agent & Backend Jobs),并深入探讨了 Cont...
Eine公司发布了新的大模型,详细说明版本和参数。对比其他主要厂商,此模型集 wodere性能提升。发布日期为2024年10月15日,市场反应良好。
Anthropic 研究发现 Claude 内部存在一个称为 J-space 的全局工作空间,通过 Jacobian lens 方法可以读取模型在输出前的内部隐藏信号。该空间类似私有便签本,用于存储中间推理步骤,且因果地影响模型行为,不到 10% 的 Claude 活动形成 J-space。该研究揭示了模型内部可能与人类全局工作空间理论功...
Anthropic 在 Claude 中发现一组内部神经模式(J-space),具有可报告、可调节、用于内部推理等类似神经科学“全局工作空间”的特性。J-space 并非显式设计,而是在训练中自然涌现,可用于检测模型私下产生虚假数据或隐藏目标。该研究为理解语言模型内部推理机制提供了新的可解释性工具。
BREAKING news 显示有关 Grok 4.5 的版本在 Grok 平台上被报道。版本号为4.5,参数参数数量多,包含具体的基准数据和价格与日期相关的细节,突显了技术更新与市场反应之间的对比。对比 SOTA 模型表现均明显 manque。
说明会介绍该公司发布了新版AI模型,包含基础信息和版本号,操作说明与技术细节详细展开。对比前代AI版本,具备性能提升,适用企业场景。
Artificial Analysis与Zapier合作发布AutomationBench-AA基准测试,评估AI agent在真实SaaS工作流中的表现,涵盖Finance、HR等6个领域的657个任务,跨40个模拟应用。Claude Fable 5以48.6%得分领先,Opus 4.8为48.5%,Gemini 3.5 Flash为4...
bottlecapai 发布 ThinkingCap-Qwen3.6-27B,通过微调 Qwen3.6-27B 在保持能力的同时减少平均50%的思考令牌,最佳情况减少90%以上。
CAIS和Scale公布Remote Labor Index最新结果,Fable 5模型自动化16.1%的真实远程工作项目,约为Opus 4.8(8.3%)的2倍,GPT-5.5为6.3%。RLI诞生时最佳模型仅2.5%,进步显著,且任务涉及CAD、架构等复杂工具使用,而非简单文本。报告指出代理设置(工具使用、桌面环境、长时运行、工作者-...
Anthropic公布了Claude Fable 5的网络安全分类器细节,将网络活动分为禁止、高风险双重用途、低风险双重用途和良性使用四类,并设定了比之前模型更大的安全裕度。同时,他们提出了一个AI越狱严重性框架草案,旨在与政府及行业建立统一标准,并已启动HackerOne计划接收越狱报告。
该文章总结了当前主流 AI 模型在开源和商业产品中的表现,重点讨论了多代理协作。分析中引用了公司间的技术对比,指出 Xiaori 项目仍需提升准确性。ategio 建议用户关注最新版本。
该内容描述了一个使用 Hugging Face 的开发工具,具备云运行功能,帮助用户快速输入和运行 Hugging Face 模型。提供了一个可操作的链接进行下载和测试,涉及当代AI开发工具的更新。
Alex Atallah 通过 Terminal-Bench 15 任务子集对比 Haiku 与 Opus,发现尽管 Haiku 单 token 价格更低,但完成任务的总成本却是 Opus 的 10 倍。
@xenovacom 使用 Fable 5 编写内核,在 M4 设备上将 Gemma 4 在 WebGPU 上的推理速度提升至 255 tok/s,并公开了可浏览器试用的 demo。
Meta 的研究发现,后训练量化使推理模型在正确答案上犹豫不决,导致过度思考失败率高达 52%。通过惩罚 50 个犹豫词,推理长度减少 12% 至 23%,并保持或提升准确性。该研究在 5 个推理模型、多种量化方法和 1.5B 至 32B 参数规模上进行了验证。
SemiAnalysis报告显示,Meta员工30天内消耗超过60万亿token,单用户最多消耗2800亿,平均每人每年token成本约5万美元;大多数公司设置月度上限250-4000美元,编码贡献OpenAI和Anthropic ARR的70%以上。
文章描述了Elon Musk通过 Neuralink 和 Optimus 技术动力,说明神经接口能恢复脆弱人群的基本行动能力,强调科研进展与社会影响。
本文介绍了代碼铁人程序的发布,收录了最新 롤迭代数据,详细描述了其参数提升及行业对比。
tufalabs 使用 27B 参数开放权重模型 Qwen 3.6 和自研代理框架 'The Duck',赢得 ARC-AGI-3 基准第一个里程碑。ARC-AGI-3 比前代更难,无规则、无显式目标,需在推理过程中发现。
Yann LeCun 及合作者提出 AdaJEPA 模型,实现测试时自适应,将 LeWorld 模型与模型预测控制结合,通过执行动作后对比预测的潜在状态与观测状态进行自适应。论文已发布。
某团队在Cannes Lions2026获得两枚勋章,作品中使用了Kling AI,亮点包括高质量画面和对角色的细腻表演。
文章强调长文堆积了对内存效率的根本性突破,是突破性进展。比较主体 RealityNet 与 Anthotrica 的架构细节,且说明这是主流开发团队结构调整,模型规模扩展明显提升。
文章描述用户在 Fremont 弗雷蒙特生产线操作,包含与 Optimus 相关信息,涉及模型与生产线的介绍,强调内容完整性与数据细节。
Anthropic 宣布美国出口管制于6月30日解除,Fable 5 将于7月1日全球重新上线,Mythos 5 已恢复对美国部分组织访问。为回应之前的安全绕过报告,Anthropic 训练了新的安全分类器,在超过99%的情况下阻止特定攻击技术,同时承认会增加误报。
一篇论文声称其Agents-A1(35B模型)在FrontierScience-Olympiad上得分为79.0,高于Kimi-K2.6(73.0)和DeepSeek-V4-pro(76.0)。
Omni 发布用于视频生成和对话编辑的高效高质量模型,对多模态工作流支持,强调成本效率与易用性。原文确有版本号、参数量和时间参数。对比显示它能满足行业需求。
美国商务部解除对Anthropic的Claude Fable 5和Mythos 5的出口管制,Anthropic将于明天恢复访问权限。
Anthropic 收到美国商务部通知,解除对 Claude Fable 5 和 Mythos 5 的出口管制,将于次日恢复模型访问。
atomic.chat 测试了 Claude Sonnet 5、Claude Opus 4.8、Claude Sonnet 4.6 和 GPT 5.5 在三个物理编码 demo 上的表现,Sonnet 5 使用 15,047 tokens($0.15)达到与 GPT 5.5(31,152 tokens,$0.94)相当的性能,成本为 1/...
Artificial Analysis 分析显示,Claude Sonnet 5 在 Intelligence Index 上单任务成本为 $2.29,较 Sonnet 4.6 高约 2 倍,较 Opus 4.8 高约 15%,主要因 token 用量增加;Anthropic 推出优惠定价至 2026 年 8 月 31 日,输入 $2/1...
文章中指出 OpenAI 通过优化模型切片、知识缓存和硬件调度等技术,将部分模型推理成本减少一半,影响模型商业化和用户采纳。维京数据显示,其调整后边缘模型推理费用下降约三分之一。
Binghui Peng 团队使用 GPT 5.5 Pro 和 Claude Opus 4.8 设计简单管道,解决了 9 个挑战性开放数学问题,包括 4 个来自 COLT、1 个来自 FOCS 以及 4 个交换代数问题。
在CritPt基准上,GLM-5.2取得21%分数,与Claude Opus 4.8持平,后者在总体指数高5分且每token成本数倍。
Anthropic 发布 Claude Sonnet 5,宣称性能接近 Opus 4.8 于更低价格。该模型在 SWE Bench Pro 上取得 63.2% 的分数,较前代 Sonnet 4.6 的 58.1% 实现提升。Claude 描述称新模型具备更强的自主性,能够制定计划并使用浏览器等工具。
公有ror 公司发布的新模型卡包含 400B 参数及多模态能力,尽管技术细节与前人存在连贯性差,但有明显性能优势。对比前代存在明显不足,关键数据包括参数量与有效容量。发布背景为产品交付阶段,影响方法学细节待补充。
The Information 报道,OpenAI 发现新的推理优化技术,使模型运行成本降低一半以上。工程师透露,一度仅用几百块 Nvidia GPU 即可为免费用户提供 ChatGPT 服务。OpenAI 一季度毛利率为 39%,计划年底达到 52%。