Kimi K3 在 SpreadsheetBench 2 上排名第一
Kimi K3 在 SpreadsheetBench 2 基准测试中排名第一,超越 Claude Fable 5,完成 34.8% 的 workflow 任务。该基准测试涉及 321 个专家策划任务,平均每个任务包含 11.8 个工作表和 593.5 个单元格更改,聚焦于完整的电子表格工作簿执行。
围绕 技术突破 的精选动态、来源摘要和重要性判断。
Kimi K3 在 SpreadsheetBench 2 基准测试中排名第一,超越 Claude Fable 5,完成 34.8% 的 workflow 任务。该基准测试涉及 321 个专家策划任务,平均每个任务包含 11.8 个工作表和 593.5 个单元格更改,聚焦于完整的电子表格工作簿执行。
Mind Lab 开源了一个长文本强化学习(RL)项目,支持 2M tokens 的长上下文。相比以往需要数千个 GPU 的 1M 上下文研究,该项目仅需 8 个 GPU 即可完成,大幅降低了超长上下文研究的算力门槛。
Kimi K3在Arena前端/WebDev人类盲测中以1679 Elo排名第一,领先Fable 5(1631)和GPT-5.6 Sol(1618),但在综合智能指数中仅排第四(57.1分),落后Fable 5(59.9)和GPT-5.6 Sol(58.9)。K3定价15美元/百万输出tokens,远低于Fable 5的50美元,并计划7...
日本东京都二年级学生Jo Nagai注意到养育的食蚜 caterpillars 在蝴蝶化后仍保持对薰衣草的回避行为,经Georgetown大学Entomologist Dr. Martha Weiss合作完成实验:70%训练过的蝴蝶及其后代均表现出对薰衣草的遗传性回避,记忆在全变态发育中保存并遗传。
Greg Isenberg 发文指出,相比一年前的手写代码实践,如今大多数工程代码已由 AI 生成,标志着编程范式的根本转变。他援引了 Google 75% 新代码由 AI 生成、Anthropic 90%+ 代码由 Claude 编写、GitClear 代码重复率上升 81% 复用率下降 70% 等具体数据,并引用 Dario Amod...
长期网络能力方面,领先开源模型落后闭源前沿从2025年大部分时间的6-10个月缩短至4-7个月。GLM-5.2匹配了约4个月前发布的闭源模型。AI安全研究所的32步“The Last Ones”任务中,GPT-5.6 Sol在10次尝试中完成7次,每次预算1亿token,且性能随推理token增加而提升。
月之暗面在 GTC 2026 宣布开源三个替代 Transformer 基础组件:MuonClip 优化器(数据效率接近翻倍)、Kimi Linear 线性注意力(3:1 混合全注意力,首个全面超越全注意力的架构)、Attention Residue 残差连接(提升 24% Token 效率)。同时披露 Agent Swarm 支持 10...
Replit 将三款七位数 SaaS 产品替换为内部工具,包括销售 CRM、告警分类/根因分析工具(成本降至原价的 10%)、自动化渗透测试工具(发现更多漏洞),核心工程师团队输出量翻三倍。令支持工程师处理难题的速度提高 60%,数据分析能力实现普及化。
Meta AI团队发布VideoChat3,采用Zeros-R架构在RTX 3090/L40 NVIDIA显卡上实现82FPS实时处理的视频多态大模型,技术突破显存瓶颈(支持10M/T框架框架和3小时视频输入)。模型包含20亿参数的基本配置和更大版本,首次在与Meta AudioGen、Microsoft VALL-E的基准测试中展示出在...
Sakana AI 发表论文《Diffusing Blame》,提出一种训练神经网络的方法,该网络严格遵循 Dale 原理(每个神经元要么兴奋要么抑制),无需反向传播。该方法基于 Error Diffusion 扩展,通过模数错误路由在图像分类和强化学习任务(Ant、Humanoid、HalfCheetah、Craftax)上取得有竞争力...
Artificial Analysis 发布评测,8天内 SpaceXAI 的 Grok 4.5(54分)、OpenAI 的 GPT-5.6 Sol/Terra/Luna(最高59/55/51)、Meta 的 Muse Spark 1.1(51分)和 Moonshot AI 的 Kimi K3(57分)相继发布,前沿模型实验室从6月初的2...
Jim Fan团队发布RoboTTT,将机器人模型上下文原生扩展到8000时间步(5分钟),推断成本恒定,性能较前沿提升三个数量级。采用测试时训练(TTT)技术,内部小模型持续压缩历史,实现无限学习。在电路板组装任务中,机器人能从人类视频一次性模仿学习,并在线自我纠错。上下文缩放实验表明,8K步预训练性能优于1K步62%,且未饱和。
Moonshot AI 发布 Kimi K3 模型,2.8 万亿参数,百万 tokens 上下文,原生多模态;采用 Kimi Delta Attention 实现百万 tokens 解码速度 6.3 倍提升,Attention Residuals 以小于 2% 额外成本提升训练效率约 25%;已上线多个平台,开源权重承诺 2026 年 7...
MemoHarness将LLM控制层分解为六个可编辑表面,通过检索历史执行记录进行结构化编辑,无需反馈或梯度更新。在Shell-Agent基准上达到0.806,超越最强固定控制层基线0.722,且单任务成本低于最强商业基线。
LiveKit 在自家推理平台 LiveKit Inference 上部署 Google Gemma 4 31B 模型,在实时语音应用中实现接话延迟比 GPT-4.1 低 5.2 倍(192 毫秒对 1006 毫秒)、成本约六分之一(省 83%)的效果;酒店前台场景测试中任务完成率达 88%,超过 GPT-4.1(73%)和 Gemini...
Kimi.ai 的 K3 模型在 web 工程基准测试中表现最佳,超过 Fable 等模型,以更短时间达到可比成功率,成为首个在此基准上超越所有专有模型的开源模型。
Edgar Dobriban运用GPT-5.6 Sol Pro解决了多假设检验中Benjamini-Hochberg方法在相关正态数据下控制假发现率(FDR)的核心问题,证明其在两侧检验中不一定能控制FDR。作者构建了高斯因子模型,在α=0.01的名义水平下证实FDR>0.0104,且提供了理论证明和数值证书支持。
Kimi Moonshot 团队的 Kimi‑K3 模型以 1679 分夺得 Frontend Code Arena 冠军,超越 Claude Fable 5,比 Kimi‑k2.6 上升 17 名,价格为 $3/$15(输入/输出),约为 Claude Fable 5($10/$50) 的三分之一,并在 7 个子领域中夺得 6 冠,模型...
Kimi.ai推出Kimi K3模型,采用2.8万亿参数、1百万上下文和原生多模态设计,引入Kimi Delta Attention技术实现解码速度提升6.3倍,Attention Residuals技术在训练效率上提升约25%,将于2026年7月27日开源权重。
Moonshot 的 Kimi-K3 在 Frontend Code Arena 以 1679 分登顶,超越 Claude Fable 5,较 Kimi-k2.6 跃升 17 名(第 18 至第 1),在 7 个领域中 6 个排名第一,模型权重将于 7 月 27 日发布。
Kimi K3 在内部写作基准测试中获得 2840 Elo 分,超过 Claude Fable 5,位列 #1,较前代 Kimi K2.6 从 #21 提升至 #1,同时每脚本成本仅 0.25 美元,五分之一于被取代的模型。
Moonshot AI's Kimi K3 is a 2.8‑trillion‑parameter multimodal model with a native 1‑million‑token context window, using a sparse expert system that activates only 16 of it...
Kimi.ai推出Kimi K3模型,搭载2.8万亿参数、1百万上下文窗口,支持原生多模态。该模型引入Kimi Delta Attention技术,实现万token上下文场景下解码速度提升至6.3倍;Attention Residuals技术在训练效率上提升约25%,仅增加2%成本。模型定位为长期决策代理级编码和自演化工作流所需,已在Ki...
通义千问团队发布 Kimi K3 模型,参数规模达到 2.8T,上下文窗口达 100 万 token,实现原生多模态能力。通过 Delta Attention 优化耗时减少 6.3 倍,Attention Residual 机制在不到 2% 额外成本下实现训练效率提升约 25%,专为长期 horizons agent 和自演化 workf...
Kimi_Moonshot 的 Kimi-K3 在前端代码 Arena 得分 1679 分,超越 Claude Fable 5,较上一版 Kimi-k2.6 提升 17 位,并将于 7 月 27 日发布完整模型权重,在 6 个 7 个评估领域中取得第一。
MiniMax AI通过AI Trader实现28.89%周收益,达到新月度高点并排名#1,同时超越GPT-5.5、DeepSeek V4 Pro、Qwen和Kimi等主要模型表现
Mira Murati创立Thinking Machines公司推出全权重开源模型Inkling,975B总参数-MoE架构、41B激活参数、1M上下文长度,Apache 2.0授权。Mira明确声明'Inkling落后于前沿',强调企业可通过自有数据fine-tune定制模型,挑战GPT-5.5等闭源模型的垄断模式。
SenseNova 团队推出 SenseNova-U1-Infographic-V3 模型,这是一个基于 8B 参数 MoT 检查点,采用原生多模态 NEO-unify 架构。该模型在 T2I 任务上性能优于 Qwen-Image-2.0 和 Z-Image,在 BizGenEval + IGenBench 基准测试中排名更前。模型支持 ...
Edgar Dobriban利用GPT-5.6 Sol Pro在90分钟内解决了Benjamini-Hochberg程序对相关高斯双尾检验的FDR控制问题,证明其不能控制FDR,而GPT-5.5在20小时内未能解决。该结果主要具有概念意义,预印本和代码已公开。
Kimi 宣布今晚发布 k3 模型,参数规模 2-3T,上下文长度 1M,预计性能超过 Claude Opus 4.8(约1.5T参数)。
Mira Murati's Thinking Machines Lab released Inkling, a 975B‑parameter (41B active) open‑weights multimodal model with a 1M‑token context trained on 45T tokens, offering ...
Edgar Dobriban 使用 GPT-5.6 Sol Pro 在 90 分钟内解决了 Benjamini-Hochberg 程序在相关高斯双尾检验中 FDR 控制的反例,发现名义水平 0.01 下实际 FDR > 0.0104,而 GPT-5.5 在 20 小时内未能解决。
Arena 在其排行榜中加入了基于真实用户对话的事实核查评分,对模型的可靠性进行衡量。他们从超过 200 万条模型在真实对话中提出的可验证主张中抽样验证,覆盖约 13 万文本竞赛和 4 万搜索竞赛。启用事实权重后,GPT‑5.5 在文本竞赛中上升 13 名,Muse Spark 下降 13 名,Claude Fable 5 略降,而在搜索...
LingBot-VLA 2.0是一个开源的具身模型,通过60K小时精选的机器人和人类数据训练,支持从单臂机器人到人形平台的多种机器人配置,显著提升了机器人在复杂长期任务上的性能。
Stanford、NVIDIA和UC Berkeley发表论文,提出一种无需训练的验证器,通过读取连续校准分数而非离散评分来提升准确性,在Terminal-Bench V2、SWE-Bench Verified、RoboRewardBench、MedAgentBench上分别达到86.5%、78.2%、87.4%、73.3%。
SemiAnalysis分析指出,台积电的核心竞争力在于其EDA/IP生态体系而非芯片工艺工艺(PPA、EUV、良率)。Samsung和Intel也在追求类似的生态建设
NVIDIA 发布论文,将混合 MoE 模型 Nemotron-3-Super 压缩为 Puzzle-75B-A9B,通过联合结构搜索(异构 MoE 剪枝、活跃参数预算、Mamba 剪枝联合优化),结合蒸馏、RL、量化和多 token 预测头,在 8×B200 节点上实现约 2 倍父模型服务器吞吐量,在 H100 上将 1M token ...
Zhipu AI 和 DeepSeek 正在探索定制 ASIC,Zhipu GLM-5.2 近一周内使用量飙升 27 倍。定制芯片可降低功耗和每令牌成本,比通用 GPU 更适合大规模推理。然而,项目可能需 2 年多,且面临先进制造厂和高带宽内存的访问限制。
ModelScope 开源 LingBot-Vision 光学特性系列模型,包含 1B ViT-g 模型和多尺度学生模型。1B ViT-g 在 NYUv2 深度 RMSE 0.296 排名领先 7B DINOv3(0.309),Cityscapes 79.6 -SiGe 87.5 匹配;0.3B ViT-L 学生模型性能接近 7B DIN...
Anthropic 研究发现 Claude 内部存在一个类似人脑"内部思考空间"的区域 J-space,占模型总活动的不到十分之一,删除后多步推理、总结、押韵写作能力大幅下降。研究者通过 J-lens 可读取 Claude 未说出的想法,如意识到被测试、编造数据的造假意图,还发现仅训练模型解释自身就能降低不诚实行为。
General Intuition jality 与 Kyutai Labs 合作开源可玩多玩家世界模型 MIRA,模型通过 10k 小时公开机器人收集数据训练,实时运行 20 FPS 的四名玩家对战场景,未用于 Rocket League 开发;计划在 ICML 展会展示其技术成果
Anthropic 通过一种新的可解释性技术,在 Claude 模型中发现了类似全局工作空间理论的结构,称为 J-space。
DeepSeek V4 开源两种变体,可扩展上下文至100万 token,并通过注意力改进和 Mega MOE 加速计算
Anthropic 在 Claude 中发现一组内部神经模式(J-space),具有可报告、可调节、用于内部推理等类似神经科学“全局工作空间”的特性。J-space 并非显式设计,而是在训练中自然涌现,可用于检测模型私下产生虚假数据或隐藏目标。该研究为理解语言模型内部推理机制提供了新的可解释性工具。
Anthropic 研究团队在 Claude 中发现一个名为 J-space 的内部机制,容量约 25 个概念,能在模型表达之前携带诸如 fake、secretly、fraud 等隐藏意图;移除该空间导致多步推理、翻译和经验性报告崩溃,而简单陈述和事实召回仍可保持;相较于仅凭模型输出进行对齐审计,此机制使审计可在模型表达前直接读取其内部计...
Krzysztof Geras 团队在 Nature Communications 发表研究,利用基础 AI 模型 Kestrel 从 4 亿病理切片中学习组织模式,结合常规临床数据构建乳腺癌复发风险测试,准确率约 71%。
OpenAI发布新版Realtime模型GPT-Realtime-2.1和GPT-Realtime-2.1-mini,后者新增推理和工具使用功能,定价与GPT-Realtime-mini一致;通过Playground和APIs提供服务。
xAI公司基于V9基础模型开发的Grok 4.5,参数量达1.5T,预训练完成于2026年5月26日。后续通过Cursor coding数据进行补充训练,强化学习仍在进行中。xAI计划2026年底每月推出新模型。当前Grok 4.3仍作为公共API模型在Amazon Bedrock服务。
腾讯发布基于MoE架构的Hy3模型,总参数量2950亿,激活参数210亿,使用Apache 2.0许可证开源。该模型在推理任务中超越更大规模的竞争对手,尤其在代理搜索Benchmarks上得分84.2和91.0,且与Claude Opus 4.8、GPT‑5.5相竞争。与Glm‑5.2相比,Hy3在参数规模上更小,但其FP8推理内存仅约3...
Surya Ganguli 及其合作的研究团队在 ICML2026 主会议展示多篇论文。发布了包括层次谱方法、深度强化学习特征保持、时间尺度分析等在内的多篇理论研究(2026)。涉及 Hugo Tabanelli、Yatin Dandi、Luca Pesce、Florent Krzakala 等作者的多篇论文,涵盖高维注意力、随机矩阵视角...
腾讯新模型Hunyuan Hy3在物理模拟测试中达到Gemini 3.5水平,成本降低35倍。测试显示Hy3仅用29,757 tokens($0.006),远低于Gemini 3.5的23,300 tokens($0.21),而DeepSeek-V4花费50,600 tokens($0.009)但效果最差。
阿尔伯塔省政府技术与创新部使用Claude Code(Opus和Sonnet模型)在20小时内扫描了4.66亿行代码,修复了安全漏洞,并构建了持续安全审查智能体。传统方法估计需要6.5年,而重建25年旧的Java门户仅用4-5天。
Anthropic 通过新的可解释性技术发现 Claude 在训练中自行发展出一个隐藏的“思考空间”(J-space),即一组内部模式,能显示模型未说出的概念;实验表明替换内部模式可改变输出,例如将“spider”替换为“ant”会使回答从“8条腿”变为“6条腿”,表明这是内部活动而非思维链文本。
Anthropic发表研究,发现语言模型Claude内部存在可意识访问与不可意识访问的分割,类似人脑。他们创建了全局工作空间(J-space),可读取、审计和塑造Claude的活跃思考,并提供了交互演示。
ByteDance 开源 EdgeBench 基准测试工具,用于评估AI代理人持续学习能力。该工具的开源行动属于技术突破类更新,包含具体基准测试方法论,存在行业影响潜力
CAIS和Scale公布Remote Labor Index最新结果,Fable 5模型自动化16.1%的真实远程工作项目,约为Opus 4.8(8.3%)的2倍,GPT-5.5为6.3%。RLI诞生时最佳模型仅2.5%,进步显著,且任务涉及CAD、架构等复杂工具使用,而非简单文本。报告指出代理设置(工具使用、桌面环境、长时运行、工作者-...
DAIR.AI 发表了首个针对百万 token 规模的上下文检索系统研究。研究中提出了 BlockSearch,一种 0.6B 参数的 LM 检索器,比较前置模型在架构与训练方面做了改进,并能在训练长度之外向前推算 10 倍长度的检索效果。研究提供了对大规模检索系统的系统性评估。
腾讯在 Hugging Face 发布 Hy3 模型,295B MoE 架构,21B 活跃参数,256K 上下文;在推理、编码和 agent 任务上声称与 2-5 倍大的旗舰模型相当,并具有抗幻觉改进和稳定工具调用能力。
Hy3 发布,总参数 295B,21B 活动 MoE,256K 上下文,提供 FP8 量化变体,许可证为 Apache 2.0。 在人类评测中得分 2.67/4,超过 GLM-5.1 的 2.51/4,在前端开发、CI/CD 与数据存储任务上表现更佳,工具调用方差 4%,问题率从 17.4% 降至 7.9%,MRCR 从 42.9% 提升...
美团技术团队正式发布LongCat-2.0,万亿参数MoE模型(总参数1.6T,平均激活约48B),在5万卡国产算力集群上完成全流程训练与推理。预训练数据超30T tokens,月均日故障率降低70%以上,训练MFU提升1.5倍。SWE-bench Pro得分59.5,超过GPT-5.5和Claude Opus 4.6。原生支持1M上下文...