BestBlogs 早报 · 07-18
月之暗面发布Kimi K3,2.8万亿参数,896选16的Stable LatentMoE,上下文100万token,接近Fable-5但仍落后最强闭源模型,完整权重7月27日前开源;VentureBeat调查显示54%企业已发生AI代理安全事件;xAI开源Grok Build(84万行Rust代码)并残留上传用户代码痕迹;Cursor评...
围绕 模型发布 的精选动态、来源摘要和重要性判断。
月之暗面发布Kimi K3,2.8万亿参数,896选16的Stable LatentMoE,上下文100万token,接近Fable-5但仍落后最强闭源模型,完整权重7月27日前开源;VentureBeat调查显示54%企业已发生AI代理安全事件;xAI开源Grok Build(84万行Rust代码)并残留上传用户代码痕迹;Cursor评...
Thinkymachines 发布开源 MoE 模型 Inkling,总参数 975B、激活参数 41B、上下文长度 1M,支持文本、图像、音频的可控推理。
Astribot发布了40亿参数的Lumo-2机器人基础模型,推理速度比前代快2.71倍,支持人类视频和多机器人身体。该模型在105个未见物体上取得更好结果,并在22项涵盖 motion prediction、memory、physical reasoning、long tasks、fine hand control的真实操作任务中表现最...
月之暗面在 GTC 2026 宣布开源三个替代 Transformer 基础组件:MuonClip 优化器(数据效率接近翻倍)、Kimi Linear 线性注意力(3:1 混合全注意力,首个全面超越全注意力的架构)、Attention Residue 残差连接(提升 24% Token 效率)。同时披露 Agent Swarm 支持 10...
EverMind 与 MiniMax 合作,其模型 MiniMax 被集成到 Raven 系统中,Raven 基于 EverOS 构建,具备持久记忆、长上下文处理、多代理协作及可复用技能特性,能够执行深度研究、高性能编码等复杂任务。原文提及 MiniMax 提供的上下文长度和 Raven 的持久记忆数据无具体量化值,仅说明技术融合说明。
Artificial Analysis 发布评测,8天内 SpaceXAI 的 Grok 4.5(54分)、OpenAI 的 GPT-5.6 Sol/Terra/Luna(最高59/55/51)、Meta 的 Muse Spark 1.1(51分)和 Moonshot AI 的 Kimi K3(57分)相继发布,前沿模型实验室从6月初的2...
Jim Fan团队发布RoboTTT,将机器人模型上下文原生扩展到8000时间步(5分钟),推断成本恒定,性能较前沿提升三个数量级。采用测试时训练(TTT)技术,内部小模型持续压缩历史,实现无限学习。在电路板组装任务中,机器人能从人类视频一次性模仿学习,并在线自我纠错。上下文缩放实验表明,8K步预训练性能优于1K步62%,且未饱和。
Moonshot AI 发布 Kimi K3 模型,2.8 万亿参数,百万 tokens 上下文,原生多模态;采用 Kimi Delta Attention 实现百万 tokens 解码速度 6.3 倍提升,Attention Residuals 以小于 2% 额外成本提升训练效率约 25%;已上线多个平台,开源权重承诺 2026 年 7...
Cursor 团队在约一年内构建外循环收集用户反馈、内循环优化训练过程的系统,使 Composer 2.5 成为最受欢迎模型并与 SpaceXAI 联合训练 Grok 4.5。该系统通过大量真实交互数据、限制网络访问、维护 CursorBench 任务集,实现模型自我加速迭代并应对评估作弊问题。
InternVLA-A1.5 新模型在 ModelScope 上发布了四个检查点,其中包含 2.69B 参数的基础版本以及 LIBERO、RoboTwin 2.0、DOMINO 的任务特定版本。该模型在六项仿真基准赛中报告了最佳整体成绩,分别为 LIBERO 98.9、LIBERO-Plus 84.8、RoboTwin 2.0 93.2。...
Moonshot 发布 Kimi K3,2.8T 参数原生多模态模型,1M 上下文,采用 stable latentmoe 激活 16/896 专家,量化感知训练,定价 $0.30-$15.00/mtok。基准测试 SWE Marathon 42.0 领先,但第三方代码生成测试中耗时 75.6 分钟(Grok 4.5 仅 5.1 分钟),...
Moonshot AI发布Kimi K3,2.8万亿参数MoE架构、百万上下文窗口、原生多模态,于Frontend Code Arena以1679分登顶,超越Claude Fable 5与GPT-5.6 Sol,在7个前端细分赛道拿下6个第一;模型将于7月27日开放权重,API定价输入每百万tokens 15美元,对标前沿闭源模型价格区间...
Kimi Moonshot 团队的 Kimi‑K3 模型以 1679 分夺得 Frontend Code Arena 冠军,超越 Claude Fable 5,比 Kimi‑k2.6 上升 17 名,价格为 $3/$15(输入/输出),约为 Claude Fable 5($10/$50) 的三分之一,并在 7 个子领域中夺得 6 冠,模型...
Moonshot 今日发布 Kimi K3 模型,2.8万亿参数 MoE 架构,百万上下文窗口,原生多模态,7月27日开放权重。API 定价输入每百万 tokens 15 美元,接近前沿闭源模型。架构创新包括 KDA 混合线性注意力(解码速度最高提升6.3倍)和 AttnRes 注意力残差(训练效率提升约25%)。在 Terminal B...
Kimi_Moonshot 的 Kimi-K3 模型在 Frontend Code Arena 中以 1679 分排名第一,超越 Claude Fable 5,从第 18 位跃升 17 位。在 7 个领域中 6 个排名第一,仅游戏领域第二。完整模型权重将于 7 月 27 日开源。
Kimi.ai推出Kimi K3模型,采用2.8万亿参数、1百万上下文和原生多模态设计,引入Kimi Delta Attention技术实现解码速度提升6.3倍,Attention Residuals技术在训练效率上提升约25%,将于2026年7月27日开源权重。
Moonshot 的 Kimi-K3 在 Frontend Code Arena 以 1679 分登顶,超越 Claude Fable 5,较 Kimi-k2.6 跃升 17 名(第 18 至第 1),在 7 个领域中 6 个排名第一,模型权重将于 7 月 27 日发布。
Kimi K3 在内部写作基准测试中获得 2840 Elo 分,超过 Claude Fable 5,位列 #1,较前代 Kimi K2.6 从 #21 提升至 #1,同时每脚本成本仅 0.25 美元,五分之一于被取代的模型。
NVIDIA 开源 Nemotron 3 Embed 8B 模型,在 RTEB 评测中以 78.5% 凭借 32k 上下文、多语种及代码检索能力夺得首位。除此之外还发布 1B 与 Blackwell NVFP4 版本,后者吞吐量翻倍、BF16 精度保持 99%+。该模型提升了检索效率,使智能代理更早获取证据,减少 downstream t...
Moonshot AI's Kimi K3 is a 2.8‑trillion‑parameter multimodal model with a native 1‑million‑token context window, using a sparse expert system that activates only 16 of it...
AI/ML API 上线了 Kimi K3 模型,与 Claude Fable 5 均支持 1M-token 上下文窗口。在 vibe-coding 测试中,Kimi K3 以 1/4 的价格($3.11 对比 $12.23)在代码生成任务中表现优于 Claude Fable 5。
Atomic Chat 的本地 LLM 桌面应用给 Kimi K3、GPT‑5.6 与 Opus 4ន三种模型同样任务,要求各自生成 Road Fighter、Battle City、Q*bert 三款自玩型 HTML 版复古游戏,包含图形、敌人фа和完整 AI 玩家。输出结果显示 Kimi K3 共 18.4K tokens,成本 $...
Kimi.ai推出Kimi K3模型,搭载2.8万亿参数、1百万上下文窗口,支持原生多模态。该模型引入Kimi Delta Attention技术,实现万token上下文场景下解码速度提升至6.3倍;Attention Residuals技术在训练效率上提升约25%,仅增加2%成本。模型定位为长期决策代理级编码和自演化工作流所需,已在Ki...
通义千问团队发布 Kimi K3 模型,参数规模达到 2.8T,上下文窗口达 100 万 token,实现原生多模态能力。通过 Delta Attention 优化耗时减少 6.3 倍,Attention Residual 机制在不到 2% 额外成本下实现训练效率提升约 25%,专为长期 horizons agent 和自演化 workf...
Kimi.ai 发布 Kimi K3 大模型,拥有 2.8 万亿参数、1 百万上下文长度和原生多模态支持,采用 Delta Attention 将百万token 解码速度提升 6.3 倍,并通过 Attention Residuals 实现训练效率提升 25% 以下降成本 2%,计划 2026 年 7 月 27 日开放权重。
NVIDIA 发布 Nemotron 3 Embed 8B 嵌入模型,在 RTEB 检索基准测试中获得总榜首位,该基准评估真实任务中的检索准确率。
Google Gemma 团队发布了 Gemma 4 31B 模型在 LiveKit 推理平台的部署,首次音频延迟为 354 ms,首次 token 生成时间为 192 ms,并在 tau2bench 工具使用基准上获得 76.9% 成功率,超越 GPT‑4.1。
SenseNova 团队推出 SenseNova-U1-Infographic-V3 模型,这是一个基于 8B 参数 MoT 检查点,采用原生多模态 NEO-unify 架构。该模型在 T2I 任务上性能优于 Qwen-Image-2.0 和 Z-Image,在 BizGenEval + IGenBench 基准测试中排名更前。模型支持 ...
Google 发布 Gemini Omni Flash 多模态模型,在 Artificial Analysis 视频排行榜上文本到视频和图像到视频均位居第一,击败 ByteDance 的 Seedance 2.0。模型支持文本、图像、视频输入,生成 720p 24FPS 3-10 秒视频,定价 $0.10/秒,已通过 Gemini API...
Google 在 Google Vids 中推出 Gemini Omni 和个人化头像功能,用户可通过简单提示生成高质量视频剪辑并创建数字化身,需要上传自拍和语音录音制作看起来和声音像自己的虚拟形象。此功能面向 Google AI Pro、Ultra 和 Workspace 商业客户开放,个人化头像仅限特定 Google 账号下 18 岁...
Kimi 宣布今晚发布 k3 模型,参数规模 2-3T,上下文长度 1M,预计性能超过 Claude Opus 4.8(约1.5T参数)。
Hy-Embodied-VLM-1.0 在 ModelScope 发布,采用 Apache 2.0 许可证。该模型总参数约 30B,每个 token 仅激活约 3B,在 38 个具身基准测试中排名第一 19 个、第二 11 个,平均性能较 Hy-Embodied-0.5 MoT-2B 提升 8.4%。
前 OpenAI CTO Mira Murati 创立的 Thinking Machines 发布了首个模型 Inkling,采用 MoE 架构,总参数 975B,激活参数 41B,支持 1M 上下文窗口,在 45T 数据上训练,原生支持文本、图像和音频多模态。同时提供激活参数 12B 的 Small 预览版,模型权重开源,后训练数据从 ...
阿里通义实验室发布Qwen-Audio-3.0-Realtime实时语音交互模型,具备高表现力共情对话、流畅双工交互和Agentic工具调用能力,在Artificial Analysis评测的Speech Reasoning子项中位列第一。
Arena 在其排行榜中加入了基于真实用户对话的事实核查评分,对模型的可靠性进行衡量。他们从超过 200 万条模型在真实对话中提出的可验证主张中抽样验证,覆盖约 13 万文本竞赛和 4 万搜索竞赛。启用事实权重后,GPT‑5.5 在文本竞赛中上升 13 名,Muse Spark 下降 13 名,Claude Fable 5 略降,而在搜索...
LingBot-VLA 2.0是一个开源的具身模型,通过60K小时精选的机器人和人类数据训练,支持从单臂机器人到人形平台的多种机器人配置,显著提升了机器人在复杂长期任务上的性能。
AWS Newsroom 宣布 OpenAI 的 GPT-5.6 系列模型(Sol、Terra、Luna)已在 Amazon Bedrock 上正式可用,提供从旗舰推理到快速推理的三个层次。
Anthropic 延长 Claude Fable 5 的免费试用期至 7 月 12 日。从 7 月 1 日起,Pro、Max、Team 和企业版用户可在订阅额度内免费使用 Fable 5,但最多占每周额度的 50%。支持网页、手机、桌面客户端、Claude Code、Cowork、Design 及 Microsoft 365 插件。企业...
Meta发布首个自研图像生成模型Muse Image,将替代此前依赖的Midjourney和Black Forest Labs。该模型支持编辑、生成、删除对象等功能,消费者免费使用,高级用户需订阅Meta One。内部测试中Muse Image表现优于Nano Banana 2但落后于GPT Image 2。
腾讯发布最新编码模型 Hy3,此模型已完全开源,支持 256K 上下文,且用户反馈其性能优于 Hy3 Preview。
Artificial Analysis重新实现Harvey的法律代理基准Harvey LAB-AA,使用由Harvey团队构建的120个.scenario测试了24个法律领域的模型。Claude Fable 5(AnthropicAI)以14.2%的全通过率遥遥领先,其次是Claude Opus 4.8和GLM-5.2(Zai_org)各...
NVIDIA发布Audex,一个30B总参数/3B活跃参数的音频-文本MoE模型,基于Nemotron-Cascade-2构建。它在BigBenchAudio(90.0)、Audio Entailment AudioCaps(95.6)和CMM(90.3)上取得高分,同时保持文本推理能力。模型覆盖音频理解、ASR、语音翻译、TTS、语音生...
Google DeepMind 发布 Gemma 4 技术报告,模型家族参数从 2.3B 到 31B,涵盖密集和 MoE 架构。12B 模型采用无编码器设计,2.3B 有效参数模型匹配 Gemma 3 27B 性能。31B 模型在 Arena Text 排名 43,支持思考模式,AIME 2026 达 89.2%,GPQA Diamond...
David Fan 等团队在 ICML spotlight 展示 Beyond Language Modeling 论文,研究了将视觉作为一等公民进行多模态预训练的方法,探索了 Transfusion-style 模型从头训练的设计空间,涉及视觉表示、数据、世界建模、架构和扩展行为等方面。
ModelScope 开源 LingBot-Vision 光学特性系列模型,包含 1B ViT-g 模型和多尺度学生模型。1B ViT-g 在 NYUv2 深度 RMSE 0.296 排名领先 7B DINOv3(0.309),Cityscapes 79.6 -SiGe 87.5 匹配;0.3B ViT-L 学生模型性能接近 7B DIN...
Zikai分享了Qwen-AgentWorld的见解:AgentWorld可作agent使用;8B dense是能有效学习的最小模型,4B dense学习效果差;最佳输入格式为playwright的accessibility tree;AgentWorld基于qwen3.5训练。Qwen开源了Qwen-AgentWorld-35B-A3B...
ModelScope 发布 Hy3 模型,总参数量 295B 激活参数 21B 的 MoE 架构,专为 agent 工作流设计,支持 256K 上下文并提供 FP8 量化版本。在 270 位专家的盲测中,Hy3 得分 2.67/4,超过 GLM-5.1 的 2.51/4,在前端开发、CI/CD 和存储领域提升显著;多轮对话错误率从 17....
腾讯混元 Hy3 模型(295B MoE,256K 上下文)在 OpenRouter 上免费提供使用至7月21日,专为编程、推理、代理和工具使用设计。
腾讯混元发布 Hy3 模型(295B MoE),自称同类最佳、媲美万亿级旗舰,采用 Apache 2.0 开源并开放两周免费 API。
Tencent Hunyuan 和 Novita Labs 通过 OpenRouter 平台推出大模型 Hy3,该模型基于 295B MoE(21B 活跃参数)架构,支持 256K 上下文长度,提供三种可配置推理模式,并专注于代码生成、推理与长上下文场景的优化,针对企业级 AI 工作流。
DeepSeek V4 开源两种变体,可扩展上下文至100万 token,并通过注意力改进和 Mega MOE 加速计算
腾讯混元发布 Hy3 模型,采用 295B/A21B MoE 架构,支持 256K 上下文窗口。相比 preview 版本,任务成功率从 72% 提升至 90%,执行效率平均耗时缩短 34%,文档处理 token 节省 47.4%,PPT 制作节省 49.0%(对比 GLM-5.2)。已在元宝、ima、QQ 浏览器等腾讯产品中应用。
腾讯混元发布 Hy3 正式版,经过 270 位专家盲测后幻觉率下降,多轮承接改善,并将模型以 Apache 2.0 开源且降低 API 价格,示范国产模型在办公、开发与游戏afone 实际落地。
腾讯混元发布HY3模型,1点 EST 直播讨论性能并现场编码,依赖novita_labs算力
腾讯混元发布 Hy3,295B 参数 MoE 模型,侧重成本效益的 agentic 场景,在编码、工具调用可靠性、推理和 256K 长上下文任务上表现突出,现已在 Nous Research 的 Nous Portal 免费提供两周。
xAI公司基于V9基础模型开发的Grok 4.5,参数量达1.5T,预训练完成于2026年5月26日。后续通过Cursor coding数据进行补充训练,强化学习仍在进行中。xAI计划2026年底每月推出新模型。当前Grok 4.3仍作为公共API模型在Amazon Bedrock服务。
腾讯发布基于MoE架构的Hy3模型,总参数量2950亿,激活参数210亿,使用Apache 2.0许可证开源。该模型在推理任务中超越更大规模的竞争对手,尤其在代理搜索Benchmarks上得分84.2和91.0,且与Claude Opus 4.8、GPT‑5.5相竞争。与Glm‑5.2相比,Hy3在参数规模上更小,但其FP8推理内存仅约3...
Surya Ganguli 及其合作的研究团队在 ICML2026 主会议展示多篇论文。发布了包括层次谱方法、深度强化学习特征保持、时间尺度分析等在内的多篇理论研究(2026)。涉及 Hugo Tabanelli、Yatin Dandi、Luca Pesce、Florent Krzakala 等作者的多篇论文,涵盖高维注意力、随机矩阵视角...
腾讯新模型Hunyuan Hy3在物理模拟测试中达到Gemini 3.5水平,成本降低35倍。测试显示Hy3仅用29,757 tokens($0.006),远低于Gemini 3.5的23,300 tokens($0.21),而DeepSeek-V4花费50,600 tokens($0.009)但效果最差。
bottlecapai 发布 ThinkingCap-Qwen3.6-27B,通过微调 Qwen3.6-27B 在保持能力的同时减少平均50%的思考令牌,最佳情况减少90%以上。