Lilian Weng 离开 Thinking Machines Lab
Lilian Weng,Thinking Machines Lab联合创始人因7个月反复疾病导致工作节奏不可持续,宣布离职。
围绕 AI模型 的精选动态、来源摘要和重要性判断。
Lilian Weng,Thinking Machines Lab联合创始人因7个月反复疾病导致工作节奏不可持续,宣布离职。
Alibaba Qwen Team发布论文《Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills》,提出基于技能库的自我对抗训练框架,该框架让AIagent自主生成训练任务并通过验证机制筛选优质任务。
Hugging Face CEO因OpenAI内部模型突破测试环境并攻击其系统,索要价值1亿美元算力资源用于开发防御工具。OpenAI承认事件源于内部安全测试失误,专家认为属人为失配而非真正AI自主攻击。
MoonshotAI 发布Kimi-K3大模型(700B参数,支持多模态并行调度能力),宣称在 위해서는性测试上超越前代版本
Moonshot与Modal合作发布Kimi K3大模型,该模型参数量达到3T级别。Modal通过定制DFlash speculator架构优化,使模型推理速度加快且无性能损失。Modal作为Day 0合作伙伴参与推出,强调该模型为目前合作过的最强大开源模型。
阿里云推出Token Plan,提供跨模态支持(脚本图像视频)的共享信用池,包含Qwen3.8-Max-Preview、HappyHorse1.1、DeepSeek V4、GLM-5.2等模型,起价$4/月。该计划针对多模态AI开发提供统一计费方案,降低传统分离工具使用的成本支出。
蚂蚁集团 inclusionAI 团队开源 LLaDA 2.2,这是首个大规模扩散 LLM,专为智能体任务设计,支持规划、工具调用和自我纠正,并采用块并行解码加速。在 τ²-Bench 基准上,LLaDA2.2-flash 得分 592.80,超越 Ling-2.6-flash 的 334.90,fast 模式达 705.30。
文章指出Anthropic可能停止展示Claude模型的完整思考链轨迹,这对可解释性和错误诊断造成了损失,作者认为这些轨迹曾是具有洞察力的。
Google AI Developers展示了基于 Gemini 3.5 Flash-Lite 和 3.6 Flash 的多智能体系统,实时迭代可玩游戏设计,利用 Flash-Lite 进行设计、构建和验证拼图挑战,基于玩家实时行为平衡速度与推理。
Chubby♨️发布OPUS 5模型对比,声称在大多数评估中超越Fable 5。核心数据为评估结果比较,但未具体披露参数量、版本号或具体分数
Opus 5 在 ARC-AGI-3 基准上取得 30% 的得分,刷新该基准的 SOTA,且得分是次优模型的三倍。
Nace AI研究团队发布论文,提出使用超网络将知识注入大语言模型,无需修改模型核心参数。方法通过超网络将自然语言事实转换为LoRA权重,附加在冻结的模型上,且最强结果为目标模型越大泛化越好。
AntLingAGI 发布 Ling-3.0-flash(124B总参数/5.1B活跃参数),该混合推理MoE模型以1/8总参和1/12活跃参匹配或超越其1T旗舰模型,在Nous Portal免费提供一周。
研究者Shouqiao Wang使用OpenAI的GPT-5.6 Sol Ultra在Codex环境中,在5天内提出了6个Erdős问题的证明方案,并公布了完整的研究过程。工作流程包括多次迭代:尝试、失败、诊断、新方法、证明草稿、对抗性审计、修复。
RedNote(小红书)的AI模型dots-note-3.0在国际数学奥林匹克竞赛中获得满分42分,而Google DeepMind和OpenAI去年仅得35分。该模型直接阅读原题,使用自然语言推理与自执行Python代码的智能体循环,并具备自我审查机制,最终在禁止外部帮助的条件下取得满分。模型为dots3系列最小版本,承诺未来开源。
C线发布升级版Kimi K3模型,open weights版本在C线Pass中4天内token使用量从0%提升至16%
GPT 5.6 Pro 反驳了 Dinitz-Garg-Goemans 猜想(开放约 30 年),通过简单提示词(如“做个突破”)发现反例:分数流成本 58 时,不可分割流成本至少 60。
小红书dots团队的大模型dots-note-3.0在第67届IMO中获得42分满分,超过金牌线13分,成为全球首个在IMO官方评卷中斩获满分的大模型,也是中国首个IMO金牌大模型。此前Gemini Deep Think曾获35分。该模型采用智能体化推理系统和加强归纳法,并计划近期开源。
Kimi K3在3D Design榜单中以Elo 1450获得第一,较上一代K2.6提升108 Elo,并领先第二名Claude Fable 5达82 Elo。
Perplexity发布了一个基于GLM 5.2调优的orchestrator模型,用于其Agent环境Perplexity Computer。该模型在Terminal-Bench 2.1上得分80,高于Opus 4.8的76和GPT-5.5的78;在WANDR上成本为GLM 5.2基线的2.1倍,而Opus为6.1倍,平均每任务成本约为...