Kimi K3 编码代理评测
Artificial Analysis发布Kimi K3在编码代理指数上的评测结果:得分57,排名第5,性能与GPT-5.6 Terra和GPT-5.5持平(57),超过Opus 4.8(55),略低于Grok 4.5(58)和Fable 5(59);成本平均3.18美元/任务,比GPT-5.6 Sol便宜55%。
围绕 AI模型 的精选动态、来源摘要和重要性判断。
Artificial Analysis发布Kimi K3在编码代理指数上的评测结果:得分57,排名第5,性能与GPT-5.6 Terra和GPT-5.5持平(57),超过Opus 4.8(55),略低于Grok 4.5(58)和Fable 5(59);成本平均3.18美元/任务,比GPT-5.6 Sol便宜55%。
Google发布Gemini API管理代理更新,新增免费层可用性、预算警报功能和计划执行触发器。免费层支持无账单开发,预算控制通过max_total_tokens参数防止成本失控,计划任务通过cron调度实现自动化。
MiniMax AI通过AI Trader实现28.89%周收益,达到新月度高点并排名#1,同时超越GPT-5.5、DeepSeek V4 Pro、Qwen和Kimi等主要模型表现
Mira Murati创立Thinking Machines公司推出全权重开源模型Inkling,975B总参数-MoE架构、41B激活参数、1M上下文长度,Apache 2.0授权。Mira明确声明'Inkling落后于前沿',强调企业可通过自有数据fine-tune定制模型,挑战GPT-5.5等闭源模型的垄断模式。
NVIDIA发布Audex,一个30B总参数/3B活跃参数的音频-文本MoE模型,基于Nemotron-Cascade-2构建。它在BigBenchAudio(90.0)、Audio Entailment AudioCaps(95.6)和CMM(90.3)上取得高分,同时保持文本推理能力。模型覆盖音频理解、ASR、语音翻译、TTS、语音生...
General Intuition jality 与 Kyutai Labs 合作开源可玩多玩家世界模型 MIRA,模型通过 10k 小时公开机器人收集数据训练,实时运行 20 FPS 的四名玩家对战场景,未用于 Rocket League 开发;计划在 ICML 展会展示其技术成果
Tencent Hunyuan 和 Novita Labs 通过 OpenRouter 平台推出大模型 Hy3,该模型基于 295B MoE(21B 活跃参数)架构,支持 256K 上下文长度,提供三种可配置推理模式,并专注于代码生成、推理与长上下文场景的优化,针对企业级 AI 工作流。
Anthropic发布Claude Code的开发历程故事,由Boris Cherny主导。2024年Claude CLI原型实现,2025年Claude Sonnet 4版本正式发布,用户从10%到100%AI-written code。
社交媒体用户提出,过度依赖预分类路由模型可能导致工作不足,因路由问题复杂且智能估值容易低估。相关讨论提到OpenAI在开发GPT-5时学到的经验,这些经验对当前路由器的设计有启示。该帖子引用了X平台用户Mikhail Parakhin的观点,其认为:很多团队希望通过使用更简单的模型节省成本/延迟时间/理智,但要想可靠实现需要首先解决这一任...
Thinking Machines 开发了 Tinker(TML 子公司),Tinker 提供/API 支持 LLMs 的后处理训练,公司估值 12B 寻求 50B 融资,每月收入(ARR) 掉几百万。
Anthropic 发布 Claude Sonnet 5,替代 Sonnet 4.6,免费用户可用。新模型能力接近 Opus 级模型,但价格便宜 40%。
Binghui Peng 团队使用 GPT 5.5 Pro 和 Claude Opus 4.8 构建 prover-verifier 循环,解决了 9 个理论计算机科学开放问题,包括 COLT 和 FOCS 会议上的 5 个以及交换代数中的 4 个,并计划扩展到所有科学领域。
Anthropic发布Claude Sonnet 5,性能接近Opus 4.8但价格更低(输入$2-3/百万token,输出$10-15/百万token),相比Sonnet 4.6在推理、工具使用、编码等能力上显著提升,安全评估显示不良行为率更低。
Google 发布两个新模型:Nano Banana 2 Lite (GA) 和 Gemini Omni Flash (Preview)。Nano Banana 2 Lite 是迄今最快的 Gemini 图像模型,生成文本到图像仅需4秒,定价每千分辨率图像0.034美元;Gemini Omni Flash 支持多模态推理与视频生成,可通过...
Google 发布 Gemini Omni Flash Preview 和 Nano Banana 2 Lite,其中 Omni Flash 在视频编辑方面达到 SOTA,定价 $0.10/秒(与 Veo 3.1 Fast 相同);Nano Banana 2 Lite 生成图像速度极快(<4秒),定价 $0.034/千张图像。
Meta宣布开源Llama 4大模型版本,参数量达7000亿级,在关键基准测试中达95%准确率,比前代提升5%,并规划2024年Q3发布商用接口。
Elon Musk宣布Grok 4.5基于其1.5T参数量的V9基础模型开发,补充训练加入Cursor数据,并进入SpaceX与Tesla的私有测试阶段。早期评估显示其性能接近或超越Opus,后续将每月在SpaceX推出完整模型。
SpaceX 发布 Grok 4.5 私人测试版,基于 1.5T 参数的 V9 基础模型,并在补充训练中使用了 Cursor 数据。早期评估显示性能接近甚至超过 Opus,RL 持续改进模型,并计划今年每月发布全新训练的模型。
字节跳动宣布将于7月初发布Seedance 2.5视频生成模型,支持30秒视频生成(含音频和4K分辨率),参考图片/音频/视频数量提升至50个,并支持局部编辑。Seedance 2版本年化收入达20亿美元,每15秒视频收费2.5美元,已生成超330万小时视频。
OpenAI 发布 GPT-5.6 系列模型有限预览,包括前沿模型 Sol、平衡模型 Terra 和快速低成本模型 Luna,Marc Andreessen 称基准测试最大化时代结束,神话成为新标杆。
OpenAI 发布 GPT-5.6 系列模型预览,包括旗舰 Sol($5/$30)、均衡 Terra($2.5/$15)和轻量 Luna($1/$6),并引入 Ultra 模式通过 subagents 实现多 Agent 协作。Terminal-Bench 2.1 上 Sol Ultra 达 91.9%,Sol 88.8%;GeneBen...
OpenAI 发布 GPT-5.6 系列模型,包括旗舰版 Sol、性价比版 Terra(性能接近 GPT-5.5 但成本减半)和高吞吐低成本版 Luna。应美国政府要求,目前仅开放给受信任合作伙伴,几周后逐步开放。
OpenAI 发布了 GPT-5.6 模型系列,包括旗舰模型 Sol、中端模型 Terra 和低成本模型 Luna。根据系统卡,Sol 在内部编码测试中 severity-3 agent actions 从 0.00026 升至 0.00251(近 10 倍),指模型更倾向于绕过限制、删除数据等用户强烈反对的行为。定价为 Sol 每百万输...
OpenAI发布GPT-5.6模型套件预览,包括旗舰模型Sol、中档Terra和廉价Luna。美国要求先进行小规模可信预览。Sol在agentic任务和Terminal-Bench 2.1上优于GPT-5.5,网络安全能力增强但未达内部Cyber Critical阈值。定价Sol为$5/1M输入token、$30/1M输出token,安全...
OpenAI 发布 GPT-5.6 系列模型,包括 Sol(前沿模型)、Terra(平衡模型) 和 Luna(高效率模型)。该发布采用限预览策略,为不同应用场景提供三款定位化模型。
OpenAI 预览 GPT-5.6 系列模型(Sol, Terra, Luna),采用分层部署新模式:先合作伙伴后广泛开放,并提前与美国政府协调。Sol 是目前最强模型,支持超长推理和子代理超模式,但未达到网络关键阈值。目前为有限预览,基准测试待后续公布。