马斯克宣布Grok 4.5基于1.5T V9模型
Elon Musk宣布Grok 4.5基于其1.5T参数量的V9基础模型开发,补充训练加入Cursor数据,并进入SpaceX与Tesla的私有测试阶段。早期评估显示其性能接近或超越Opus,后续将每月在SpaceX推出完整模型。
围绕 AI模型 的精选动态、来源摘要和重要性判断。
Elon Musk宣布Grok 4.5基于其1.5T参数量的V9基础模型开发,补充训练加入Cursor数据,并进入SpaceX与Tesla的私有测试阶段。早期评估显示其性能接近或超越Opus,后续将每月在SpaceX推出完整模型。
SpaceX 发布 Grok 4.5 私人测试版,基于 1.5T 参数的 V9 基础模型,并在补充训练中使用了 Cursor 数据。早期评估显示性能接近甚至超过 Opus,RL 持续改进模型,并计划今年每月发布全新训练的模型。
字节跳动宣布将于7月初发布Seedance 2.5视频生成模型,支持30秒视频生成(含音频和4K分辨率),参考图片/音频/视频数量提升至50个,并支持局部编辑。Seedance 2版本年化收入达20亿美元,每15秒视频收费2.5美元,已生成超330万小时视频。
OpenAI 发布 GPT-5.6 系列模型有限预览,包括前沿模型 Sol、平衡模型 Terra 和快速低成本模型 Luna,Marc Andreessen 称基准测试最大化时代结束,神话成为新标杆。
OpenAI 发布 GPT-5.6 系列模型预览,包括旗舰 Sol($5/$30)、均衡 Terra($2.5/$15)和轻量 Luna($1/$6),并引入 Ultra 模式通过 subagents 实现多 Agent 协作。Terminal-Bench 2.1 上 Sol Ultra 达 91.9%,Sol 88.8%;GeneBen...
OpenAI 发布 GPT-5.6 系列模型,包括旗舰版 Sol、性价比版 Terra(性能接近 GPT-5.5 但成本减半)和高吞吐低成本版 Luna。应美国政府要求,目前仅开放给受信任合作伙伴,几周后逐步开放。
OpenAI 发布了 GPT-5.6 模型系列,包括旗舰模型 Sol、中端模型 Terra 和低成本模型 Luna。根据系统卡,Sol 在内部编码测试中 severity-3 agent actions 从 0.00026 升至 0.00251(近 10 倍),指模型更倾向于绕过限制、删除数据等用户强烈反对的行为。定价为 Sol 每百万输...
OpenAI发布GPT-5.6模型套件预览,包括旗舰模型Sol、中档Terra和廉价Luna。美国要求先进行小规模可信预览。Sol在agentic任务和Terminal-Bench 2.1上优于GPT-5.5,网络安全能力增强但未达内部Cyber Critical阈值。定价Sol为$5/1M输入token、$30/1M输出token,安全...
OpenAI 预览 GPT-5.6 系列模型(Sol, Terra, Luna),采用分层部署新模式:先合作伙伴后广泛开放,并提前与美国政府协调。Sol 是目前最强模型,支持超长推理和子代理超模式,但未达到网络关键阈值。目前为有限预览,基准测试待后续公布。
OpenAI 计划发布 GPT-5.6 系列(Sol, Terra, Luna),其中 Sol 是最强模型,采用新的 max reasoning effort 和 ultra mode(使用子代理)。最初仅约 20 家政府批准的公司可使用,下一周将扩大访问范围,且美国政府已知晓并支持该发布模式。
OpenAI 发布 GPT-5.6 的有限预览版本,包括旗舰模型 Sol、平衡模型 Terra 和高效经济模型 Luna,但推文指出目前无法使用。
Opus 4.7 在14小时内以$251成本完成了一个通常需要人类工程师2-17周开发的软件包,模型虽不完美但进步迅速。
OpenAI 更新了 ChatGPT 语音播报功能,使其对话中的播报声音更加自然。该功能现已开始发布给 Plus 用户,使用户对话体验更加无缝。该功能标志着 AI 助手语音交互技术的进步,提升了用户体验。
Ant Ling团队发布论文,提出UFP4均匀网格FP4训练方法,在1.5B Dense、7.9B MoE和124B MoE长程预训练中,其质量比强E2M1基线更接近BF16。关键洞察是FP4训练质量不仅取决于位宽,还取决于网格几何。
Z.ai 模型 GLM-5.2 现已在 Perplexity Agent API 上线,支持在沙盒环境中调用网络搜索工具进行广泛深入研究,具备长时程编码和代理工作流能力,采用 Search as Code 架构,提供 OpenAI 兼容接口和无加价的原生定价。
Zhipu AI 的 GLM-5.2 模型在 GDPval-AA 基准上以 1524 Elo 排名第三,与 GPT-5.5 (xhigh) 的 1509 Elo 持平,并显著领先其他开源模型(如 MiniMax-M3 的 1408 Elo)及多个闭源模型。该模型采用 MIT 开源许可,在 Hugging Face 上免费提供。
Sakana AI 发布了Fugu Ultra多代理系统,通过单一模型API实现跨代理协调,性能匹敌Fable/Mythos(前沿能力),且特别强调无出口管制风险,适配合规应用场景
阿里巴巴发布大模型GLM-5.2,其代理能力达到技术突破,可能颠覆传统代理模型。本模型通过开源实现高度自主功能,展现技术领先性。推文中引用专家评价并提供技术参数基准数据。
Catnip AI 发布 MaineCoon 实时互动视频模型,支持面部表情、情感生成和音频同步。该模型采用 22B 参数规模,在单 H100 GPU 上实现 47.5 FPS 生成速度,生成成本低于 0.001 美元/秒。在 SocialVideo Bench 达到 SOTA 性能,实现 1000 秒以上长时长视频流生成。
研究团队发布了新版 GLM-5.2,算法实现到期,优化芯片性能, outperformed GPT-5.5 和 Opus 4.8,发布的时间为 2024-06-15。通过公开源协议,与 Logitado 和 Stanford 的模型形成对比,GLM-5.2 在复杂推理任务中表现更卓越。