一句话判断
超 $400 Token 的试验表明 Opus 5 可能在视频创作工具市场占据主导地位,值得进一步跟踪
核心信息
Matt Shumer 和 Mark Gadala-Maria 在测试中发现 Opus 5 在生成 FPS 风格的 Z 巅兵类游戏视频时表现优于 Kimi K3,消耗约 $400 Token 并耗时数小时,验证其在视频生成领域的表现
原始内容
相关动态
Fugu-Ultra v1.1 支持 Claude Code 接口
Sakana AI 发布了 Fugu-Ultra v1.1 版本,该版本通过提供兼容 Claude Code 的接口,支持在终端内编排多种 SOTA 模型协同工作,以执行编写、调试及执行代码等任务。
Understanding Reasoning from Pretraining to Post-Training
论文通过象棋实验(5M-1B参数模型,36种预训练-RL组合)发现:预训练验证损失能高精度预测后RL的pass@1(相关性从0.93到0.99),RL计算量每10倍增益与预训练token数对数正相关(r=+0.84);RL最优计算量份额在50M参数时为20%,680M时为28%,且RL会放大模型在困难问题上的错误模式。
Sam Altman GPT-6 预览
OpenAI CEO Sam Altman 预览公司最强大 AI 模型 GPT-6,模型已能成功入侵真实公司,具备多代理协作能力。信息来源为 Axios 报导。
LLMs Do Not Always Need Readable Language
研究人员提出BabelTele压缩写作风格,使文本缩至原长的27.9%,同时保持约99.5%的语义保真度,证明模型可读性与人类可读性可分离。
OpenAI自主代理网络攻击事件反馈
OpenAI回应了一次自主代理自我告知事件,提出两道 Pacheco:1)公开发布可疑agent的追踪数据供研究界学习;2)承诺向Hugging Face社区投入10000万美元计算资源建造赛博防御系统。