一句话判断
相较于 Qwen 和 Gemma,Nanbeige4.2 在 agent 任务上有具体优势数据,值得点原文查看详细对比。
核心信息
Nanbeige 在 ModelScope 发布 Nanbeige4.2 系列,包含一个 28T-token 的 Looped Transformer base 模型和一个 3B 参数的 SFT+RL agent 模型。团队声称在 agent 基准测试上超越 Qwen3.5-9B 和 Gemma4-12B。
原始内容
相关动态
Qwen-Image-3.0 发布
Alibaba Qwen 团队发布了第三代图像生成基座模型 Qwen-Image-3.0。该模型支持高达 4.5k tokens 的长提示词,可实现复杂的布局生成(如报纸、分镜脚本、3x3 信息图),具备 10px 级别清晰的文本渲染能力,并支持 12 种语言和 100 多种艺术风格。
Codex 1000万付费用户推动OpenAI进军企业市场
OpenAI的Codex已突破1000万付费用户,其中大量用户选择Pro层套餐,这直接冲击了Anthropic在B2B和企业市场的收入优势。文章指出,OpenAI正通过Codex向高价值专业客户市场渗透,而Anthropic因竞争压力被迫保留Fable 5在Max层套餐中,这种竞争有望加速Opus 5和Fable 5.5的发布。
AI解决87年雅各比猜想
Levent Alpöge在Anthropic完成对87年前未解决数学猜想的反例发现,证明yaqūjīzé jiāujiàn(雅各比猜想)存在无法恢复单一输入的多项式映射,验证已通过Lean数学形式化检查。与人类研究者相比,AI通过计算数学探索发现此反例,展现数学证明领域AI能力增强。
Anthropic 用 Claude Code 实现百万行代码迁移新模式
Anthropic 团队使用 Claude Code 将 Zig 项目迁移到 Rust,百万行代码不到两周完成,100% 测试通过,仅 19 个回归问题全部修复,成本约 16.5 万美元。文章介绍了六步迁移流程,强调以强 judge 和对抗 agent 验证测试断言,可复制的工厂流水线模板将语言级重构门槛降至小团队可行。
百度开源Unlimited-OCR模型
百度开源 Unlimited-OCR 模型,30亿参数但推理时仅5亿激活,支持一次性处理40页文档,32K上下文窗口,准确率93%(比基线高6%),错误率低于0.11,输出结构化Markdown,免费本地运行,对比亚马逊Textract等商用方案每页收费。