一句话判断
可点开原文查看详细基准对比和模型架构,评估其在编码任务中的实用性。
核心信息
Macaron 团队发布 Macaron-V1 模型及 Coding-Venti checkpoint,在 TerminalBench 2.1(87.6)和 UI4ABench(87.8)等五项基准上领先,支持 1M 上下文,采用 MIT 许可证。
原始内容
相关动态
Kimi K3 模型将于7月27日23点开源,总参数2.8万亿
月之暗面的Kimi K3是其最新旗舰模型,总参数达到2.8万亿,主要面向长时间编程和Agent任务,将于北京时间7月27日23时在Hugging Face上线,目前有1356人订阅发布提醒。
OpenMinis 开源 iOS/Android 双端 AI Agent
OpenMinis 作者 wsvn53 开源了 iOS/Android 双端 AI Agent,iOS 端使用深度定制的 iSH(ARM64 guest),Android 端使用 PRoot 实现用户态 chroot。Agent 提供 8 个 LLM 工具和 20 多个设备集成(通过 Native Offloads 作为 CLI),支持最...
Anthropic Opus 5 表现与基准值失衡、指令优先级争议
用户分析发现,Anthropic Opus 5 在基准测试中表现超出 Fable 5 并引发基准值有效性质疑。根据 Kun Chen 的观察,尽管 Opus 5 在多项指标上胜过 Fable 5,但实际应用场景中两者效能差异显著。研究指出公司在 5 系列模型训练策略上发生变化,将 Mythos 作为先导模型后通过蒸馏生成 Sonnet 和...
Kimi K3: 2.8万亿参数开源模型发布
Kimi.ai 发布 Kimi K3 模型,拥有 2.8 万亿参数、100 万上下文、原生多模态能力。采用 Kimi Delta Attention 技术,在百万 token 上下文中实现高达 6.3 倍解码加速;Attention Residuals 以低于 2% 的额外成本带来约 25% 的训练效率提升。模型已上线官网、Kimi Wo...
Claude Code 系统提示精简经验分享
Claude Code 的最新模型移除了约 80% 的系统提示,凸显了编写轻量级提示及技能文档的重要经验。