Signal Brief

Macaron-V1 发布新编码模型

Macaron 团队发布 Macaron-V1 模型及 Coding-Venti checkpoint,在 TerminalBench 2.1(87.6)和 UI4ABench(87.8)等五项基准上领先,支持 1M 上下文,采用 MIT 许可证。

twitter关注列表 ModelScope (@ModelScope2022) 发布 2026-07-27 收录 2026-07-27 观察

一句话判断

可点开原文查看详细基准对比和模型架构,评估其在编码任务中的实用性。

核心信息

Macaron 团队发布 Macaron-V1 模型及 Coding-Venti checkpoint,在 TerminalBench 2.1(87.6)和 UI4ABench(87.8)等五项基准上领先,支持 1M 上下文,采用 MIT 许可证。

原始内容

Macaron-V1 is here, with a new Coding-Venti checkpoint for standalone coding workflows. 🍪 🤖 https://t.co/BeD86E80M4 🏆 Macaron-V1 leads the reported comparison on five benchmarks, including 87.6 on TerminalBench 2.1 and 87.8 on UI4ABench. 🛠️ Both models support 1M context, with Macaron-V1-Venti built for long-horizon agents and GenUI. 🧠 Macaron-V1-Venti routes across Chat, Agent, Coding, and GenUI specialists, while Coding-Venti merges the Coding specialist for standalone deployment. License: MIT, subject to requirements inherited from the base model and serving dependencies. ![photo](https://pbs.twimg.com/media/HOOd3RtXcAANWp0.jpg)

相关动态

02

OpenMinis 开源 iOS/Android 双端 AI Agent

OpenMinis 作者 wsvn53 开源了 iOS/Android 双端 AI Agent,iOS 端使用深度定制的 iSH(ARM64 guest),Android 端使用 PRoot 实现用户态 chroot。Agent 提供 8 个 LLM 工具和 20 多个设备集成(通过 Native Offloads 作为 CLI),支持最...

twitter关注列表2026-07-27#模型#开源#技术
观察
03

Anthropic Opus 5 表现与基准值失衡、指令优先级争议

用户分析发现,Anthropic Opus 5 在基准测试中表现超出 Fable 5 并引发基准值有效性质疑。根据 Kun Chen 的观察,尽管 Opus 5 在多项指标上胜过 Fable 5,但实际应用场景中两者效能差异显著。研究指出公司在 5 系列模型训练策略上发生变化,将 Mythos 作为先导模型后通过蒸馏生成 Sonnet 和...

twitter关注列表2026-07-26#模型发布#技术#评测
值得跟进
04

Kimi K3: 2.8万亿参数开源模型发布

Kimi.ai 发布 Kimi K3 模型,拥有 2.8 万亿参数、100 万上下文、原生多模态能力。采用 Kimi Delta Attention 技术,在百万 token 上下文中实现高达 6.3 倍解码加速;Attention Residuals 以低于 2% 的额外成本带来约 25% 的训练效率提升。模型已上线官网、Kimi Wo...

twitter关注列表2026-07-26#大模型#模型发布#技术突破
值得跟进