Signal Brief

BestBlogs 早报 07-25: Claude Opus 5 等

Anthropic 发布 Claude Opus 5 旗舰模型,Frontier-Bench 得分超前代两倍,ARC-AGI 3 是次优模型三倍,但网络安全能力落后。Moonshot 开源 Kimi K3 开放权重模型;火山引擎开源 SearchCLI Agent 搜索技术;AMD 发布 MI455...

twitter关注列表 ginobefun (@hongming731) 发布 2026-07-24 收录 2026-07-25 观察

一句话判断

Claude Opus 5 的 ARC-AGI 3 得分是次优模型三倍,但网络安全落后,值得对比其他模型。

核心信息

Anthropic 发布 Claude Opus 5 旗舰模型,Frontier-Bench 得分超前代两倍,ARC-AGI 3 是次优模型三倍,但网络安全能力落后。Moonshot 开源 Kimi K3 开放权重模型;火山引擎开源 SearchCLI Agent 搜索技术;AMD 发布 MI455X 等硬件。

原始内容

BestBlogs 早报 · 07-25 # Claude Opus 5 / Harness Engineering / 超级团队 / Kimi K3 / 视频动作模型 [1] ★ 精讲|Anthropic 发布 Claude Opus 5 新一代旗舰模型 Anthropic 将 Opus 5 作为 Max 默认、Pro 最强模型发布:Frontier-Bench 得分超过前代两倍,ARC-AGI 3 是次优模型三倍,OSWorld 以约三分之一成本超过 Fable 5 最佳成绩。它还展示了自建视觉管线和测试工具修复复杂任务的案例;但这些数据多来自厂商测试,网络安全能力仍落后 Mythos 5。 来源:Anthropic News https://t.co/dXNL7Hd72M [2] ★ 精讲|腾讯 WorkBuddy 实践:如何把 Agent 做成可用产品 WorkBuddy 团队把 Agent 可靠性拆成上下文、工具、权限、验证与反馈系统:稳定规则放 System Prompt,项目知识和 Skill 按需加载;危险动作由沙箱与审批约束,确定性错误优先交给 linter、测试等程序信号纠正。文章还区分可版本化的 Skill 与长期 Memory,帮助读者判断模型能力何时才能变成可控的产品能力。 来源:腾讯技术工程 https://t.co/zMHQUyyUB3 [3] ★ 精讲|袁晓辉:AI 让每个人都变强了,但为什么公司没跑得更快? 腾讯研究院袁晓辉解释了个人提效为何没有等比例变成组织产出:流程中未被优化的环节限制整体加速,瓶颈转移到跨部门协作、方案判断和反馈闭环。文章给出的判断框架是,人负责选择与创造,Agent 承担执行,同时用共享上下文、知识沉淀和持续反馈连接各节点。 来源:腾讯研究院 https://t.co/iYvwThTGHO [4] 分解一座冰山:后端系统「AI 知识库体系」建设实践(长文干货) 本文从 AI 需要理解系统边界出发,提出业务、架构、系统、基建四层知识库体系,以提升 AI 编码的上下文感知与决策质量。 来源:阿里技术 https://t.co/0Z4rWbmUJ3 [5] Kimi K3 重绘开放前沿,Muse Spark 1.1 打响低价竞争 本期《The Batch》报道了 Moonshot 推出的 开放权重 Kimi K3 、Meta 的 低成本 Muse Spark 1.1 以及 Cloudflare 新的 爬虫控制功能 ,并在 Andrew Ng 为 开放模型 辩护 、反对 基于 安全的 监管捕获 的 框架 下进行。 来源:The Batch | https://t.co/hRFcJTFVYd https://t.co/9X4YmyVybT [6] 火山引擎开源 Agent 驱动的搜索自迭代技术 火山引擎开源 SearchCLI,通过 Agent 驱动的搜索自迭代和 SPA 框架,实现搜索策略的自动优化与闭环验证。 来源:字节跳动开源 https://t.co/DLVvqFWhf7 [7] AMD 挑战英伟达全栈壁垒|一文读懂 AMD AAI 2026 本文全面解读 AMD Advancing AI 2026 大会发布内容,涵盖 Helios 机架级平台、MI455X GPU、Venice CPU、https://t.co/7htzSlRfdF 及本地 Agent 方案,并深入分析 AMD 从芯片竞争走向系统级竞争的挑战与路径。 来源:腾讯科技 https://t.co/sp4ku4gvyg [8] 科技爱好者周刊(第 405 期):资源,社会公平与算力 本期周刊以资源、社会公平与算力为特写,讨论资源过度集中加剧社会不公平的观点,并包含如何破坏组织的策略分析、科技动态、工具与文章推荐、言论分享等丰富内容。 来源:阮一峰的网络日志 https://t.co/qomtyPrWNL [9] 评测与提示词如何塑造智能体行为 [视频] 这是一套源自 YouTube Ads 实践的智能体评测框架:先强化工具与护栏,从少量可衡量任务起步,检查执行轨迹与评分一致性,再把具代表性的测试集逐步演化为发布门槛。 来源:AI Engineer https://t.co/A2QTB4aAbi [10] FLUX 3 x mimic:视频-动作模型的下一代 FLUX 3 通过骨干网络和 Self-Flow 实现视频-动作机器人技术,已在奥迪生产线部署。 来源:Hacker News https://t.co/upQVppsvwg --- https://t.co/88ZBr47sdT · 发现真正适合你的高质量内容 BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 在线阅读:https://t.co/tAmHMikXia > **引用原帖 ginobefun (@hongming731):** > https://t.co/xkUnxA3FE8 > https://x.com/hongming731/status/2080804744109658534

相关动态

01

Meta 发布 Llama 3 8B

Meta 发布 Llama 3 8B 与 70B 两款模型,参数量分别为 8B 和 70B。 在 MMLU 基准上,8B 版本比 Llama 2 提升 5%,70B 版本提升 3%。

twitter关注列表2026-07-24#模型发布#技术
观察
04

Opus 5 性能大幅提升

在发布仅两个月内,Opus 5模型在ARC-AGI 3基准上从Opus 4.8的低于5%提升至超过30%,并在Artificial Analysis基准上以比Fable 5低26%的成本提供相当智能。

twitter关注列表2026-07-24#模型发布#技术突破
观察
05

OpenCode爆炸增长数据

Y Combinator 在播客中披露,OpenCode(开源替代 Claude Code 和 Codex 的 AI 编码工具)自年初起增长至 460 万周活用户、1300 万月活用户,年化收入约 4000 万美元,处理了 7 万亿 tokens,CEO Jay V 谈到 Anthropic 争议和 20 倍增长驱动因素。

twitter关注列表2026-07-24#行业动态#AI#开源
观察