OpenCode爆炸增长数据
Y Combinator 在播客中披露,OpenCode(开源替代 Claude Code 和 Codex 的 AI 编码工具)自年初起增长至 460 万周活用户、1300 万月活用户,年化收入约 4000 万美元,处理了 7 万亿 tokens,CEO Jay V 谈到 Anthropic 争议和 20 倍增长驱动因素。
围绕 AI 的精选动态、来源摘要和重要性判断。
Y Combinator 在播客中披露,OpenCode(开源替代 Claude Code 和 Codex 的 AI 编码工具)自年初起增长至 460 万周活用户、1300 万月活用户,年化收入约 4000 万美元,处理了 7 万亿 tokens,CEO Jay V 谈到 Anthropic 争议和 20 倍增长驱动因素。
Ramp 测试了 Grok 4.5 等模型在 150k 张真实发票上的表现,Grok 4.5 获得最高完美提取率,击败了 Gemini Flash 3.6、GPT 5.6 Terra 和 Sonnet 5。
Grok 已集成到 Google Workspace,通过侧边栏插件在 Sheets、Slides、Docs 中提供数据解释、公式书写、演示生成、文档起草等功能,无需频繁切换标签页,组织可批量部署。
Anthropic 发布了 Claude Opus 5,官方称其为 '思慎且主动的模型',性能接近 Claude Fable 5 但价格仅为后者一半。Opus 5 在 frontier-bench v0.1(43.3%)、gdpval-aa v2(1861)、arc-agi-3(30.2%)、zapier automationbench(...
Anthropic 发布 Claude Opus 5,定价 $5/$25 每百万 token(与 Opus 4.8 相同),仅为 Fable 5 的一半,但在绝大多数基准测试中击败了 Fable 5。它支持五种努力设置,默认启用推理,并在编码、操作计算机等经济价值高的任务上表现更强,具有自主验证和恢复能力。
Cursor平台上线Claude Opus 5模型,在CursorBench基准测试中得分66.7,与Fable 5的66.5分持平,但价格仅为后者一半(输入5美元、输出25美元每百万token),且支持零数据保留,而Fable 5仍保留数据30天。
Claude 官方发布 Opus 5 模型,称其 thoughtful and proactive,接近 Fable 5 的前沿智能,价格仅为后者一半。
Claude 发布 Opus 5,声称接近 Fable 5 的前沿智能且价格仅为一半。Opus 5 在网络安全任务上强于 Opus 4.8,但远落后于 Mythos 5。该模型发布于所有付费计划和 API,定价与 Opus 4.8 相同,并提供 2.5 倍速度的 Fast 模式。
Anthropic 发布 Claude Opus 5,API 价格为每百万输入 Token 5 美元、输出 25 美元,与 Opus 4.8 相同,是 Fable 5 的一半。在 Frontier-Bench v0.1 上成绩是 Opus 4.8 的两倍多,CursorBench 3.2 上最高 Effort 与 Fable 5 差距不到...
黄仁勋开通Twitter账号并发表公开信,支持开源模型和开源生态,反对封禁中国顶尖开源模型,主张美国应通过开放模型、算力基础设施和生态应用保持AI领导力,而非保护少数巨头公司。
PRO-LONG方法通过保留所有过去动作的搜索日志,使编码代理在长期任务中更可靠。在ARC-AGI-3的25个隐藏规则游戏中,该方法将基础代理性能平均提升18个百分点,同时使用4.2到5.8倍更少的计费令牌。
论文提出 Harness Handbook 方法,通过将仓库围绕运行时行为重组并关联到源码位置,帮助编码代理找到更多需要编辑的代码点。在 Codex 和 Terminus-2 请求上,计划获胜率分别提升 10.0 和 18.9 个百分点,同时减少 token 使用 12.7% 和 8.6%。
吴恩达与Rohit Prasad开源OpenWorker,一个本地优先的桌面AI Agent,非聊天型,可自动分解任务并跨文件及工具(HubSpot、Slack、日历)交付成品(HTML报告、消息、日程),支持GPT、Claude、Gemini、Kimi、GLM、DeepSeek、Ollama等多种模型,实现模型无关,数据本地或可选LLM...
Genspark 推出 GenTeam,一个共享工作空间,支持人类与 AI 代理协作。该空间替代独立聊天会话,提供持久对话,可从市场添加编码、设计、营销等专业代理,也可创建自定义代理。代理基于前沿模型,全天候工作,并具备权限控制。
OpenRouter 在2025年1月至2026年7月间,token月使用量从2T增长至250T,18个月增长125倍。
该论文通过信息瓶颈视角,在5个基准测试、3种模型大小、18个测试中,比较了单agent、单agent遵循任务拆分、多agent系统的性能。发现多agent系统在信息传递紧凑完整时有效,尤其对弱模型,但当后续步骤需要精确早期细节时优势减弱或逆转。
DeepSeek泄露的投资者电话会显示,截至5月仅用2万张Hopper等效卡训练出一线模型,推理毛利率约85%,硬件10个月回本,10亿美元API营收即可覆盖研发。公司已锁定1.6万张华为950卡,并将TileLang编译器生态迁移至华为,梁文锋断言CUDA护城河一年内瓦解。
本次早报包含10条AI新闻:Anthropic升级Claude语音模式支持Opus与Sonnet;梁文锋透露DeepSeek将Agent持续学习作为下一目标,承认算力与数据约束;阿里开源Agent评测框架skill-up,内部将1200行代码收敛为声明式;Andrew Ng推出开源智能体OpenWorker;此外还有关于Agent PR频...
Fugu发布Fugu-Ultra v1.1,性能最高提升7.9分,尤其在ProgramBench和Terminal Bench 2.1上,价格不变。
Mark Ajzenstadt 分享一个团队通过先构建知识图谱再使用AI的方法,在3.5个月内完成FedEx供应商平台重建,AI生成90%代码,合并122个PR,计算成本200美元/月。