OpenRouter 获1.13亿美元B轮融资
OpenRouter 宣布完成 1.13 亿美元 Series B 融资,由 CapitalG 领投。OpenRouter 表示,过去 6 个月其周 token 处理量从 5T 增长到 25T,增长 5 倍,反映 AI 使用正在从实验阶段转向生产环境。
围绕 基础设施 的精选动态、来源摘要和重要性判断。
OpenRouter 宣布完成 1.13 亿美元 Series B 融资,由 CapitalG 领投。OpenRouter 表示,过去 6 个月其周 token 处理量从 5T 增长到 25T,增长 5 倍,反映 AI 使用正在从实验阶段转向生产环境。
DAIR.AI 转引一篇关于长上下文 agent 的论文,提出让语言模型在运行中加入类似“睡眠”的离线巩固步骤:模型会周期性地对最近上下文做 N 次离线递归前向,然后把结果写入 state-space blocks 的 persistent fast weights,并清空 KV cache。这样可把额外计算挪到“睡眠”阶段,同时保持“清...
Cloudflare 在 Agents Week 中将内置特性开关服务 Flagship 推出 public beta,可直接集成到已部署在 Cloudflare Workers 上的应用,或在应用前部署一个 Worker 来做 feature flipping,无需额外配置。Flagship 提供少于 10 个方法的 binding A...
Xiaomi MiMo 宣布 MiMo-V2.5 Series API pricing 永久下调,较此前价格最高降低 99%,并改为所有 context lengths 统一定价。MiMo Token Plans 也升级为同价可获得 5–8 倍更多可用 tokens,计费规则更简单透明;现有 Token Plan credits 将全部重...
OpenRouter 表示其当前年处理量已达到 1.5 quadrillion tokens/yr。Deedy 给出的对比是,这一 token run rate 约为 Google APIs 的 15%至30%、OpenAI 的 20%至40%、以及 Microsoft Azure Foundry 的 50%以上;同时称这一规模较一年前 ...
OpenRouter 宣布完成由 CapitalGVC 领投的 1.13 亿美元 Series B 融资。过去 6 个月,其周度 token 处理量从 5T 增长到 25T,官方将这一增长归因于 AI 从实验阶段加速转向生产环境。
CMU 和 UMD 研究者在论文《Language Models Need Sleep》中提出,模型在处理深度推理任务时不只是受限于内存容量,还需要通过多次 forward pass 将当前 context 巩固成更可用的内部表示。研究使用 Rule 110 这种图灵完备的 toy task 做实验,方法是在清除 KV cache 前让模...
Google DeepMind 表示,SynthID 已为超过 1000 亿份内容加水印,Gemini 中的 SynthID verification 到目前为止已被使用 5000 万+ 次,用于判断媒体是否由 AI 生成。Google DeepMind 还与 OpenAI、ElevenLabs、Kakao 合作,将 SynthID 水印...
Huawei 提出 Tau Scaling / τ Scaling 设计方法,试图在美国出口管制和 EUV 工具受限的情况下,通过减少信号传输距离来提升芯片性能,而不只依赖更小制程。其方案包含 LogicFolding,把相关逻辑块折叠得更近,以缩短关键连线、降低电阻和寄生电容,并将这种“减少 τ 延迟”的思路扩展到晶体管、版图、架构、软...
Together AI 开源了 OSCAR,这是一套面向长上下文服务的 attention-aware 近 2-bit KV Cache 量化系统。OSCAR 使用 query covariance 旋转 keys、使用 score-weighted value covariance 旋转 values,以把量化噪声尽量投向注意力不敏感的...
华为发布名为“LogicFolding”的芯片设计思路,论文主张将芯片进步的衡量重点从“晶体管更小”转向“全机时延更少”,并提出 τ scaling 概念,把信号在长连线、存储路径、芯片间互连和软件通信中的延迟纳入统一优化目标。该方案通过将有协同关系的逻辑电路垂直堆叠,并用细间距 hybrid bonds 连接,以缩短信号路径、降低 cr...
Alibaba 和 Nanjing Univ 的论文提出 RTPurbo,称可在仅进行轻量适配的情况下,将百万 token prefill 速度相对 FlashAttention-2 提升最高 9.36 倍,并将 decoding 速度提升约 2 倍。论文认为标准 full-attention LLM 已包含隐藏的稀疏结构,因此无需从头重...
Reuters 报道称,DeepSeek 将其旗舰 V4-Pro 的价格下调改为永久生效,API 价格降至原来的 25%,即永久降价 75%。报道指出,DeepSeek 未确认更好的 Huawei Ascend 950 供给是否直接导致此次降价,但时间点显示其成本曲线正在下行,且中国 AI 技术栈正从受限的 Nvidia 芯片转向 Hua...
UCSF 研究人员筛查了老年海马体中所有发生变化的蛋白,发现 FTL1 是最显著的候选蛋白,它是医生在常规血检中就会测到的 ferritin 亚基。研究在老年小鼠中移除 FTL1 后,突触重新生长、记忆恢复;反向实验中,在年轻小鼠中提高 FTL1 会让它们表现出衰老。论文发表在 Nature Aging,机制是过量 ferritin 使铁...
SemiAnalysis 在最新分析中指出,美国下一波 AI 训练集群的供电规划里,园区内燃气发电已不再是临时过渡方案,而是多个园区未来数年的实际发电架构。该判断意味着对电力市场、天然气外输能力,以及 Permian 和 Haynesville 的设备租赁需求的影响,可能比多数股票模型反映的更大。SemiAnalysis 还列出相关供应链...
Anthropic 公布 Project Glasswing 的初步进展:该项目上月启动,目标是在更强 AI 模型被用于攻击前,提前加固全球关键软件。Anthropic 与约 50 家合作伙伴使用 Claude Mythos Preview,已在最重要的软件中发现超过一万处高危或严重漏洞;部分合作伙伴表示漏洞发现速度提升超过 10 倍。C...
ModelBest、Tsinghua Univ 和 OpenBMB 社区发布并开源了 BitCPM-CANN,这是全球首个完全在中国自研 AI 基础设施上训练的 1.58-bit 三值 LLM。该模型的全流程训练管线从量化算子、算法到完整框架均原生运行在 Huawei Ascend 910B NPU 上,开源版本覆盖 0.5B–8B 全模...
Marc Andreessen 转发 Greg Lukianoff 的帖子,介绍由 Harvard 的 Rhea Karty 开发、并由 @cosmos_inst 和 @TheFIREorg 支持的 Replication Radar。该项目提出用 AI 抓取论文、书籍、主张、引用、重复验证、撤稿、旧争论和失败结果,检测某个领域是否建立在...
Nous Research 发布了一项研究,在 1.7B 参数的 byte-level 预训练管线中,逐一模拟 7 个关于“为什么 subword LLM 优于 byte-level LLM”的假设,涵盖计算效率、子词边界与位置的结构先验,以及优化目标。研究在 fineweb-edu 上、基于 LLaMA-3 架构完成验证,其中有 68M...
Menlo 相关人士称,Modal 是其两年前最想投资的早期公司之一;该公司当时估值约 1 亿美元。Modal 联合创始人 Erik Bernhardsson 公开宣布完成 3.55 亿美元 Series C 融资,估值达到 46.5 亿美元,由 General Catalyst 和 Redpoint 领投。发言还提到,Modal 正被 ...