01
通过将多台搭载8颗GPU的NVIDIA B200服务器经由RoCEv2 CX-7以太
通过将多台搭载8颗GPU的NVIDIA B200服务器经由RoCEv2 CX-7以太网互联,并采用PD disaggregation(流水线解耦)推理优化,配合vLLM开源引擎和Dynamo推理编排器,单GPU令牌吞吐量最高提升7倍,每百万令牌成本相应降低7倍。
值得跟进
围绕 基础设施 的精选动态、来源摘要和重要性判断。
通过将多台搭载8颗GPU的NVIDIA B200服务器经由RoCEv2 CX-7以太网互联,并采用PD disaggregation(流水线解耦)推理优化,配合vLLM开源引擎和Dynamo推理编排器,单GPU令牌吞吐量最高提升7倍,每百万令牌成本相应降低7倍。
MRC 已部署于 OpenAI 旗下所有超级计算机,包括 Oracle Abilene 和 Microsoft Fairwater,并通过 OpenCompute 项目向业界开源,方便开发者构建模型。
谷歌自2016年宣布“AI优先”战略后,持续在自研芯片、云平台、YouTube与深度AI研究等领域投入并取得显著回报,强化了Alphabet在AI产业中的基础设施与生态主导地位。该进展被《TIME》在其#TIME100Companies封面报道中作为AI驱动型企业转型的典型案例予以肯定。
Cloudflare 宣布正式支持 AI Agent 作为独立客户,允许 Agent 自主创建账户、支付订阅、注册域名并获取 API 令牌以部署代码。