一句话判断
与公开信息相比,本文首次详细对比了 Rubin 和 GB200 在推理 TCO 和架构上的具体差异,值得原文阅读以获取数据支撑。
核心信息
Semianalysis 对 NVIDIA 的 Vera Rubin NVL72 和 GB200 NVL72 进行了推理总拥有成本和架构对比分析,涉及 Rubin LUT Based Tensor Core、Feynman 设计、机架规模性能、每兆瓦性能、每美元性能以及 PyTorch、vLLM、OpenAI Triton 等软件改进。
原始内容
相关动态
美国政府指控 中国模型蒸馏技术 & 深度寻展低价战策略
美国特朗普助理指控中国模型通过'蒸馏'技术开发,网络舆论普遍嘲讽;梁文锋分享4小时投资人会议记录,揭露深度寻展通过价格低于成本供下 convaincu AGI的核心策略,同时强调企业需专注技术突破而非次要产品化。
Cursor推出智能模型路由Router
Cursor 团队推出 Cursor Router,基于 60 万+ 线上请求训练的分类器,根据查询内容、上下文、任务复杂度、领域自动选择模型,在保持用户满意度的同时将成本降低 30-60%。Intelligence 模式用户满意度接近 Fable,成本低约 60%;Balance 模式满意度高于 Opus 4.8,成本低约 36%。单次...
AIHOT月活60万
AIHOT月活突破60万,站点完成UI升级,交互更流畅。后端实现数百信源5分钟抓取、数据清洗、结构化、预筛选、聚类展示,至少10个大模型环节,累计数百轮数据回测与标注。创始人表示永久免费,未来将持续开发新功能。
Claude安全插件发布
Anthropic 发布 Claude Security 插件(beta 版) for Claude Code,可在终端通过一行命令实现代码提交前的漏洞扫描。插件采用多智能体协作进行架构盘点、威胁建模、漏洞挖掘和独立验证,提供 Medium、High、Max 三种深度,其中 Max 模式会推翻自身发现以减少误报。输出仅提供漏洞说明和补丁方...
GPT-Live延迟评测显示一致性提升
Agora Media Lab 测量了 GPT-Live 的端到端延迟,发现其最大改进来自一致性而非原始速度。中位数响应仅改进 205ms,但延迟标准差从 489ms 降至 104ms。