一句话判断
与公开的模型路由方案相比,Cursor 提供了基于真实线上数据训练、缓存感知的具体实现和量化效果对比,值得点开原文了解技术细节。
核心信息
Cursor 团队推出 Cursor Router,基于 60 万+ 线上请求训练的分类器,根据查询内容、上下文、任务复杂度、领域自动选择模型,在保持用户满意度的同时将成本降低 30-60%。Intelligence 模式用户满意度接近 Fable,成本低约 60%;Balance 模式满意度高于 Opus 4.8,成本低约 36%。单次 commit 成本:Intelligence $6.76、Balance $4.63,对比 Fable 5 的 $12.69 和 Opus 4.8 的 $7.34。
原始内容
相关动态
Vera Rubin NVL72 vs GB200 NVL72? Inference TCO & Architecture Analysis
Semianalysis 对 NVIDIA 的 Vera Rubin NVL72 和 GB200 NVL72 进行了推理总拥有成本和架构对比分析,涉及 Rubin LUT Based Tensor Core、Feynman 设计、机架规模性能、每兆瓦性能、每美元性能以及 PyTorch、vLLM、OpenAI Triton 等软件改进。
AIHOT月活60万
AIHOT月活突破60万,站点完成UI升级,交互更流畅。后端实现数百信源5分钟抓取、数据清洗、结构化、预筛选、聚类展示,至少10个大模型环节,累计数百轮数据回测与标注。创始人表示永久免费,未来将持续开发新功能。
Claude安全插件发布
Anthropic 发布 Claude Security 插件(beta 版) for Claude Code,可在终端通过一行命令实现代码提交前的漏洞扫描。插件采用多智能体协作进行架构盘点、威胁建模、漏洞挖掘和独立验证,提供 Medium、High、Max 三种深度,其中 Max 模式会推翻自身发现以减少误报。输出仅提供漏洞说明和补丁方...
GPT-Live延迟评测显示一致性提升
Agora Media Lab 测量了 GPT-Live 的端到端延迟,发现其最大改进来自一致性而非原始速度。中位数响应仅改进 205ms,但延迟标准差从 489ms 降至 104ms。
Yann LeCun 转发介绍 Patch Policy 架构
Gaoyue Zhou 团队提出 Patch Policy 架构,允许基于 transformer 的策略直接使用密集视觉 token,无需大语言模型,在操纵任务中比微调 7B VLA 性能高 18%,参数量仅为其 0.7%。