← 返回精选动态
精选动态

HF science team 异步 RL 权重同步优化

Hugging Face 发布 TRL 异步 RL 权重同步优化(100x)

更新于 2026年05月28日 23:50 1 条公开来源

发生了什么

Hugging Face 发布 TRL 异步 RL 权重同步优化(100x)

为什么值得关注

值得点开原文查看实现细节,尤其是稀疏权重导出、Bucket 分发和 disaggregated training 的工程路径,适合评估是否可迁移到自有 RL 训练栈。

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

HF science team 异步 RL 权重同步优化

twitter关注列表 2026年05月28日 21:23

clem 🤗 介绍了 Hugging Face science team 在 TRL 中实现的异步 RL 权重同步优化:每个 RL step 不再同步完整权重,只导出变化的元素为稀疏 safetensors 文件,通过 Hugging Face Bucket 分发给 vLLM。对于 Qwen3-0.6B,单步传输载荷从 1.2 GB 降到 20–35 MB,带宽开销约降低 100 倍。文中还展示了一个完整的 disaggregated training:trainer 跑在一台机器上,vLLM 跑在 Hugging Face Space,Wordle 环境跑在另一 Space,权重通过 Hub bucket 流转,不需要 shared cluster、RDMA、VPN 或跨云 NCCL,只需 HTTPS 和 bucket。

打开原始来源 ↗
← 返回精选动态