← 返回精选动态
精选动态

Nous Research 发布 Token Superposition Train

Nous Research 发布 Token Superposition Training(TST),一种在模型预训练阶段通过对 token 进行分组处理的技术,在不改变模型架构和训练数据的前提下,实现了 2-3 倍的训练速度提升。该技术已在 270M、600M、3B 密集模型和 10B-A1B 稀...

更新于 2026年05月14日 11:11 2 条公开来源

发生了什么

Nous Research 发布 Token Superposition Training(TST),一种在模型预训练阶段通过对 token 进行分组处理的技术,在不改变模型架构和训练数据的前提下,实现了 2-3 倍的训练速度提升。该技术已在 270M、600M、3B 密集模型和 10B-A1B 稀疏模型上验证,由 @bloc97_、@gigant_theo 和 @theemozilla 团队主导。

为什么值得关注

展示了 LLM 预训练效率优化的重要技术突破,对 AI 开发者具有重要参考价值

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

Nous Research 发布 Token Superposition Train

twitter关注列表 2026年05月14日 10:48

Nous Research 发布 Token Superposition Training(TST),一种在模型预训练阶段通过对 token 进行分组处理的技术,在不改变模型架构和训练数据的前提下,实现了 2-3 倍的训练速度提升。该技术已在 270M、600M、3B 密集模型和 10B-A1B 稀疏模型上验证,由 @bloc97_、@gigant_theo 和 @theemozilla 团队主导。

打开原始来源 ↗
02

Token Superposition Training (TST) 是一种新的 L

twitter关注列表 2026年05月14日 01:09

Token Superposition Training (TST) 是一种新的 LLM 预训练方法,通过在训练前期使用连续 token 袋预测技术,在不改变模型架构、优化器、分词器或训练数据的情况下,实现了 2-3 倍的训练时间加速,已在 270M 到 10B 参数规模的模型上验证。

打开原始来源 ↗
← 返回精选动态