发生了什么
Tencent 发布 Hy3(295B MoE, 21B active, 256K context)
为什么值得关注
该模型以较小活跃参数实现与超大模型竞争,其抗幻觉改进和稳定工具调用是差异点,值得进一步阅读原文了解细节。
信息来源
以下内容来自公开来源,可打开原文继续核验。
01
Tencent 发布 Hy3 模型于 Hugging Face
腾讯在 Hugging Face 发布 Hy3 模型,295B MoE 架构,21B 活跃参数,256K 上下文;在推理、编码和 agent 任务上声称与 2-5 倍大的旗舰模型相当,并具有抗幻觉改进和稳定工具调用能力。
打开原始来源 ↗