一句话判断
该论文提出超网络生成LoRA适配器的新范式,并发现缩放定律——模型越大生成的泛化越好,与传统微调不同。
核心信息
Nace AI研究团队发布论文,提出使用超网络将知识注入大语言模型,无需修改模型核心参数。方法通过超网络将自然语言事实转换为LoRA权重,附加在冻结的模型上,且最强结果为目标模型越大泛化越好。
原始内容
相关动态
ClaudeDevs 更新缩放工具,Chartography 测试成绩提升
ClaudeDevs 更新了缩放工具 Cookbook,让 Claude 模型在 Chartography 基准测试(100 道难题)上实现提升,Fable 5 准确率从 29% 提升至 73%,Sonnet 5 从 13% 提升至 44%。
FLUX 3 将极大影响机器人智能和学习
Black Forest Labs 发布 FLUX 3 统一多模态模型,支持图像、视频、音频和动作预测。其 Self-Flow 架构使机器人微调数据减少一半,相比早期模仿视频实验,机器人训练数据减少 10 倍,通过大规模视频预训练隐式学习物理规律。
Black Forest Labs 发布 FLUX 3 统一多模态模型
Black Forest Labs 发布 FLUX 3,采用统一架构同时处理图像生成、视频、原生音频和机器人动作预测。视频已开放早期访问,后续将开放权重,并与 mimic、Audi 合作在真实机器人上运行。团队认为物理世界智能与内容创作可共享同一视觉基础模型。
Sonilo 发布音频模型 1.0
Sonilo 发布了视频原生音频模型 Sound Effects 1.0,可自动从视频同步音频,支持三分钟输入并可根据文本生成独立音频素材。该模型与现有的 Video2Music 和 Text2Music 工具集成,Fal 独家提供 Day Zero API,并在基准测试中声称超越领先模型。
Ant Ling 发布 Ling-3.0-flash 混合推理 MoE 模型
Ant Ling 团队发布 Ling-3.0-flash 混合推理 MoE 模型,124B 总参数,每个 token 仅激活 5.1B 参数,在多数基准测试中匹敌或超越其 1T 参数的旗舰模型。