InklingMoE模型发布
Thinkymachines 发布开源 MoE 模型 Inkling,总参数 975B、激活参数 41B、上下文长度 1M,支持文本、图像、音频的可控推理。
围绕 多模态 的精选动态、来源摘要和重要性判断。
Thinkymachines 发布开源 MoE 模型 Inkling,总参数 975B、激活参数 41B、上下文长度 1M,支持文本、图像、音频的可控推理。
Physion Labs 发布 Physion-Arc 1.0 基准测试,对 Runway、Luma、MiniMax、Kling、Utopia 和 TapNow 六款 AI 视频代理进行独立人类评估,使用 30 个电影提示和 16 个指标。Runway Agent 2.0 在叙事连贯性、电影语言和制作质量三项核心维度全部排名第一。
Anthropic 在Claude 3系列推出2024年2月新特性,实现代理系统技能数量扩展至500项,增强自定义化程度。更新后的API参数文档显示请求头需包含新版本控制标识符v20240201。相较Claude 2的100技能限制,新版本实现10倍扩容空间,核心优化体现在事件触发策略更新与上下文处理模块重构。
Moonshot AI's Kimi K3 is a 2.8‑trillion‑parameter multimodal model with a native 1‑million‑token context window, using a sparse expert system that activates only 16 of it...
Moonshot AI 发布 Kimi K3 开源模型,参数量 2.8 万亿,支持 100 万 token 上下文及原生多模态。在 Frontend Code Arena 基准测试中获得 1679 分,超过 Claude Fable 5(1631 分)和 GPT‑5.6 Sol(1618 分),整体性能仅次于 Claude Fable 5...
SenseNova 团队推出 SenseNova-U1-Infographic-V3 模型,这是一个基于 8B 参数 MoT 检查点,采用原生多模态 NEO-unify 架构。该模型在 T2I 任务上性能优于 Qwen-Image-2.0 和 Z-Image,在 BizGenEval + IGenBench 基准测试中排名更前。模型支持 ...
Google 发布 Gemini Omni Flash 多模态模型,在 Artificial Analysis 视频排行榜上文本到视频和图像到视频均位居第一,击败 ByteDance 的 Seedance 2.0。模型支持文本、图像、视频输入,生成 720p 24FPS 3-10 秒视频,定价 $0.10/秒,已通过 Gemini API...
Mira Murati's Thinking Machines Lab released Inkling, a 975B‑parameter (41B active) open‑weights multimodal model with a 1M‑token context trained on 45T tokens, offering ...
Hy-Embodied-VLM-1.0 在 ModelScope 发布,采用 Apache 2.0 许可证。该模型总参数约 30B,每个 token 仅激活约 3B,在 38 个具身基准测试中排名第一 19 个、第二 11 个,平均性能较 Hy-Embodied-0.5 MoT-2B 提升 8.4%。
前 OpenAI CTO Mira Murati 创立的 Thinking Machines 发布了首个模型 Inkling,采用 MoE 架构,总参数 975B,激活参数 41B,支持 1M 上下文窗口,在 45T 数据上训练,原生支持文本、图像和音频多模态。同时提供激活参数 12B 的 Small 预览版,模型权重开源,后训练数据从 ...
阿里通义实验室发布Qwen-Audio-3.0-Realtime实时语音交互模型,具备高表现力共情对话、流畅双工交互和Agentic工具调用能力,在Artificial Analysis评测的Speech Reasoning子项中位列第一。
Meta发布首个自研图像生成模型Muse Image,将替代此前依赖的Midjourney和Black Forest Labs。该模型支持编辑、生成、删除对象等功能,消费者免费使用,高级用户需订阅Meta One。内部测试中Muse Image表现优于Nano Banana 2但落后于GPT Image 2。
NVIDIA发布Audex,一个30B总参数/3B活跃参数的音频-文本MoE模型,基于Nemotron-Cascade-2构建。它在BigBenchAudio(90.0)、Audio Entailment AudioCaps(95.6)和CMM(90.3)上取得高分,同时保持文本推理能力。模型覆盖音频理解、ASR、语音翻译、TTS、语音生...
David Fan 等团队在 ICML spotlight 展示 Beyond Language Modeling 论文,研究了将视觉作为一等公民进行多模态预训练的方法,探索了 Transfusion-style 模型从头训练的设计空间,涉及视觉表示、数据、世界建模、架构和扩展行为等方面。
Krzysztof Geras 团队在 Nature Communications 发表研究,利用基础 AI 模型 Kestrel 从 4 亿病理切片中学习组织模式,结合常规临床数据构建乳腺癌复发风险测试,准确率约 71%。
Google NotebookLM 发布 Short Video Overviews 功能,可将上传的文档源材料自动生成 60 秒竖屏深度解析视频。该功能现已向 Google AI Ultra 和 Pro 订阅者在移动端和网页端开放,免费用户将随后获得访问权限。
Google 在 Gemini API 和 AI Studio 中发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两种生成式媒体模型。Nano Banana 2 Lite 生成图像速度低于 4 秒,价格 0.034 美元/千张;Omni Flash 在视频编辑上达到 SOTA,价格为 0.10 美元/秒...
Google 发布两个新模型:Nano Banana 2 Lite (GA) 和 Gemini Omni Flash (Preview)。Nano Banana 2 Lite 是迄今最快的 Gemini 图像模型,生成文本到图像仅需4秒,定价每千分辨率图像0.034美元;Gemini Omni Flash 支持多模态推理与视频生成,可通过...
Google AI 宣布推出 Nano Banana 2 Lite,这是最快速经济的 Gemini 图像模型,文本到图像输出低于 4 秒,现可通过 Gemini API 和 Google AI Studio 使用,并将逐步集成到 NotebookLM、Google Search 等产品中。同时,Gemini Omni Flash 进入公开...
MOSS 发布了 2.4B 参数的英语自动语音识别模型 MOSS-Transcribe-preview-2B,模型文件为单个 4.84GB 片段。模型在 Open ASR Leaderboard 上平均 WER 为 4.87;在 LibriSpeech test.clean 上 WER 为 1.21,test.other 为 2.84。其...