Signal Feed

#多模态 主题信号

围绕 多模态 的精选动态、来源摘要和重要性判断。

动态列表

02

Runway Agent 在第三方评测中全面领先

Physion Labs 发布 Physion-Arc 1.0 基准测试,对 Runway、Luma、MiniMax、Kling、Utopia 和 TapNow 六款 AI 视频代理进行独立人类评估,使用 30 个电影提示和 16 个指标。Runway Agent 2.0 在叙事连贯性、电影语言和制作质量三项核心维度全部排名第一。

twitter关注列表2026-07-17#评测#多模态#模型
观察
03

Claude Managed Agents 支持500个技能项目升级

Anthropic 在Claude 3系列推出2024年2月新特性,实现代理系统技能数量扩展至500项,增强自定义化程度。更新后的API参数文档显示请求头需包含新版本控制标识符v20240201。相较Claude 2的100技能限制,新版本实现10倍扩容空间,核心优化体现在事件触发策略更新与上下文处理模块重构。

twitter关注列表2026-07-17#技术更新#产品改进#多模态
观察
05

Kimi K3 终于来了,最强开源模型!

Moonshot AI 发布 Kimi K3 开源模型,参数量 2.8 万亿,支持 100 万 token 上下文及原生多模态。在 Frontend Code Arena 基准测试中获得 1679 分,超过 Claude Fable 5(1631 分)和 GPT‑5.6 Sol(1618 分),整体性能仅次于 Claude Fable 5...

twitter关注列表2026-07-17#开源#大模型#多模态
值得跟进
08

Inkling 开源

Mira Murati's Thinking Machines Lab released Inkling, a 975B‑parameter (41B active) open‑weights multimodal model with a 1M‑token context trained on 45T tokens, offering ...

twitter关注列表2026-07-15#技术突破#大模型#多模态
观察
09

Hy-Embodied-VLM-1.0 发布

Hy-Embodied-VLM-1.0 在 ModelScope 发布,采用 Apache 2.0 许可证。该模型总参数约 30B,每个 token 仅激活约 3B,在 38 个具身基准测试中排名第一 19 个、第二 11 个,平均性能较 Hy-Embodied-0.5 MoT-2B 提升 8.4%。

twitter关注列表2026-07-16#模型发布#多模态#开源
观察
10

Thinking Machines 发布 Inkling 模型

前 OpenAI CTO Mira Murati 创立的 Thinking Machines 发布了首个模型 Inkling,采用 MoE 架构,总参数 975B,激活参数 41B,支持 1M 上下文窗口,在 45T 数据上训练,原生支持文本、图像和音频多模态。同时提供激活参数 12B 的 Small 预览版,模型权重开源,后训练数据从 ...

twitter关注列表2026-07-16#技术#模型发布#多模态
值得跟进
13

Audex:30B总参音频MoE

NVIDIA发布Audex,一个30B总参数/3B活跃参数的音频-文本MoE模型,基于Nemotron-Cascade-2构建。它在BigBenchAudio(90.0)、Audio Entailment AudioCaps(95.6)和CMM(90.3)上取得高分,同时保持文本推理能力。模型覆盖音频理解、ASR、语音翻译、TTS、语音生...

twitter关注列表2026-07-07#模型发布#多模态#AI模型
观察
14

Beyond Language Modeling 论文 ICML spotlight

David Fan 等团队在 ICML spotlight 展示 Beyond Language Modeling 论文,研究了将视觉作为一等公民进行多模态预训练的方法,探索了 Transfusion-style 模型从头训练的设计空间,涉及视觉表示、数据、世界建模、架构和扩展行为等方面。

twitter关注列表2026-07-07#研究#多模态#模型发布
观察
16

NotebookLM 推出短视频摘要

Google NotebookLM 发布 Short Video Overviews 功能,可将上传的文档源材料自动生成 60 秒竖屏深度解析视频。该功能现已向 Google AI Ultra 和 Pro 订阅者在移动端和网页端开放,免费用户将随后获得访问权限。

twitter关注列表2026-06-30#产品发布#多模态#产品更新
观察
20

MOSS-Transcribe-preview-2B

MOSS 发布了 2.4B 参数的英语自动语音识别模型 MOSS-Transcribe-preview-2B,模型文件为单个 4.84GB 片段。模型在 Open ASR Leaderboard 上平均 WER 为 4.87;在 LibriSpeech test.clean 上 WER 为 1.21,test.other 为 2.84。其...

twitter关注列表2026-06-29#模型发布#技术更新#多模态
观察