发生了什么
Google DeepMind 发布 Gemini Omni Flash
为什么值得关注
这是一次把多模态输入、对话式视频编辑和实际产品分发同时落地的更新,值得查看原文示例以判断其生成质量和工作流可用性。
信息来源
以下内容来自公开来源,可打开原文继续核验。
Introducing Gemini Omni
Google DeepMind 发布 Gemini Omni,称其为可从任意输入生成内容的新模型,首发聚焦视频生成与编辑。官方表示,Gemini Omni Flash 已上线 Gemini app、Google Flow 和 YouTube Shorts,支持将图像、音频、视频和文本作为输入,生成基于 Gemini 现实世界知识的高质量视频,并可通过对话进行多轮视频编辑;后续还将支持图像和音频等输出模态。
打开原始来源 ↗Gemini 3.5 Flash
Google DeepMind 发布 Gemini 3.5 系列,并率先推出 3.5 Flash,定位为面向 agent 和 coding 的旗舰级模型。官方称其在多项基准上超过 Gemini 3.1 Pro:Terminal-Bench 2.1 为 76.2%,MCP Atlas 为 83.6%,GDPval-AA 为 1,656 Elo;在多模态理解 CharXiv Reasoning 上达到 84.2%,输出 token 速度则比其他 frontier models 快 4 倍。3.5 Flash 已可在 Gemini app、Google Search 的 AI Mode、Gemini API、Antigravity、Android Studio,以及 Google 的企业 agent 产品中使用;Google 还表示 3.5 Pro 正在内部使用,计划下月发布。
打开原始来源 ↗Gemini Omni 发布
Google DeepMind 在 Google I/O 相关发布中推出 Gemini Omni,称其是“从任何东西生成任何东西”的第一步,重点面向视频生成与编辑。该系统把 Gemini 的智能与生成媒体系统结合,支持通过自然语言修改风格、添加效果、替换环境、物体和动作,并可保持角色外貌、动作与光影一致;Gemini Omni Flash 已在 Gemini App、Flow by Google 和 YouTube Shorts 上线,几周后开放 API。
打开原始来源 ↗