Gemini Omni 团队谈 Omni:从视频生成走向“任意输入、任意创作”

Gemini Omni 团队谈 Omni:从视频生成走向“任意输入、任意创作”

Google DeepMind 团队介绍 Gemini Omni 及首个版本 Omni Flash:把视频生成与编辑变成对话式创作,并把它视为更广泛多模态“任意输入、任意创作”的起点。

Omni 先从“对话式视频创作”切入

Google 将 Gemini Omni 描述为能够从多种输入出发进行创作的新模型体系,首个公开版本 Gemini Omni Flash 重点落在视频生成与编辑。核心体验不是让创作者在多个独立工具之间切换,而是尽量把“生成—修改—继续调整”收敛到同一段对话中。

文章采访了三位 Google DeepMind 团队成员:研究科学家 Mohammad Babaeizadeh、产品经理 Anish Nangia 和研究工程师 Sarah Xu。他们讨论了 Omni 的长期方向、为什么首先选择视频,以及团队如何理解创作者真正需要的交互方式。

重点在可持续操控,而不是一次性出图

文章中的演示刻意选择了换发型、把人物变成树懒、把猫放进场景等轻松例子。它们传递的产品信号比“某个单次生成效果”更重要:用户可以围绕同一个创作对象持续提出修改,模型需要在多轮过程中保留意图并响应新的约束。

这篇内容并不是一份模型基准评测,因此不应该被包装成“性能排名”。更准确的理解是,Google 正在把多模态生成从一次性调用推进到连续、可操控的创作工作流。

AI 智库判断

对创作者和工具产品而言,下一阶段的竞争点会从“第一次生成有多惊艳”逐步转向“能否稳定地改、连续地改、跨输入类型地改”。如果上下文连续性和可操控性做得足够好,模型才更可能进入真实生产流程,而不是停留在演示层。

本文为 AI 智库基于 Google DeepMind on The Keyword 原文整理的编辑摘要;涉及产品能力、价格或可用性时,请以原始来源的最新说明为准。 Google DeepMind on The Keyword