Gemini Omni 1.1 Flash 将 AI 视频延长至 40 秒并支持 4K 超分

新闻摘要
谷歌已推出 Gemini Omni 1.1 Flash,这是其原生多模态视频生成与编辑模型的更新生产版本,新增三项核心能力:场景延长至 40 秒、通过两帧关键帧控制首尾帧以引导镜头运动,以及 4K 超分输出。此次更新于太平洋时间 2026 年 8 月 28 日至 29 日发布,将 Omni 从一次性视频生成器推向谷歌所称的"可导演"创作工具,让开发者和工作室能够逐镜头地掌控创作。
Omni 1.1 Flash 的新功能
核心功能是场景延长。此前版本的 Omni 在延续片段时只能参考片段的最后一帧,而 1.1 Flash 更新在用户要求模型延续场景时,每次都会分析最多 10 秒的前置上下文。每次调用生成的延长片段约为 3 到 10 秒,并可按 10 秒为一块进行堆叠,直到片段达到 40 秒的上限。延长只能追加到片段末尾——模型无法在开头之前添加画面,也无法在现有序列中间插入新素材。
首尾帧控制允许用户提供一张起始图像和一张结束图像,在提示词中以 <FIRST_FRAME> 和 <LAST_FRAME> 标记,让模型生成两者之间的所有内容。谷歌表示,这是实现环绕镜头运动、推拉变焦和无缝循环等效果的预期方式,因为模型是在求解一个明确的视觉终点,而不是从单一起点自由外推。
另一项相关功能是视频参考,允许将最多三段短视频参考片段(每段上限为三秒)输入生成过程,帮助模型在不同镜头之间保持角色外观或场景视觉风格的一致性。参考片段中嵌入的音频会被模型忽略。
4K 超分与草稿工作流
输出分辨率可配置为 360p、720p(默认)、1080p 和 4K。谷歌已明确表示,1080p 和 4K 输出是从模型的原生生成结果超分而来,而非以这些分辨率原生渲染。为支持更快的迭代,360p 草稿预览的渲染速度最高可提升 60%,成本约为标准 720p 档位的三分之一,让创作者可以低成本地先粗剪出序列,再投入全分辨率渲染。
定价与技术限制
Gemini Omni 1.1 Flash 按 token 计费:输入 token 为每 100 万 1.50 美元,文本输出为每 100 万 9.00 美元,视频输出为每 100 万 17.50 美元,谷歌将其换算为大约每秒 720p 视频 0.10 美元。没有免费层,也没有预留吞吐量选项——只能通过 Gemini API 的付费层访问。
该模型目前缺少其他生成系统中常见的若干控制项:没有系统指令、temperature 或 top_p 采样控制、停止序列或负面提示词。不支持语音编辑和音频参考。谷歌指出,英文提示词已获得充分支持和测试,而其他语言的表现尚未经过正式评估。
模型生成的每个片段都会打上 SynthID 水印,这是一种不可见的标记,观众无法看到,但可以通过程序检测来验证视频是否为 AI 生成。
可用性与发布计划
Gemini Omni 1.1 Flash 现已通过 Google AI Studio 中的 Gemini API 以及 Gemini Enterprise Agent Platform 提供。它还在 Google Flow 中面向 AI Plus、Pro 和 Ultra 层级的订阅用户全球推出,场景延长功能将专门面向这些订阅用户直接在 Gemini 应用中上线。
行业反响与早期采用者
谷歌表示,多家公司已在公开发布前集成或测试了更新后的模型。Adobe 已将其集成到 Adobe Firefly 中,Figma 旗下 Weave 产品的创意总监表示,此次更新"让团队从生成视频走向真正导演视频"。GMI Cloud 强调了该模型在教育内容制作方面的可靠性,Runway 的首席创意官则指出新控制项能多么顺畅地融入现有制作工作流。谷歌列出的用例涵盖创意制作工具、媒体编辑软件、房地产展示视频和教育内容平台,作为开发者基于该模型构建应用的目标场景。