Gemini Omni 1.1 Flash 將 AI 影片延長至 40 秒並支援 4K 升頻

新聞摘要
Google 推出了 Gemini Omni 1.1 Flash,這是其原生多模態影片生成與編輯模型的更新生產版本,新增三項主要功能:場景延長至 40 秒、首尾幀控制(可在兩個提供的關鍵幀之間引導運鏡),以及 4K 升頻輸出。此次更新於太平洋時間 2026 年 8 月 28 至 29 日宣布,將 Omni 從一次性影片生成器推向 Google 所稱的「可導演」創作工具,讓開發者和工作室能夠逐鏡引導創作。
Omni 1.1 Flash 的新功能
核心功能是場景延長。早期版本的 Omni 在延續片段時只能查看片段的最後一幀,而 1.1 Flash 更新在使用者要求模型延續場景時,每次會分析最多 10 秒的先前上下文。延長內容以每次呼叫約 3 至 10 秒的增量生成,並可以 10 秒為單位堆疊,直到片段達到 40 秒的上限。延長只能附加在片段末尾——模型無法在開頭之前添加畫面,也無法在現有序列中間插入新素材。
首尾幀控制讓使用者提供一張起始影像和一張結束影像,在提示詞中標記為 <FIRST_FRAME> 和 <LAST_FRAME>,然後由模型生成兩者之間的所有內容。Google 表示,這是實現環繞運鏡、推拉變焦和無縫循環等效果的主要方式,因為模型是在朝特定的視覺終點求解,而不是從單一起點自由推斷。
相關功能「影片參考」允許將最多三段短片(每段上限 3 秒)輸入生成流程,幫助模型在不同鏡頭之間保持角色外觀或場景視覺風格的一致性。參考片段中嵌入的音訊會被模型忽略。
4K 升頻與草稿工作流程
輸出解析度可設定為 360p、720p(預設值)、1080p 和 4K。Google 明確表示,1080p 和 4K 輸出是從模型的原生生成結果升頻而來,而非以這些解析度原生渲染。為了支援更快速的迭代,360p 草稿預覽的渲染速度最高可快 60%,成本約為標準 720p 層級的三分之一,讓創作者能以低成本先粗略完成一段序列,再投入全解析度渲染。
定價與技術限制
Gemini Omni 1.1 Flash 按權杖計費:輸入權杖每 100 萬個 1.50 美元,文字輸出每 100 萬個 9.00 美元,影片輸出每 100 萬個權杖 17.50 美元,Google 換算後約為每秒 720p 影片 0.10 美元。沒有免費層級,也沒有預留吞吐量選項——只能透過 Gemini API 的付費層級存取。
該模型目前缺少其他生成系統中常見的多項控制:沒有系統指令、溫度或 top_p 採樣控制、停止序列或負向提示詞。不支援語音編輯和音訊參考。Google 指出,英文提示詞已獲得完整支援和測試,而其他語言的表現尚未經過正式評估。
模型產出的每個片段都會加上 SynthID 浮水印,這是一種觀眾看不見的隱形標記,但可透過程式方式偵測,以驗證影片是否由 AI 生成。
可用性與推出情況
Gemini Omni 1.1 Flash 現已可透過 Google AI Studio 中的 Gemini API 以及 Gemini Enterprise Agent Platform 立即使用。此版本也正在全球範圍內向 Google Flow 的 AI Plus、Pro 和 Ultra 層級訂閱者推出,而場景延長功能則會直接內建於 Gemini 應用程式中,提供給相同的訂閱者。
業界反應與早期採用者
Google 表示,已有數家公司在公開推出前整合或測試了更新後的模型。Adobe 已將其建置到 Adobe Firefly 中,Figma 旗下 Weave 產品的創意總監表示,此次更新「讓團隊從生成影片進一步走向真正導演影片」。GMI Cloud 強調了該模型在教育內容製作方面的可靠性,Runway 的創意長則指出新控制項能多麼順暢地融入現有製作工作流程。Google 列出的目標應用涵蓋創意製作工具、媒體編輯軟體、房地產展示影片和教育內容平台,供開發者在此模型上建構應用。