首页/ 资讯/ Gemini Omni 1.1 Flash 谷歌推出的 AI 视频生成模型

Gemini Omni 1.1 Flash 谷歌推出的 AI 视频生成模型

灵犀编辑部 2026-08-28 0 阅读

Gemini Omni 1.1 Flash是什么

Gemini Omni 1.1 Flash 是谷歌推出的 AI 视频生成模型,面向开发者和专业创作者,支持从 360p 快速预览到 4K 超高清的多档位输出。模型具备场景续写、首尾帧指定、视频参考等精细控制能力,可基于已有画面无缝扩展至 40 秒,通过引入最长 3 秒的参考片段保持角色与场景一致性。模型采用按秒计费模式,360p 约 0.2 元/秒,4K 约 2 元/秒。

<a class=Gemini Omni 1.1 Flash" loading="lazy" />

Gemini Omni 1.1 Flash的主要功能

  • 场景扩展 :基于已有视频从结尾无缝续写,每次 10 秒,单条累计最长可达 40 秒。
  • 指定首尾帧 :给定起始帧与结束帧,自动生成平滑转场与镜头运动。
  • 360p 快速预览 :生成速度比 720p 提升 60%,成本仅为三分之一,适合快速迭代。
  • 4K 高分辨率输出 :支持直接输出 1080p 或 4K 画质,满足专业制作需求。
  • 视频参考 :可引入最长 3 秒参考视频,精准保持场景背景与角色一致性。

Gemini Omni 1.1 Flash的技术原理

  • 长上下文视频理解 :模型将可分析的前置视频上下文从 1 秒扩展至 10 秒,通过更长的时序记忆捕捉画面中的动态细节与叙事逻辑,在续写时维持角色外观、光影环境和摄像机运动的一致性,避免片段衔接处的跳变。
  • 多模态输入融合 :系统同时处理文本提示、静态图像与视频片段三种模态,将文本语义映射为视觉指令,以图像定义关键帧构图,以参考视频锁定角色与场景风格,最终在统一的潜空间中生成连贯的时序内容。
  • 分辨率自适应生成 :采用同一套模型架构支持 360p 到 4K 的多档位输出,低分辨率模式下通过减少潜空间采样步数实现快速草稿,高分辨率模式下则启用增强的上采样与细节重建,让创作者先用低成本验证创意,再输出成片。
  • 时序一致性保持 :通过引入外部参考视频作为条件输入,模型在生成过程中将参考帧的特征嵌入与当前生成帧进行对齐,结合对前序 10 秒上下文的自注意力计算,抑制角色形变、背景漂移等时序不一致问题。

如何使用Gemini Omni 1.1 Flash

  • 获取访问权限 :访问 Google AI Studio 或接入 Gemini API,确保账号具备调用权限。
  • 选择目标模型 :在模型列表中选择 gemini-omni-1.1-flash 作为目标模型。
  • 准备输入素材 :根据需求准备输入素材:纯文本提示、起始/结束图像、参考视频(最长 3 秒)或已有视频片段。
  • 选择生成模式 :直接生成新视频、基于已有视频续写(需传入 previous_interaction_id )、或指定首尾帧生成过渡。
  • 设置输出分辨率 :先用 360p 快速预览验证创意,满意后再切换至 720p、1080p 或 4K 输出成片。
  • 执行生成 :调用 API 或点击生成按钮,等待模型返回视频结果。
  • 导出与后续编辑 :下载最终视频文件,或直接在 Adobe Firefly、Runway 等已集成平台中继续编辑。

Gemini Omni 1.1 Flash的核心优势

  • 4K 超高清输出 :支持直接生成 1080p 乃至 4K 分辨率视频,满足专业影视制作标准。
  • 场景无缝续写 :基于已有视频从结尾继续生成,每次 10 秒步进,单条叙事最长可延伸至 40 秒。
  • 首尾帧精准控制 :只需提供起始帧与结束帧,即可自动生成平滑转场与复杂镜头运动。
  • 360p 极速草稿 :预览模式生成速度提升 60%,成本仅为 720p 的三分之一,大幅降低迭代试错开销。
  • 视频参考一致性 :引入最长 3 秒的参考视频,即可精准锁定角色形象与场景风格,避免生成漂移。
  • 10 秒长上下文理解 :模型可回溯分析多达 10 秒的前置画面(此前仅 1 秒),续写时叙事与视觉连贯性显著增强。
  • 多模态灵活输入 :同时融合文本提示、静态图像与视频片段,让创意指令的表达维度更丰富。

Gemini Omni 1.1 Flash的项目地址

  • 项目官网 :https://blog.google/innovation-and-ai/technology/developers-tools/build-with-gemini-omni-1-1-flash/

Gemini Omni 1.1 Flash的同类竞品对比

对比维度 | Gemini Omni 1.1 Flash | Runway (Gen-3/Gen-4 系列)

>
对比维度 Gemini Omni 1.1 Flash Runway (Gen-3/Gen-4 系列)
开发商 Google DeepMind Runway ML
最高分辨率 4K 1080p(主流版本)
累计生成时长 最长 40 秒(原生支持扩展) 单次通常 10–16 秒
场景续写 原生支持,10 秒步进无缝扩展 需借助外部工具拼接
首尾帧控制 原生支持,自动生成平滑过渡与运镜 支持 Image to Video
参考视频一致性 最长 3 秒参考视频,精准锁定角色与场景 支持 Video to Video
低成本预览 360p 模式,速度快 60%,成本低至 1/3 无专门低分辨率预览模式
上下文理解 可分析前 10 秒画面保持连贯 通常仅参考末端帧
计费方式 按秒计费($0.03–$0.30/秒) 按信用点或订阅制

Gemini Omni 1.1 Flash的应用场景

  • 影视广告与预告片制作 :用 4K 输出和首尾帧控制,快速生成高质感商业短片、品牌广告与电影预告。
  • 社交媒体内容创作 :借助 360p 快速预览低成本迭代,批量产出短视频、动态封面与 viral 内容。
  • 游戏与动画预演(Previz) :通过场景扩展和参考视频保持角色一致性,快速生成分镜脚本与动作预览。
  • 电商产品动态展示 :基于产品图指定首尾帧,生成 360° 旋转、细节特写等动态展示视频。
  • 教育与培训视频 :用视频参考保持讲师或动画角色形象统一,批量生成解释性视频与课件动画。
相关工具
与本文相关的 AI 工具
AI 智能推荐 ×
输入关键词,AI 从 1000+ 工具中精准匹配推荐