← 返回 Blog

Gemini Omni = "视频版 Nano Banana":用自然语言生成、编辑视频的完整工作流

Gemini Omni Flash——官方定位为"视频版纳米香蕉"的模型——于6月30日正式通过Gemini API、Google AI Studio与Gemini Enterprise Agent Platform向开发者开放公开预览。该模型支持文本、图片、音频、视频多形式输入,生成高质量视频。现阶段可生成10秒短视频,输出720p画质,原生自带同步音频,视频生成单价为每秒0.1美元。 如果说纳米香蕉让"图像编辑"变成"开口说话",那么Gemini Omni则让"制作视频"变成"日常对话"。

GeminiGemini Omni

让"视频剪辑"变得和"图片修图"一样简单

去年,纳米香蕉(Nano Banana)把Gemini的智能能力带入图像生成与图像编辑领域。数百万用户借助它修复老照片、根据草图进行设计,通过自然语言将脑海中的画面变为图像。修改一张图片,难度就像修改PPT一样轻松。

今年,谷歌把这套交互逻辑延伸到视频领域。

Gemini Omni Flash——官方定位为"视频版纳米香蕉"的模型——于6月30日正式通过Gemini API、Google AI Studio与Gemini Enterprise Agent Platform向开发者开放公开预览。该模型支持文本、图片、音频、视频多形式输入,生成高质量视频。现阶段可生成10秒短视频,输出720p画质,原生自带同步音频,视频生成单价为每秒0.1美元。

如果说纳米香蕉让"图像编辑"变成"开口说话",那么Gemini Omni则让"制作视频"变成"日常对话"。

对话式编辑:你口述需求,视频随之改动

传统AI视频生成最大的痛点就是"盲盒式生成"——修改提示词重新生成,画面里的人物形象可能彻底改变,之前好不容易调试满意的画面元素也会一并消失。

而Omni正是为了解决这一难题而生。

它的核心能力是对话式视频编辑(Conversational Editing):使用自然语言创作视频,每一条指令都承接上一步的画面内容。人物形象保持统一,物理规律保持自洽,场景能够记住上一秒发生的内容。

官方演示中有一段非常直观的对比案例:先提供一段小提琴手演奏视频,指令"将这位小提琴手放到这张图片的环境中"。场景发生变化,但人物保持原样。继续指令"让小提琴变得透明",小提琴消失,但演奏动作依旧保留。接着下达指令"将拍摄视角调整至小提琴手肩膀上方",镜头视角改变,整套场景的逻辑完整不变。

这不是"全盘重新生成",而是在原有视频基础上修改。借助谷歌的Interactions API,模型能够在会话中保留上下文,每一次指令都是对前一条视频的修订而非重新生成,最多可进行三轮连续编辑。无需从头渲染整条视频,只需告知模型想要调整的内容。

编辑粒度十分精细。你可以下达指令:"公寓里的灯光跟随音乐依次亮起""镜面如同液体一般泛起涟漪,触碰镜面的手臂转变为镜面材质""将雕塑化作无数气泡"。谷歌在官方博客放出十余条提示词案例,全部聚焦"修改特定元素",而非重新生成整条视频。

物理仿真:水流终于拥有真实流体效果

Omni的另一大核心优势是物理认知能力与世界知识(World Knowledge and Simulation)

谷歌表示,Omni能够直观理解重力、动能、流体动力学相关规律,并结合Gemini对历史、科学、文化语境的现实知识库。在开发者大会演示视频中,水流呈现出符合现实的流动效果——这并不是单纯"模仿见过的同类视频画面",而是模型真正推演物理法则。

这意味着你无需写长达三页的提示词描述建筑风格,Omni本身就知晓哥特式教堂的样貌,并能直接将图文信息转化为视频动态画面。

双模型联动:一套从静态到动态的完整工作流

Omni真正亮眼之处,并非单独发挥作用,而是可以和纳米香蕉2 Lite(Nano Banana 2 Lite)深度联动。

纳米香蕉2 Lite是谷歌7月同步发布的图像生成模型,约4秒生成一张1K分辨率图像,单张成本仅0.034美元。它是初代Nano Banana的推荐替代模型,主打近实时、高通量图像生成。

谷歌通过统一的交互API打通两款模型,打造出Gemini生态中成本最优的图像到视频流水线——单条成品视频约1.04美元。完整工作流十分清晰:先用纳米香蕉2 Lite高速生成静态参考图,再将图像输入Gemini Omni Flash,一键转化为可编辑视频。两个模型在相同开发接口下串联,静态图像作为起点,动态视频作为成果,整条工作流依靠自然语言驱动。

谷歌还推出三款演示应用,展现这套"1+1>2"的工作模式:

  • Anywhere:自拍合成地标合影的动态视频

  • Space Lift:室内设计动态预览

  • Omni产品工作室:电商短视频生成

全场景落地:从Gemini应用、Flow到YouTube Shorts

Omni的应用覆盖范围十分广泛。

在Gemini应用内,符合条件的用户可直接使用。6月30日起,Omni Flash同步上线Google AI Studio、Gemini API、Gemini Enterprise Agent Platform以及Google Flow。在视频生态侧,YouTube Shorts已支持创作者依托文字提示词或图片,在现有短视频素材内重新渲染画面

💡 需要客观指出的是,作为公开预览版模型,Omni Flash目前仍存在若干限制:单次生成视频最长10秒;场景切换和大幅度运镜时的人物一致性尚有待优化;音频参考上传、场景扩展等功能尚未开放。但谷歌已明确将其定位为Gemini应用中Veo的下一代替代品,更长时长与更高分辨率已在路线图中。

谷歌的愿景直白清晰:"让自然语言成为你创作视频唯一需要使用的工具。"从图像走向视频、支持对话式编辑与物理仿真——Omni正在改变行业:视频创作正在从一门专业技能,转变为一种表达手段。

当"动口做视频"成为常态,企业如何接住这波智能红利

Gemini Omni Flash的发布揭示了一个朴素而深刻的产业趋势:多模态生成AI的价值不再只是"更清晰的画面",而是能够把自然语言转化为真实世界的动态影像。无论是创作者想要的"动口剪视频",还是企业想要的"批量生成电商素材、广告短视频、产品演示",背后依赖的,都是稳定、丰富、高性价比的生成式模型调用能力。

然而现实落地中,企业往往面临多重门槛:

  • 模型碎片化:GPT、Claude、Gemini、DeepSeek各有擅长,图像、视频、音频模型更需要分别对接,意味着重复开发、运维成本高企;

  • 高强度消耗下的成本压力:以Omni Flash为例,每秒0.1美元、10秒短视频约1美元,在批量生成、A/B测试、电商素材流水线等重度使用场景下,按官方原价计费,账单将呈指数级膨胀;

  • 跨境调用与合规:视频生成涉及SynthID水印、C2PA内容凭证等合规要求,跨国企业需要满足多种监管标准,自建通道的技术门槛与合规成本陡增。

这正是UseAIAPI所致力于解决的问题。作为全球领先的API聚合服务平台,UseAIAPI为企业与开发者提供以下核心权益:

  • 全生态模型一站式接入:单一接口无缝调用GPT、Claude、Gemini、DeepSeek等120余个顶级模型,覆盖对话、推理、多模态、嵌入等全场景,官方能力实时同步,业务始终站在技术前沿。图像生成、视频生成、对话编辑——一条流水线所需的全部模型,皆可在一个平台上闭环调用。

  • 企业级高可用保障:具备全球边缘节点加速能力,依托智能语义缓存降本,提供99.9%极致可用性保障与45ms骨干网络超低延迟,满足金融级可靠要求,晚高峰依然稳定可靠,无惧流量洪峰。

  • 成本优势显著,缓解高强度消耗压力:平台专属优惠折扣最低可达官方定价的50%。依托全球算力集采优势压降成本,并提供可视化财务看板,支持按项目、模型溯源消耗。对于高并发调用、高强度内容生成、长上下文Agent开发等重度使用场景,这一权益能够有效缓解成本压力——以Gemini Omni Flash为例,10秒短视频的官方成本约1美元,而通过UseAIAPI的高频调用综合成本可压至官方定价的五成左右,让预算管控精准高效,让"批量出片"真正具有商业可行性。

  • 定制化服务体系:UseAIAPI定位为SVIP企业级API服务平台,"不仅是一个接口,更是能融入核心系统、通过财务审计、适配集团架构的AI基础设施"。提供超越模型原厂的卓越服务体验,从技术对接到合规部署、从运维保障到场景落地,全程护航。

从Gemini Omni Flash"动口做视频"重塑创作流水线,到UseAIAPI在企业服务端提供稳定、低成本、全模型覆盖的接入底座,AI多模态能力正在从"炫技demo"进化为"可规模化的生产力工具"。而当前沿智能真正成为可调用、可负担、可落地的基础设施,这场视频创作民主化的红利,才能惠及每一位开发者和每一家企业。

UseAIAPI,让澎湃智能触手可及。