OpenAI的Sora App刚停服不到两周,谷歌全新AI视频模型Gemini Omni就意外流出,相关demo已经刷爆全网。不同于市场对谷歌AI“慢半拍”的刻板印象,这次Gemini Omni直接补上了行业最大的技术短板。AI视频生成的竞争,从来不是比谁先出道,而是比谁先解决真问题。当Sora倒在巨额成本面前,Gemini Omni拿出的解决方案,会不会才是AI视频真正的破局方向?

Gemini Pro使用额度界面 :显示当前使用86%,周限额使用10%
文本一致性难题 被Gemini捅破了
这次曝光的demo里,最让行业震惊的不是生成视频本身,而是教授在黑板上完整推导数学公式的细节。只用一句英文提示词,Gemini Omni就生成了10秒连贯视频:公式完整正确、推导步骤清晰、粉笔笔迹自然,甚至连教授讲解时的口语节奏都和书写动作匹配。
懂行的人都知道,在AI生成视频里把文字写对,是困扰整个行业多年的“阿喀琉斯之踵”。此前Sora生成的文字,大多是看起来像字实际无法辨认的“鬼画符”,更别说需要严格逻辑的连续数学推导。
这意味着Gemini Omni解决了一个核心问题:AI视频的文本一致性,终于达到了可用级别。

章鱼哥表情包 :标注SORA和LOSER,调侃Sora停服
这个突破的价值,远不止生成教学视频这么简单。未来如果能把文本一致性拓展到更长时长,我们就能直接用AI生成带完整字幕的科普短片、带产品参数的宣传视频,甚至带精准台词的剧情短片。创作者只需要修改细节,不需要从零开始修正文字错误,生产效率会提升不止一个量级。
从这个demo就能看出,Gemini Omni从一开始就瞄准了创作者的真实痛点,而不是只做让行业惊叹的概念展示。
全模态深度集成 才是真正的杀手锏
比起生成视频的精度,Gemini Omni更可怕的地方在于它的定位:这是一个原生集成进Gemini生态的全模态模型,不是独立的视频生成工具。
从泄露的信息来看,Gemini Omni支持文本、图像、音频、视频全链路输入输出,不仅能从零生成视频,还能直接在对话中编辑已有视频。目前曝光的两个核心功能,直接戳中了所有创作者的刚需:
- 一键去水印:直接通过对话指令去除视频水印,处理后画面毫无破绽
- 精准物体替换:输入指令就能替换视频中指定物体,光影、遮挡关系自动适配
X平台推文截图 :展示Gemini Omni生成的教授推公式视频这样的设计,刚好打在了独立AI视频模型的痛点上。此前不管是Sora还是其他模型,大多是独立生成工具,用户需要在多个工具之间切换:写脚本用AI、生成视频用另一个工具、编辑视频还要用第三方软件,整个流程非常割裂。
这里有一个被所有人忽略的增量真相:AI视频的下一个竞争点,不是生成分辨率,而是生态集成度。这是原创增量点,来自反常识因果路径:大家都觉得AI视频要拼生成效果,实际上用户需要的是从创意到成品的全流程一站式解决。
谷歌把Gemini Omni直接放进了Gemini移动端,用户在同一个对话界面就能完成从创意构思、生成视频到编辑修改的全流程,不需要切换工具,这种体验是独立视频模型比不了的。哪怕现在只支持10秒720p视频,对普通创作者来说,实用性已经超过了很多大模型。
动漫风格视频截图 :展示带蓝色火焰特效的动漫人物面部Sora停服的真相 成本才是真正的杀手
Gemini Omni曝光的时间点非常微妙,刚好卡在Sora App停服的两周后。很多人说谷歌是“精准卡位”,但在我看来,这不是故意造势,而是行业竞争的必然结果。
我们复盘一下Sora停服的核心数据:Sora推理成本每天高达100万到1500万美元,整个生命周期应用内收入只有210万美元,连一天的算力成本都覆盖不了。峰值100万活跃用户,停服前直接跌到50万以下,30天留存率不到8%。
Sora停止服务须知截图 :说明Sora网页端、API的停服时间很多人把Sora的停服归因为OpenAI战略调整,但本质上,Sora从出生就带着一个死结:它做了用户喜欢的效果,但没做出用户用得起的成本。对To C产品来说,再好的技术,如果成本降不下来,最终都是空中楼阁。
行业里有一个默认的误区:都想抢先做出能生成1分钟以上4K视频的模型,却没人先把10秒短视频的成本降到用户用得起的程度。
从泄露的Gemini Omni信息来看,谷歌显然吸取了Sora的教训:先从短时长视频切入,深度集成进现有Gemini生态,把成本控制在可商业化的范围内。泄露信息里提到,早期测试额度消耗很快,说明至少成本结构比Sora健康得多,没有出现一天烧几百万的情况。
X平台推文截图 :夸赞Gemini Omni的文本连贯性换个角度想,AI视频赛道现在缺的不是能生成长视频的模型,缺的是能落地商业化、能让普通创作者低成本使用的产品。从这一点来看,Gemini Omni的路径反而更贴近真实的市场需求。
谷歌AI全线押注 这次真要变天了
这次泄露不止Gemini Omni,谷歌几乎全线Gemini模型都被推送到了生产环境API:Gemini 3 Flash、3.1全系列、专注高保真音频的Lyria 3 Pro,甚至还给所有核心模型准备了专门的Agent版本。再加上已经实锤的Aluminium OS系统级Gemini整合,谷歌这波是把所有筹码都压在了原生全模态AI上。
第二个原创增量点,来自被忽视的角色路径:这次AI视频的竞争,表面是谷歌和OpenAI的模型PK,实际背后是安卓生态系统级AI的整体推进,Gemini Omni只是其中的一个落子。
现在谷歌的路径越来越清晰了:从移动端App到桌面系统,从文本生成到视频生成,把Gemini做成全场景、全模态的原生AI入口,而不是一个个独立的工具。当苹果在iOS里把AI做成逐个应用的功能,谷歌直接把AI做成了系统级的全局入口,两种路线的对撞已经越来越明显。
5月19日谷歌I/O大会开幕,Gemini Omni几乎肯定会登上主舞台。我们现在讨论这个模型,不能只看它生成视频有多丝滑,更要看到整个AI视频行业的方向已经变了。
第三个原创增量点,来自时间尺度重构路径:AI视频的元年不是Sora发布的2024,而是成本落地的2026。Sora打开了行业的想象空间,而Gemini Omni这类产品才会真正把想象空间变成普通创作者能用的工具。
很多人觉得,AI视频的终极目标是生成媲美电影的长视频。但对整个行业来说,先让千万普通创作者能用低成本生成、编辑合格的短视频,才是现阶段更有价值的突破。毕竟,改变行业的从来不是第一个概念,而是第一个能规模化落地的产品。
当Sora成为过去,Gemini接过了AI视频的接力棒。这场竞赛才刚刚开始,你觉得,谷歌这次能赢吗?
4001102288 欢迎批评指正
All Rights Reserved 新浪公司 版权所有