← 返回文章列表

谷歌在文图影AI领域已经全面弯道超车并遥遥领先

谷歌在文图影AI领域已经全面弯道超车并遥遥领先 大家好,我是九歌。 这篇文章断断续续,拖拉了一个多月才成稿。 刚开始写的时候,谷歌Nano Banana刚上线,现在估计小孩子都知道了。前两天,谷歌直接

AI电商商业
谷歌在文图影AI领域已经全面弯道超车并遥遥领先

谷歌在文图影AI领域已经全面弯道超车并遥遥领先

大家好,我是九歌。

这篇文章断断续续,拖拉了一个多月才成稿。

刚开始写的时候,谷歌Nano Banana刚上线,现在估计小孩子都知道了。前两天,谷歌直接把Nano Banana封装成了一款新的画板产品 ,取名Mixboard。

图片展示的是一个AI生成的鸟类图片集合,标题为““Birds with Googly Eyes” 。画面中排列着多种鸟类图片,包括小鸡、猫头鹰、鹦鹉、鸽子、鸟儿等,每张图片下方都有对应的编号。图片下方有一个蓝色按钮,写着“Show me birds with googly eyes”。该图片与上文提到的Nano Banana逆天功能相关,展示了其将“长着卡姿兰大眼的鸟儿”这一天马行空创意可视化的能力。

Mixboard可以帮你即时把自己天马行空的创意给可视化,比如上图中我们让它绘制出长着卡姿兰大眼的鸟儿,每张图片都能接着进行编辑,感觉就挺有意思的。当然,Nano Banana最逆天的功能还是Ps功能,你可以要求他把一些图片中的元素移植到生成效果中。

下面这张图,上图是我随便从网上找的一张带马赛克的图片,下图是让Nano Banana修改后的修改,说实话非常震撼,看来马赛克都没有存在价值了!

图片展示了两张带马赛克的图片,上图为一位穿着白色连衣裙的女性,背景有蓝色渐变和白色花朵;下图为同一位女性,但穿着带有花卉图案的连衣裙,背景也类似。两张图片均为带马赛克的跑车照片修复效果。该图片与上下文提到的Nano Banana修复带马赛克的图片效果相呼应,直观呈现了其在写实领域修复带马赛克图片的能力,体现了谷歌在文生图领域的技术优势。

下面这张图,也是从网上随便找了带马赛克的跑车照片,Nano Banana给修复了一下,如果以前的文生图搞得都是写意作品,那现在的文生图在写实领域真的有点逆天了。

图片展示了两辆宝马汽车。上图中,一辆蓝色宝马车以蓝色线条呈现,背景为城市天际线,地面有蓝色光圈。下图是上图经过Nano Banana修复后的效果,车辆细节更加清晰,线条变为实线,背景和地面也更为真实,光圈变为蓝色光晕。该图片与文档中提到的谷歌在文生图领域遥遥领先的内容相关,直观呈现了Nano Banana在修复带马赛克图片方面的强大能力。

回到正题,为什么说谷歌在文字、图片、视频三端,已经弯道超车并遥遥领先了呢。

文生图和图生图方面,上面我们已经用Nano Banana给出说明了,现在我们聊大模型方面,谷歌怎么弯道超车的。

两年多前,ChatGPT横空出世的时候,最尴尬的莫过于谷歌了。因为在AI领域,谷歌一直是业内的标杆,阿尔法GO横扫中韩顶尖围棋高手的场景,更是一代人记忆深处的烙印。

然后此一时彼一时,掀起AI新时代序幕,被永久写入历史的公司,叫OpenAI。作为Thransformer架构的发明者,谷歌成了这个历史事件的观众。

面对OpenAI的ChatGPT,谷歌一开始竟然毫无还手之力,在巨大的外部压力下推出聊天机器人Bard,灾难性的发布会直接让谷歌的股价一天大跌7%。

AI不光代表了人类最先进的科技技术,谷歌失去这个光环其实也到没啥,但是AI会取代用户使用搜索引擎的习惯,这简直就是要了谷歌的老命了。

痛定思痛后,谷歌立即快速整合内部资源,形成合力。长期以来,Google Brain和DeepMind虽然都成绩斐然,硕果累累,但某种程度上是独立运作的。为了集中最顶尖的人才和技术,谷歌直接将这两大王牌团队合并,成立了统一的Google DeepMind部门。这一举动极大地减少了内耗,为后续集中力量办大事铺平了道路,没多久Gemini大模型就发布了。

看来国内外企业都一样呀,据说淘宝闪购能在外卖大战中杀出,就是蒋凡把淘宝和饿了么的资源整合在一起产生的化学反应。

如今两年多过去了,谷歌也确实在文图影AI领域已经全面弯道超车,股价创了历史新高【截止发文,谷歌股价已经涨到251美元】。

图片展示了谷歌(GOOG)的股价走势。上方显示当前股价为213.53美元,涨幅为+136(+0.55%)和+104.85(+96.48%)。下方图表以绿色和红色柱状图呈现股价波动,黑色折线代表收盘价。图中用红色箭头标注了两个关键日期:2023年2月9日Bard发布翻车后当天股价,以及2025年8月30日最新股价。该图与上下文紧密相关,直观呈现了谷歌股价在特定时间节点的变化情况。

当然,本文无意探讨投资。我们一起看看谷歌在大语言模型端的统治力。

图片展示了OpenRouter上模型token使用量排行榜,横轴为日期,纵轴为token数量。Gemini系列模型表现突出,Gemini 2.5 Flash以1.187T tokens位列第二,Gemini 2.0 Flash以1.067T tokens位列第三,Gemini 2.5 Pro以0.642T tokens位列第五。这些模型由谷歌开发,其token使用量在排行榜中名列前茅。该图与文档中提到的Gemini大模型在Openrouter的token使用量占据前五席,以及其可能带来的利润等内容相关,直观呈现了Gemini模型的市场表现。

MaaS服务商Openrouter最新的数据统计中,Gemini大模型的token使用量,已经在前五席中占据了3席。大家可别忘了,国外大模型的API费用可比国内贵多了,而且国外用户付费习惯更好,所以Gemini大模型的token收入和Gemini会员,就能给谷歌带来不少利润,更不用说衍生产品了。

这也从侧面印证,谷歌的股价为什么会一直不断新高。

在几个月前,知乎上就有一个问题一直出现在我的时间线上:“为什么我感觉Gemini 2.5pro 异常的强”,回答中提到最多的就是其恐怖如斯的上下文能力,我觉得大模型颠覆网文行业,只是时间问题了。

图片展示的是知乎用户赛琳娜Selena关于Gemini 2.5 Pro的评论。她表示Gemini 2.5 Pro和战双帕弥什的赛琳娜一样美妙。评论中提到战双赛厨称用Gemini 2.5 Pro写同人文,在一个对话内已创作进60万字,内容够一本600页的书,但能保持不忘记原始设定和前文,创作质量比ChatGPT好一个档次。还提到deepseek不到10万字就说对话到上限了。该评论发布于2025年7月16日14:31

最后我们再来看看谷歌在文生视频生成领域的代表性产品 Veo3吧。OpenAI Sora的发布并没有带来超预期的反馈,而且价格过于昂贵。原因无他,之前吹牛吹大了。

从网上找了一份研究报告,文生视频模型,谷歌占据了2-3名的位置。但是,我自己更多的是在使用Veo3。

图片为“Artificial Analysis文生视频及图生视频排行榜(统计时间:2025年6月19日)”。表格中展示了不同公司及其模型在文生视频方面的排名情况,如ByteDance的Seedance 1.0排名1,Google的Veo 3 Preview (No Audio)排名2等。表格还列出了排名、公司、模型等信息,数据来源为Artificial Analysis,国元证券研究所。该图片与文档中介绍谷歌在文图影AI领域领先的内容相关,直观呈现了相关技术模型的排名情况。

下面是我随手用Veo3生成的视频。

1.提示词:机械臂拖地

2.提示词:机械臂帮忙遛狗

无论是Nano Banana让想法可视化变得如此简单,还是Gemini在理解与推理上展现的惊人能力,亦或是Veo将高质量视频生成的门槛大幅降低,谷歌产品的弯道超车,都标志着AI竞争已进入一个全新的阶段——不再是单个模型的参数竞赛,而是生态、体验与应用场景的全面融合。

在当下的AI领域,如果只看国外公司,谷歌将是唯一能和阿里、字节在多个AI领域全面发展的公司,这三家公司也将会是在AI领域走得最远,直到拥有绝对的领先优势的企业。