谷歌深夜偷袭OpenAI,白菜价打赢Pro

谷歌发布Nano Banana 2.1图像生成模型,这是一款小型Flash级别模型,性能超越自家旗舰Pro版本。该模型支持蒙版局部编辑,可精准修改指定区域不改变其他部分;主体一致性大幅提升,最多支持14张参考图;画面质量接近实拍,支持4K输出。价格仅为上代一半,1K图像0.034美元。在Arena竞技场多图编辑榜排名第4,仅次于OpenAI三款GPT Image模型。目前已在Gemini App、搜索AI模式等平台陆续上线。这场AI生图竞赛已从文生图转向改图赛道,电商、广告等行业的图像编辑需求成为各大厂商争夺焦点。

文章作者、来源:新智元

刚刚,谷歌深夜甩出Nano Banana 2.1!

一个Flash级小模型,把自家旗舰Nano Banana Pro都干翻了。

谷歌

划一波重点:

改图:支持蒙版局部编辑,圈哪改哪,别的地方原样不动

一致性:人物、产品连改几轮不变脸,最多能塞14张参考图

画质:画面更像实拍,最高4K直出

价格:出图价是Nano Banana 2的一半,1K一张0.034美元

榜单:Arena多图编辑排第4,前面只剩OpenAI三款GPT Image

上线:Gemini App、搜索AI模式、AI Studio、Flow等今天起陆续可用

谷歌

Flash打赢Pro,Nano Banana主打性价比?

首先,Nano Banana 2.1还是Gemini 3系列模型的成员,基于Gemini 3.6 Flash,知识截止日期为2026年3月。

谷歌

按照以往的命名方式,Nano Banana 2.1也可以叫Gemini 3.6 Flash Image

根据官方的基准测试,Nano Banana 2.1在视觉设计、编辑、一致性等方面,可以说是遥遥领先。

谷歌

虽然在小文本渲染、3D推理和事实性等方面,依然有改进空间,但对于那些需要图片生成和编辑服务的用户来说,这无疑是个相当出色的更新:

以专业级的精度和控制力创建与编辑图像,并支持多次快速迭代

为海报和复杂图表生成清晰的文字

长上下文的现实世界知识

跨多种语言的本地化文字渲染

网友的盲投结果也证明这一点。

谷歌

在Arena竞技场上上,Nano Banana 2.1拿到了多图编辑第4,文生图第5,单图编辑第6的成绩。

尤其是在多图编辑榜上,排在它前面的只剩OpenAI的三款GPT Image。

相比之下,上一代Nano Banana 2在这三个榜上,分别只排第7、第11、第14。

谷歌

谷歌

谷歌

左右滑动查看

考虑到出图价只有Nano Banana 2的一半,看来谷歌是要打价格战了。

圈哪改哪,脸都不带变的

蒙版编辑,用过PS的都熟。圈出一块就只改这一块,别的地方原样留着。

可放到AI生图里,这事一直很难。

你跟模型说「把左下角那个杯子换成红的」,它得先猜你说的是哪个杯子,再把整张图重新生成一遍,别的地方能不能保住,全凭运气。

现在圈一下就行。换衣服、换招牌、P掉背景里的路人,都只动圈住的那块。

网友ibexdream给它连出了三道题,生成、改图、换风格。

谷歌

第一题,画一张纸币。画面上是一位托腮沉思的老哲人,头发往后化成了一整座迷宫。

第二题就在这张图上改。编号从「№ 1098471」换成「NB-21098471」,两侧的小字也换了,老哲人手里多了根香蕉当电话,底下还加了条「IN BANANA WE TRUST」的飘带。

两张放在一起看,迷宫、长袍、胡子都原样没动。

谷歌

第三题换风格,整张纸币变成了一幅油画。

谷歌

在模型卡的评分中,蒙版编辑这一项,2.1拿了1049分,比Nano Banana 2高84分,比Pro高122分。

甚至,就算不开思考,2.1在每一项上也都压着Pro。

谷歌

另一项升级是主体一致性,说白了就是别变脸。

拍电商图、做品牌海报、画连载漫画的人应该深有体会,同一个模特换十套衣服,换到第三套,脸就开始不对劲了。

这次涨分最猛的就是这一项。多人物一致性拿了1106分,比Nano Banana 2高出128分。

开发者最多能塞10张物体参考图、4张人物参考图进去,让它照着画。

网友BG-VC就这么试了。他给了一张模特照,再加上上衣、半裙、包、鞋、耳环五件单品的参考图,让它出六个不同场景的照片,六张都是一次生成。

谷歌

谷歌

走着、坐着、靠在台边,换了六个姿势,脸、衣服、包和耳环都没走样,拿去当一组电商图都够了。

画面本身也更像拍出来的了。官方放的样图里,挂满水珠的甲虫、粉房子外楼梯上的绿裙姑娘,乍一看真分不出是AI画的。

谷歌

除此之外,做信息图时,它能先上谷歌网页搜索和图片搜索查资料,再动笔。

谷歌的自动评测里,2.1做信息图的事实准确分是0.521,Nano Banana 2只有0.179,Pro也才0.265。

换句话说,让它画张科普图,内容画错的情况会少很多。

谷歌

画图便宜了,动脑贵了

出图按每百万token 30美元收,正好是Nano Banana 2的一半。

1K一张从0.067美元降到0.034美元,4K从0.151美元降到0.076美元。

这个价格,跟7月主打白菜价的Nano Banana 2 Lite一模一样。

不过,别的项目反倒涨了。

输入从每百万token 0.5美元涨到1.5美元,是原来的3倍。文字和思考的输出,也从3美元涨到了7.5美元。

相当于谷歌把钱从「画」挪到了「想」上。

谷歌

谷歌

目前,开发者现在就能在AI Studio里选到它,模型名叫gemini-nano-banana-2.1。

之前的Nano Banana 2的API,则会在10月29日关停。

普通用户也不用等。

Gemini App、搜索的AI模式、Flow、设计工具Stitch、Google Ads和Gemini企业平台,今天起陆续上线。

在谷歌App里,点搜索框下面那个香蕉图标就能玩。

谷歌

网友连夜上强度,GPT也被拉来对线

模型上线不到一小时,X上就有人开测了。

Mark Kretschmann给它出了一道「酷刑测试」,提示词要求一张图里同时塞进人群、杂物、能看清的文字、雨天的反光,再看这些东西凑在一起,还像不像一张真照片。

谷歌

谷歌

Luis Catacora让它画一块茶馆的菜单板,同一款「茉莉绿茶」,要用英语、日语、阿拉伯语、印地语四种文字写出来,一次出图。

谷歌

谷歌

Lad则写了一段专挑AI软肋的提示词,画面里要有细线纹身、3条项链、一排耳饰、手链,还要一副能透出眼睛的有色墨镜,然后把这段提示词分别交给Nano Banana 2.1和GPT Image 2.5,各画一张来比。

谷歌

下面这组图,左边是Nano Banana 2.1,右边是GPT Image 2.5。

Nano Banana 2.1把纹身全画在了他指定的位置,项链、耳饰、手链也都在,就是墨镜忘了上色,脸还被晒红了一片。

谷歌

Pankaj Kumar找的对手是GPT Image 2。他让两个模型画同一个场景,书桌上放着的一块手表,各出一张。

谷歌

左边是Nano Banana 2.1画的,自然光,像随手拍的。右边是GPT Image 2画的,开了台灯,表盘还换成了镂空机芯,一股精修广告图的味道。

谷歌

速度上差得更多。API平台AI/ML API准备了5个提示词,每个都让Nano Banana 2.1和GPT Images 2.5各画一张。

Nano Banana 2.1出一张图要11秒、0.044美元,GPT Images 2.5要50秒、0.069美元。

谷歌

谷歌

Hugo Plat出了4道太空题,旋涡星系、超大质量黑洞、类星体,外加把整个太阳系装进一张图,同样交给Nano Banana 2.1和GPT Image 2.5各画一遍。

4张画下来,Nano Banana 2.1一共花了0.178美元,GPT Image 2.5要0.284美元。

谷歌

同一道黑洞题,左边的Nano Banana 2.1画得克制,右边的GPT Image 2.5把星云和火焰全拉满了。

谷歌

中文这块,知名博主歸藏测了一圈,结论是字更清楚、错字少了很多,排版也干净,没有GPT那种破碎感。他还觉得,比起GPT,它最大的优势是能直接出4K。

谷歌

谷歌

谷歌

谷歌

谷歌

左右滑动查看

当然,也不是没有破绽。「传承与新生」旁边那行竖排的小英文,放大一看已经糊成了乱码。

谷歌

生图之战,打到改图了

4月,GPT Image 2上线,在同一个Arena的文生图榜上,领先Nano Banana 2整整240分。

9月,OpenAI又发了Images 2.5,主打的就是只改指定区域、多轮修改不跑偏。

不到一个月,谷歌的2.1也押在了这两件事上。

两家前后脚卷改图,原因也不难猜。电商、广告、品牌设计这些行当,一张图动辄改上十几版,改到第十版还不崩,比第一版惊艳重要得多。

所以谷歌这次直接把2.1塞进了Google Ads和企业平台,冲的就是这群天天改图的客户。

话说回来,Flash都把Pro超了,Nano Banana Pro的下一代,谷歌打算什么时候端上来?

参考资料:

https://x.com/googleaistudio/status/2107501303890915550