还记得此前在 LMArena 测试中被称为“神秘香蕉模型(nano-banana)”的 AI 图像编辑工具吗?如今它终于揭开面纱,Google 宣布正式发布 Gemini 2.5 Flash Image —— 一款能够兼顾生成与编辑的全能 AI 图像模型。
彻底解决“角色一致性”难题
传统 AI 绘图工具常常在保持角色一致性上翻车——同一个人物在不同场景里画风突变。Gemini 2.5 Flash Image 在这一点上实现了突破,它能让同一个角色自然地出现在多个场景,或从不同角度展示同一款产品。
这对于 品牌素材制作、产品目录生成、连续故事创作 来说,几乎可以称得上革命性。
Google 甚至为开发者提供了现成的模板应用,上传一张人像就能快速生成不同年代的复古照片。
句子级修图:自然语言就能完成复杂编辑
除了角色一致性,Gemini 2.5 Flash Image 最大的亮点是 自然语言精准编辑。
用户只需一句话,就能完成专业级别的操作,比如:
- 模糊背景
- 去除衣服上的污渍
- 从合照中移除某个人
- 给黑白照片上色
- 调整人物姿势
无需 Photoshop 的复杂操作,效果却能媲美专业修图。
让 AI 更懂世界:多模态语义理解
Gemini 2.5 Flash Image 不只是“会画”,它还 理解现实世界语义。
模型能够识别手绘草稿、理解文字说明,并直接执行跨步骤的复杂编辑指令。
Google 在 AI Studio 演示了一个互动教育应用:在画布上随意画图,模型不仅能识别,还能结合现实知识进行讲解,像一个随身的智能导师。
多图像融合:真正的「无缝」拼贴
新版本还带来一项酷炫功能——图像融合。
只需拖拽即可把一个物体“放入”另一个场景,生成结果自然得像原本存在。
例如,把产品放到不同环境里,或把一张图的风格渲染到另一间房间。
成本低廉 + 内置水印
Gemini 2.5 Flash Image 已可通过 Gemini APP、API、Google AI Studio 和 Vertex AI 使用。
定价为 每百万输出 token 30 美元,生成一张图片约需 1290 token,成本仅 0.039 美元(不到人民币 3 毛钱)。
所有生成或编辑的图片都会自动嵌入 SynthID 隐形水印,确保可溯源和内容真实性。
总结:AI 修图工具的转折点
Gemini 2.5 Flash Image 不仅是一次常规迭代,而是让 AI 图像从“玩具”真正跨入 生产力工具 的关键一步。
它解决了长期困扰用户的痛点(角色一致性、复杂编辑门槛),同时引入了更多创意可能(多图融合、语义理解)。
未来,基于这款模型的新应用很可能会层出不穷——从品牌设计到教育娱乐,再到个人创作,都将迎来新的可能性。



