谷歌发布 Nano Banana 2.1,强化视觉设计与局部编辑
谷歌发布 Nano Banana 2.1,改进视觉设计、蒙版编辑和主体一致性。
AI 深度解读
谷歌发布 Nano Banana 2.1,并将其接入 Gemini、AI Studio、搜索 AI 模式等产品,关注点在于图像生成模型正从单次出图转向连续编辑与多主体控制。
- 谷歌开发者文档称,该模型支持 1K、2K、4K 输出,并改进文字渲染、提示词遵循和多轮角色一致性。
- 模型最多可融合 14 张参考图,官方称可保持最多 4 个角色和 10 个物体的一致性。
- 谷歌模型卡显示,其在编辑、蒙版编辑、多角色一致性等内部评测中高于 Nano Banana 2,但同时提示存在幻觉、偶发缓慢和空间定位错误。
- 模型支持文本、图片、视频和 PDF 输入,API 模型 ID 为 gemini-nano-banana-2.1。
- 影响/看点:如果这些内部评测能在真实工作流中复现,局部编辑和多参考图控制可能降低反复重做成本;实际价值仍取决于输出稳定性、调用成本、速度以及不同场景下的编辑边界。
- 资料依据:
- Google AI for Developers(2026-10-06):https://ai.google.dev/gemini-api/docs/models/gemini-nano-banana-2.1?hl=en
- Google DeepMind(2026-10-06):https://deepmind.google/models/model-cards/nano-banana-2-1/
本内容由 AI 生成,仅供参考,请注意甄别