最新出刊

人像不再走鐘!Google最強AI圖像模型登場,要怎麼用?

過往,用AI生成圖片時可能會遇到人物表情走鐘、畫面不協調、不符合現實世界邏輯的情況。最新的Google圖像模型Gemini 2.5 Flash Image終結了這些問題,它可以幫你做什麼?

AI-Gemini-Google-AI圖像生成 圖片來源:Google
其他
  • 天下Web only

週二,Google推出外界引頸期待已久的圖像生成模型Gemini 2.5 Flash Image,又稱「奈米香蕉」(nano-banana)。

用戶反應熱烈,因為這款新模型能保持畫面中角色的一致性將多幅影像融合成一幅,並且不需要用戶寫程式,用自然語言即能修改圖像,還能更符合現實世界邏輯,不輸出令人滿頭問號的畫面。

保持角色

過往在使用其他圖像模型時,可能會碰到畫面中人像「愈改愈走鐘」的煩惱,因為先前的模型很難在每次改動環境的指令下維持人物面部的細節。

然而,進化後的Gemini 2.5 Flash Image可以在多個提示和編輯指令中,保持角色或物件的外觀。

資料來源:Google

融合多張圖像

Gemini 2.5 Flash Image可以理,解並合併多幅影像。例如將一件家飾放入房間場景中,或是修改房間牆壁的紋理。

Gemini甚至提供一個模板應用程式,讓用戶拖曳物件到新場景中,讓用戶更快速地創建融合圖像。

資料來源:Google

自然語言就能下指令

Gemini 2.5 Flash Image支援使用自然語言進行特定的修改,和精準的局部編輯。用戶只要簡單提示「模糊影像背景」、「去除衣服上的污漬」、「從照片中移除整個人物」,就能實現想法。

資料來源:Google

更合現實世界邏輯

除此之外,該模型還增加了對現實世界的知識推理。舉例來說,一個氣球飄向仙人掌接下來會怎樣?模型能生成氣球破碎的畫面。這讓圖像生成模型不只做出精美的作品,也能符合現實世界的邏輯。

資料來源:Google

挑戰OpenAI

Google DeepMind視覺生成模型產品負責人布里奇托瓦(Nicole Brichtova)指出,該公司確實在不斷提高視覺品質,以及模型遵循指令的能力,更新的模型特別考慮了消費者的使用場景,像是居家視覺化。

如今,AI圖像模型已成為科技巨頭的關鍵戰場。在OpenAI於三月推出GPT-4o原生影像生成器之後,使用量一路飆升,特別是廣受歡迎的吉卜力工作室風格圖片。

為了跟上OpenAI和Google的腳步,Meta上週宣布將從新創公司Midjourney獲得 AI 影像模型授權。同時,由a16z投資的德國獨角獸公司Black Forest Labs,也以FLUX AI圖像模型在基準測試中佔優勢。

對Google來說,Gemini這款令人印象深刻的AI圖像生成器或許能幫它縮小與OpenAI的用戶量差距。目前,ChatGPT每週用戶數超過7億人,而Gemini的大約1億出頭。

不過,考量安全問題,新AI圖像生成器設有限制,不能生成非自願的親密圖像,並且圖像都會加上不可見的浮水印。

(資料來源:Google, TechCrunch, Decoder)

廣告
你可能有興趣
廣告
#廣編企劃 #Shorts|手護大台北母親河流域共好看見新店溪生命力
最新訊息
破壞創新大師史考特・安東尼首度來台!
訂閱天下雜誌電子報

天下雜誌當期內容的精華與延伸,每周三發送最具時效性的深度內容