OpenAI 推出 ChatGPT Images 2.0:文字更清晰、指令更精準,支援多圖生成

OpenAI 於 4 月 22 日正式推出新一代生圖模型 ChatGPT Images 2.0。這次更新聚焦於文字呈現、指令理解、多語言生成與構圖能力,改善過去常見的文字模糊、細節錯置及排版不自然等問題。

OpenAI 表示,ChatGPT Images 2.0 不只是單純的圖片生成工具,也能協助設計、教學與內容製作。所有 ChatGPT 用戶即日起均可使用;Plus、Pro 或 Business 方案則可進一步使用 thinking 模式。

ChatGPT Images 2.0 五大升級重點

1. 指令理解更精準,細節呈現更完整

ChatGPT Images 2.0 強化了對指令的理解能力,能更準確掌握物件位置、物件之間的關係,以及畫面中的細節元素。小字、圖示、使用者介面元件與複雜構圖的生成穩定性也有所提升,降低「整體符合但細節出錯」的情況。

2. 文字生成能力提升,支援多種語言

文字渲染是此次更新的重點之一。除了英文之外,中文、日文與韓文等非拉丁語系文字也有更清晰的生成表現,即使面對密集文字與複雜排版,仍能維持較好的可讀性。

模型不只著重於將文字正確呈現在畫面上,也改善了語句通順度與版面配置,因此可應用於海報、圖解、漫畫及社群圖片等需要大量文字的內容。

3. 風格控制更到位

在視覺風格方面,ChatGPT Images 2.0 能處理寫實照片、電影感畫面、像素風與漫畫風等不同類型。生成結果更能掌握各種媒材與風格的特徵,而不只是呈現大致相近的視覺效果。

4. Thinking 模式支援推理與多圖生成

使用 thinking 模式時,ChatGPT Images 2.0 能在產生圖片前進行推理與規劃,並一次生成多張不同方向的圖像,同時維持角色與物件的一致性。

這項能力可用於從單一構想延伸出一組視覺內容,例如系列海報、漫畫分鏡或設計提案,讓圖片生成更適合需要連貫內容的工作流程。

5. 畫面比例選擇增加,並開放 API

ChatGPT Images 2.0 支援從橫向 3:1 到直向 1:3 的輸出比例,可套用於簡報、海報、社群貼文及行動裝置畫面,減少後續裁切與調整的需求。

模型也具備截至 2025 年底的世界知識,可用於需要結合現實資訊的生圖需求。此外,OpenAI 透過 gpt-image-2 API 開放相關能力,開發者可將生圖功能整合至產品與服務,例如在地化廣告素材、教學圖片、設計工具及網站內容製作。

ChatGPT Images 2.0 與 Gemini 的生成比較

來源測試以海報宣傳圖、俯視角桌面場景、日系漫畫、擬真旅行照片及繁體中文洗手教學海報等指令,將 ChatGPT Images 2.0 與 Gemini 的生成結果進行比較。

測試觀察指出,ChatGPT Images 2.0 在文字渲染、排版設計、細節處理與複雜畫面等面向具備競爭力,尤其在需要大量文字、明確結構或資訊層級的場景中,生成結果更接近可直接使用的內容。

範例一:海報宣傳圖生成

原圖:

ChatGPT Images 2.0 與 Gemini 的生成結果:

範例二:情境圖片生成

ChatGPT Images 2.0 與 Gemini 的生成結果:

範例三:漫畫風格圖像生成

ChatGPT Images 2.0 與 Gemini 的生成結果:

範例四:擬真風格生成

ChatGPT Images 2.0 與 Gemini 的生成結果:

範例五:複雜文字海報生成

ChatGPT Images 2.0 與 Gemini 的生成結果:

所有 ChatGPT 用戶即日起可使用

ChatGPT Images 2.0 已正式上線,免費帳戶也能使用。若採用 Plus、Pro 或 Business 方案,則可使用 thinking 模式,體驗更完整的推理及多圖生成能力。

從上面的比較應該也能感受到 ChatGPT Images 2.0 在文字渲染、排版設計、細節處理、複雜畫面都能跟 Gemini 的 Nano Banana 2 打得有來有回;尤其是在需要大量文字、清楚結構或資訊層級的場景中,ChatGPT Images 2.0 的略勝一籌,也更接近可直接使用的程度,推薦大家自己玩玩看,感受一下!

Related Articles

Stay Connected

0FansLike
0FollowersFollow
22,800SubscribersSubscribe
- Advertisement -spot_img

Latest Articles