ChatGPT 圖像 2.0 登場:OpenAI 的推理驅動視覺引擎重新定義 AI 繪圖能力

新聞摘要
2026年4月21日(太平洋時間),OpenAI 正式發布了由其下一代模型 gpt-image-2 驅動的 ChatGPT Images 2.0,標誌著 AI 驅動的視覺創作邁出了重要一步。此次更新立即對所有 ChatGPT 和 Codex 用戶開放,同時也確認了開發者可透過 API 存取。Images 2.0 首次將推理能力整合到圖像生成中,使模型能夠處理複雜、多輸出的視覺工作流程,並顯著改善了文字渲染、多語言支援和風格保真度。
可用性與存取層級
OpenAI 於 2026 年 4 月 21 日(太平洋時間)透過其官方部落格和社群管道宣布了 ChatGPT Images 2.0。存取結構分為不同層級:所有 ChatGPT 和 Codex 用戶可立即獲得核心模型改進,而付費訂閱用戶(包括 Plus、Team 和 Enterprise 會員)則可解鎖更進階的輸出功能和更高的生成量。gpt-image-2 模型同時可透過 OpenAI API 存取,定價依據解析度和品質分級。API 圖像輸出的標準輸出定價為每百萬個 token 30.00 美元,快取輸入定價為 2.00 美元,相較於先前模型的輸出成本有所降低。
精確度、指令遵循與文字渲染
Images 2.0 最顯著的技術進步之一是其遵循詳細、複雜提示的能力大幅提升。該模型透過 API 支援高達 2K 解析度的輸出,並在渲染小字體、密集的使用者介面元素、圖標和精細的風格限制方面展現出新的保真度水平——這些是早期生成模型經常表現不佳的領域。文字準確度據報約為 99%,這是一項重大改進,使得該模型適用於現實世界的設計任務,例如行銷材料、產品模型和品牌圖形。先前 AI 圖像工具在生成圖像中出現亂碼或拼寫錯誤文字的限制已得到大幅解決。
多語言視覺輸出
Images 2.0 在多語言渲染方面取得了實質性進展,OpenAI 特別指出在非拉丁字母腳本方面有所改進,包括日文、韓文、中文、印地文和孟加拉文。該模型現在可以生成將語言作為完全整合設計元素的圖像——出現在海報、圖表、資訊圖表和敘事格式(如漫畫分鏡)中——而不會出現早期系統中常見的一致性問題。這擴大了該模型在全球內容創作應用中的實用性。
風格範圍與格式彈性
新模型在廣泛的視覺風格(包括寫實圖像、電影劇照、像素藝術和漫畫)方面展現出更強的一致性。紋理、光照、構圖和精細細節在風格轉換中得到更好的保留。除了風格改進外,Images 2.0 還引入了彈性的長寬比支援——從 3:1 的寬幅橫幅到 1:3 的縱向格式——使用戶能夠直接為簡報、社群媒體和行動應用程式等平台生成量身定制的資產,無需額外的後製處理。
推理整合工作流程與批次輸出
OpenAI 的圖像產品線首次將 Images 2.0 整合了源自該公司 O 系列推理模型的思考能力。與思考或專業級模型配對時,該系統可以更深入地分析任務,利用上下文資訊,並在單一請求中生成多達八個連貫的輸出——在批次中保持角色和物件的連續性。這使得故事板、多格式廣告活動創建和從單一提示進行的迭代設計探索等結構化工作流程成為可能,減少了先前將連續視覺輸出拼接在一起所需的手動工作。
模型轉換與舊版支援
隨著 gpt-image-2 的發布,OpenAI 確認將棄用 GPT-Image-1.5 作為其產品套件的預設模型。先前模型將透過 API 保持可用,以提供舊版支援,但 Images 2.0 現在已定位為消費者和企業創意工作流程的主要模型。版本號為 gpt-image-2-2026-04-21 的模型快照已列於 OpenAI API 文件中。