首页 / 资讯 / ChatGPT 图像 2.0 登场:OpenAI 的推理驱动视觉引擎重新定义了 AI 能画什么
OpenAI

ChatGPT 图像 2.0 登场:OpenAI 的推理驱动视觉引擎重新定义了 AI 能画什么

2026年4月22日1 分钟阅读
ChatGPT 图像 2.0 登场:OpenAI 的推理驱动视觉引擎重新定义了 AI 能画什么

新闻摘要

2026年4月21日(太平洋时间),OpenAI正式发布了由下一代模型gpt-image-2驱动的ChatGPT Images 2.0,标志着AI驱动的视觉创作迈出了重要一步。此次更新立即对所有ChatGPT和Codex用户开放,并确认了开发者API的访问权限。Images 2.0首次将推理能力集成到图像生成中,使模型能够处理复杂的多输出视觉工作流,并显著提高了文本渲染、多语言支持和风格保真度。

可用性和访问层级

OpenAI于2026年4月21日(太平洋时间)通过其官方博客和社交渠道宣布了ChatGPT Images 2.0。访问权限分为不同层级:所有ChatGPT和Codex用户可立即获得核心模型改进,而付费订阅用户(包括Plus、Team和Enterprise会员)则可解锁更高级的输出功能和更高的生成量。gpt-image-2模型同时可通过OpenAI API访问,定价根据分辨率和质量分级。API图像输出的标准输出价格为每百万个token 30.00美元,缓存输入价格为2.00美元,与先前模型的输出成本相比有所降低。

精确度、指令遵循和文本渲染

Images 2.0最显著的技术进步之一是其遵循详细、复杂提示的能力得到了极大提升。该模型通过API支持高达2K分辨率的输出,并在渲染小文本、密集UI元素、图标和精细风格约束方面展现出新的保真度水平——这些是早期生成模型经常表现不佳的领域。排版准确率据报道约为99%,这是一个实质性的改进,使得该模型能够胜任现实世界的设计任务,如营销材料、产品模型和品牌图形。AI图像工具在生成图像中产生乱码或拼写错误文本的先前限制已得到显著解决。

多语言视觉输出

Images 2.0在多语言渲染方面取得了重大进展,OpenAI特别指出在非拉丁字母脚本方面有所改进,包括日语、韩语、中文、印地语和孟加拉语。该模型现在可以生成将语言作为完全集成设计元素的图像——出现在海报、图表、信息图和叙事格式(如漫画面板)中——而不会出现早期系统特征的连贯性故障。这扩展了该模型在全球内容创作用例中的实际效用。

风格范围和格式灵活性

新模型在广泛的视觉风格中展现出更强的连贯性,包括照片写实图像、电影剧照、像素艺术和漫画。纹理、光照、构图和精细细节在风格迁移中得到了更好的保留。除了风格改进外,Images 2.0还引入了灵活的宽高比支持——从3:1的宽幅横幅到1:3的竖幅格式——使用户能够直接为演示文稿、社交媒体和移动应用程序等平台生成定制的资产,而无需额外的后期处理。

集成推理的工作流和批量输出

在OpenAI的图像产品线中,Images 2.0首次集成了来自公司O系列推理模型的思考能力。当与思考或专业级模型配对时,该系统可以更深入地分析任务,利用上下文信息,并在单次请求中生成多达八个连贯的输出——在批量处理中保持字符和对象的连续性。这使得故事板、多格式广告系列创建和从单个提示进行迭代设计探索等结构化工作流成为可能,减少了先前将顺序视觉输出拼接在一起所需的手动工作。

模型迁移和遗留支持

随着gpt-image-2的发布,OpenAI确认其正在弃用GPT-Image-1.5作为其产品套件的默认模型。先前模型将通过API提供,以支持遗留系统,但Images 2.0现在被定位为消费者和企业创意工作流的主要模型。版本号为gpt-image-2-2026-04-21的模型快照已列入OpenAI API文档。

OpenAI图像生成