GPT Image 2
指令跟随与文字渲染依然可靠,画质分 low / medium / high 三档,适合日常插图、封面与商品图。
自述文件
GPT Image 2
GPT Image 2 是 OpenAI 最先进的图像生成模型。它能按文本生成图像,也能按精确的指令修改已有图像。
它的作用
GPT Image 2 覆盖两种工作流:按文本描述生成图像,以及按具体指令编辑已有图像。它的设计取向是严格跟随你的指令,同时保留你不打算改的部分。
传入参考图时,GPT Image 2 会自动做高保真处理,没有需要手动调的旋钮——模型始终尽力保留输入图像的细节。传一张图就是编辑它,传多张图则是把不同的风格、主体或参考合成进一张输出。
主要能力
- 照片级真实感与细节:光照准确、材质可信、纹理丰富。从抓拍感的照片到打磨过的商业视觉都能覆盖。
- 文字渲染:密集文字、小字号、复杂版式,例如信息图、界面模型图、营销物料。
- 精准编辑:做定点修改,不必重新诠释整张图。调整局部的同时保住人物形象、构图与光照。
- 风格控制:让同一个视觉风格贯穿不同主体,或者用极少的提示把一张图的外观迁移到另一张上。
- 世界知识:要求"1969 年 8 月纽约州贝塞尔的一个场景",模型会知道你要的是伍德斯托克音乐节——它内置了推理能力。
用例
- 图像生成:信息图、Logo、界面模型图、照片级场景、漫画、营销视觉。既适合创意探索,也直接产出可用的成品。
- 图像编辑:风格迁移、虚拟试穿、产品模型图、图中文字转换、光照调整、物体移除、场景合成。可以把人放进新场景并保住长相,也可以换掉房间照片里的家具而不动拍摄角度。
- 角色一致性:做多页插画时让角色在不同场景里长得一致——儿童绘本、故事板、广告活动都用得上。
如何取得好结果
- 具体一点:清楚描述你要什么。别说"改好一点",说"加一点柔和的海岸日光"或"把红帽子换成浅蓝色天鹅绒"。
- 要写实用摄影语言:想要照片感,就提镜头、光线和取景。"50mm 镜头、柔和日光、浅景深"比泛泛地说"高质量"更接近真实摄影。
- 锁定不该变的部分:编辑时明确说出必须保持不变的东西。"只改光照,保留人物的脸、姿态和衣服"能挡住不想要的改动。
- 文字加引号:要让图中的文字可读,就把原文放进引号里,并描述字体。"粗体无衬线、居中、高对比"有助于保证可读性。
- 小步迭代:先出底图,然后一次只改一处,而不是全部重写。
- 多图要标清关系:输入多张图时用编号标注,并说明它们的关系。"把图 1 的风格用到图 2 的主体上。"
透明背景
要透明背景,把 background 设为 transparent、output_format 设为 png(或 webp)。这样得到的是真正的 alpha 通道,适合 Logo、贴纸、产品抠图。JPEG 存不了透明,选 jpeg 时背景会退化成不透明。
输入参数
prompt:你想生成什么,或者要怎么编辑输入图input_images:一张或多张参考图(用于编辑或合成)aspect_ratio:1:1(方)、3:2(横)、2:3(竖)quality:low / medium / high / auto —— 越低越快越便宜number_of_images:一次最多生成 10 张output_format:webp(默认)/ png / jpeg
定价
| 档位 | 计价单位 | 单价 |
|---|---|---|
| LOW | 张 | 45 积分/张 |
| MEDIUM | 张 | 170 积分/张 |
| HIGH | 张 | 465 积分/张 |
| 默认档 | 张 | 465 积分/张 |
参数
| 画面比例 | 1:1 / 3:2 / 2:3 / 4:3 / 3:4 / 16:9 / 9:16 |
| 画质档位 | low / medium / high |
| 单次输出 | 最多 10 张 |
| 参考图 | 最多 4 张 |