OpenAI Group PBC今日宣布,将为其图像生成工具增添更多艺术表现力,正式发布ChatGPT Images 2.5,这是对今年4月推出的ChatGPT Images 2.0的一次更新。
据OpenAI介绍,新工具生成的图像具有"更自然的光影效果和更丰富的纹理",并且在"多轮对话中"更好地遵循用户指令。新版本的生成速度也大幅提升,最高可比之前快50%,此外还新增了一项名为Sketch的工具,让用户可以用手指在触摸屏上画出草图,作为生成图像的参考基础。
OpenAI在博客文章中表示,这些更新还意味着ChatGPT Images现在能够更好地保留参考图片中主体的细节。例如,在单次对话中进行多次图像生成和编辑时,人物的独特面部特征和其他辨识细节现在能够更可靠地保持一致。
新模型在用户请求编辑时,还会保留用户未要求更改的细节。即使面对包含多个主体、物体或复杂背景的场景,这一特性也同样有效。在ChatGPT Images 2.0中,用户进行局部编辑时,这类细节常常会出现劣化,而2.5版本在保持图像整体稳定性方面表现更好,使用户能够进行精准编辑。
在较长的对话过程中,用户可能会要求模型进行多次编辑,新版本会确保在用户提出新的编辑请求时,之前的要求仍被遵循。该公司表示,这意味着此前的更改将保持稳定,每一次后续编辑都会在此基础上叠加,不会造成画质损失。这一切都是为了支持迭代式的创意工作流程。
以草图作为起点
ChatGPT Images 2.5最大的新增功能可能是Sketch,它允许用户直接在ChatGPT中绘画,并将自己的草图作为想要生成图像的视觉参考。用户只需勾勒出大致的布局、视觉方向或构图,模型便会基于这个起点生成更为精致的图像。这一功能对使用触控笔(如Apple Pencil)的用户最为有利,因为在触摸屏上直接绘画在大多数情况下都不太方便。
该模型还为常见的图像格式新增了模板,例如宣传单和产品照片。它现在也支持在图像上添加内联注释,以便进行有针对性的编辑。最后,用户现在还可以将自己的提示词与生成的图像一起分享,以便朋友和同事在此基础上进行迭代创作。
OpenAI表示,ChatGPT Images 2.5共有两个版本。第一个是GPT-Image-2.5 Flare,这是用户首次打开应用时的默认模型。该公司表示,该模型生成高质量图像的速度是GPT-Image-2模型的两到四倍,并对透明背景有更好的支持,因此非常适合用于制作品牌素材、演示文稿和网站内容。
另一个模型是GPT-Image-2.5 Sunburst,该公司解释说,它以速度换取更高的精度。生成图像所需的时间会稍长一些,但用户能够生成细节保真度更高的图像,这对于一些需要像素级一致性的创意专业人士和艺术家来说可能十分重要。OpenAI表示,该模型主要面向产品照片和营销材料等场景,这些场景中每一份素材都必须完全符合品牌规范。
在安全方面,OpenAI表示ChatGPT Images 2.5对提示词和输出内容设置了多项防护机制,以防止生成有害内容。它还使用C2PA元数据和隐形水印技术,确保生成的图像能够被识别出来,从而防止未经授权的二次使用和深度伪造。
OpenAI表示,新模型现已在桌面端、移动端和网页版的ChatGPT、ChatGPT Work和Codex中上线。开发者也可以通过两个独立的应用程序接口访问GPT-Image-2.5 Flare和GPT-Image-2.5 Sunburst。
Q&A
Q1:ChatGPT Images 2.5是什么?
A:ChatGPT Images 2.5是OpenAI推出的图像生成工具更新版本,相比此前的2.0版本,能生成光影更自然、纹理更丰富的图像,生成速度最高提升50%,并新增了名为Sketch的手绘草图参考功能。
Q2:ChatGPT Images 2.5的两个模型有什么区别?
A:GPT-Image-2.5 Flare是默认模型,生成速度快,是GPT-Image-2的两到四倍,适合制作品牌素材、演示文稿和网站;GPT-Image-2.5 Sunburst则牺牲速度换取更高精度,适合需要像素级一致性的产品照片和营销材料。
Q3:ChatGPT Images 2.5如何防止生成有害内容和深度伪造?
A:该模型对提示词和输出内容设置了多重防护机制以阻止有害内容生成,并使用C2PA元数据和隐形水印技术标记生成图像,防止未经授权的二次使用和深度伪造。
