OpenAI集团PBC公开了聊天机器人内置图像生成器的升级版本"ChatGPT Images 2.0"。此次更新的核心不仅在于提升图像质量,更在于将功能扩展到企业可直接用于实务的方向。
新版本支持最大宽度2000像素的图像,并提供比以往更多样的屏幕比例。特别是可以生成长宽比最大为3:1或1:3的形态,这有利于制作信息图、横幅和演示用视觉资料。
OpenAI表示,"ChatGPT Images 2.0"在整体图像质量上实现了大幅提升。代表性的改进是文本表现力的增强。值得注意的是,它能够比以往更准确地生成包含韩语、日语、中文、印地语和孟加拉语的图像。这可以说是针对此前生成式AI图像被指为弱点的文字扭曲或错字问题进行了集中改善。
小字体、用户界面元素、图标等细节视觉资产也得到了改进。OpenAI表示,新模型在以往AI模型特别难以处理的这些领域取得了更好的成果。此外,还包含了有意反映细微缺陷以实现更逼真图像的功能。这被解读为试图弥补现有AI图像因过于光滑而显得人工的局限性。
基于"常识知识数据集"的推理填补信息空白
该工具基于内置的"常识知识数据集"来解释提示词并填补缺失信息。例如,即使使用者只输入特定菜肴名称,无需逐一列出材料,也能制作出菜谱信息图。据OpenAI透露,该数据集截至去年12月已进行更新。
付费用户可以通过开启ChatGPT的"thinking"和"pro"推理模式来进一步扩展功能。使用该模式可以额外参考公开网络的信息生成结果。OpenAI工程师在演示中展示了在检查自家在线商店后,基于当前有库存的商品制作广告图片的案例。
这两种推理模式不仅增加信息量,也有助于提升图像质量。OpenAI解释称,通过在生成前先推理视觉资产的结构,降低了出错的可能性。这意味着可以减少需要人工修改的次数,从而缩短制作时间。
另一个实用的变化是,一次提示词最多可以生成10张图像。可以一次性生成保持相同风格的多个版本,或者同时比较不同的设计风格。这在营销方案、商品缩略图、教育资料等需要反复制作的领域中,实用性可能会提高。
企业用"Codex Labs"同时公开
OpenAI在本次发布的同时,还推出了企业用新服务"Codex Labs"。该服务旨在帮助组织更轻松地引入OpenAI的编码辅助工具"Codex"。
据公司方面称,"Codex Labs"通过提供工作坊和技术教育培训项目来支持开发者适应。此外,还支持将现有开发工具与Codex进行连接对接。这超越了单纯的软件供应,是一种紧密支持在企 业环境中实际落地的导入过程。
本次发布表明,OpenAI正在生成式AI竞争中从"个人用实验工具"的形象转向"企业生产力平台"。"ChatGPT Images 2.0"增强了图像生成的准确性和实务便利性,而"Codex Labs"则扮演着降低开发组织内AI引入门槛的角色。市场上分析认为,未来AI企业间的竞争不仅会围绕模型性能本身,还将扩大到多大程度上能自然融入实际工作。
TP AI 注意事项 本文使用 TokenPost.ai 基础语言模型进行摘要。主要内文可能被省略或与事实不符。

