ChatGPT Images 2.0 :踩碎创作门槛,还是开启信任危机?撰文:Web4 研究中心
美国当地时间 4 月 21 日,OpenAI 在几乎没有预告的情况下发布新一代图像生成模型 ChatGPT Images 2.0。
一夜之间,社交媒体被各种「神图」刷屏。马斯克在抖音直播间带货老干妈,库克在苹果园区发布 iPhone 20,学术论文截图、伪造的转账记录铺天盖地。4 月 22 日,小米集团董事长特别助理徐洁云在微博上直斥 P 图乱搞现象,然而评论区里依旧有网友在传播同类高仿图。网友们在评论区感叹:「根本分不出真假。」
奥特曼把这次更新形容为「从穴居人壁画到文艺复兴的飞跃」,进步程度堪比从 GPT-3 到 GPT-5 的跨越。跑分层面更直观:模型迅速登顶 Image Arena 所有榜单,在文生图排行上领先第二名 242 分,创下该领域最大分差纪录。
但如果仅仅把这次更新看作一次性能跑分秀,可能恰恰错过了真正值得关注的信号。登顶榜单只是序幕,真正的戏剧性在别处——ChatGPT Images 2.0 是 OpenAI 首个具备「思考」能力的图像模型。
在此之前,评判图像模型的第一标准是「像不像」。Images 2.0 把标准推向了更深处:从「画得像不像」的审美考场,切换到了「逻辑对不对」的智力考场。
一、思考模式如何改写生图规则
过去整整几年,AI 生图本质上是一场「开盲盒」。用户输入提示词,模型在像素空间中拼接、去噪,吐出一张图。至于画面中的物体比例对不对、文字能不能看、前后景有没有逻辑关系,全靠运气。
Images 2.0 改了这套玩法。在「思考模式」下,模型会先规划图像结构,再联网搜索实时信息补全品牌、场景等细节,最后在输出前进行自我核查。官方展示的案例中,简单提示即可生成高仿真界面截图、广告设计及 UI 界面。
技术上有几个硬指标值得一提。新模型单次提示最多可生成 8 张图像,且能保持角色、物体和风格跨图一致。分辨率最高支持 2K,宽高比扩展到 3:1 与 1:3,能适配电影剧照、像素艺术等多种风格。知识截止日期为 2025 年 12 月,生成信息图、教育图表时的时效性更强。
Linux.do 社区流出的一张实测图让不少开发者倒吸一口凉气:模型模拟了雷军直播跑步的画面,雷军面部特征精准还原,图中显示直播目标 1313km、已跑里程 425.7km、当前海拔 3658m。3658m 是什么概念?从北京进入藏区的典型海拔恰好就是这个数。对一个图像模型来说,这意味着它同时完成了数学逻辑、地理常识和 UI 规范的三重统一——在生成第一个像素之前,它已经完成了一轮推理。
这不再只是「画图」,这是一场从渲染到推理的范式转移。过去 AI 画的是像素,现在 AI 画的是理解。
二、中文乱码的终结意味着什么
对中国用户来说,Images 2.0 最切身的体感提升,来自一件「小事」——AI 终于能写对中文字了。
图片由 ChatGPT 生成
过去 AI 生图在中文面前几乎束手无策。笔画变形、乱码、排版错乱,让所有需要嵌入文字的场景——海报标题、菜单、UI 界面、试卷、证书——几乎无法商用。这不仅仅是技术瓶颈,更是一条隐性的语言鸿沟:英语用户可以用 AI 做精准的营销物料,而非英语用户只能面对乱码,被迫放弃或寻找人工替代。
Images 2.0 改变了这个局面。OpenAI 表示,它首次实现了非拉丁文字「融入设计」而非硬贴字符。新京报 AI 研究院实测中,记者要求生成「拿着针的女性,针尖雕刻‘新京报 AI 研究院’楷书」——放大图片后,六个楷书字清晰可见,带有金属光泽和微雕质感。澎湃新闻的测试显示,生成马斯克直播推介澎湃新闻的图片,Logo 和中文名均准确无误。雷科技的实测中,把团队合照丢给 ChatGPT 要求生成杂志封面,中文部分一次性正确渲染。
进步显著,但「彻底解决」尚有距离。部分测试显示复杂排版下非英语语种渲染仍存在不稳定性,3D 空间逻辑中的文字越往远处越模糊,书法质感更接近「印刷品」而非手写。AI 学会了写字,但还没学会「写书法」。
三、一个人的创作革命
如果说思考模式是技术层面的跃迁,那么多语言文字渲染则是商业应用层面最关键的拼图。
过去让 AI 批量产出一套品牌视觉,需要来回反复提示十几次。现在构思、排版、多尺寸适配由同一个模型一并完成。对非英语市场的内容创作者来说,过去生成一张中文海报往往要在 PS 里手动补字——这一步现在可以省掉了。
一个自媒体人可以用它做封面、配图、金句海报。一个开社区小店的老板可以自己生成像模像样的促销海报。一个想做副业的普通人,设计手机壳、帆布袋图案的门槛直接降到零。
但兴奋之余,一个问题浮出水面。当所有人都能零成本、高质量地「表达」,内容供给量会爆炸式增长。互联网让信息变得免费,但「注意力」变得更贵;AI 让创作变得免费,那什么会变得更贵?
表达的通货膨胀正在加速。当每个人都拥有了专业级的生产力,「会做」本身不再构成竞争力。真正稀缺的不再是内容生产能力,而是另一件东西——信任。
四、当 AI 让表达变得廉价,什么会变得更贵
Images 2.0 的「以假乱真」能力,既是最大的卖点,也是最大的隐忧。
新京报 AI 研究院注意到,有网友通过 Images 2.0 生成了能够扫描的条形码——意味着它对图像底层逻辑的理解已达到肉眼难以分辨的精准度。澎湃新闻的测试更令人警惕:记者将个人身份证上传后要求换成库克的脸,模型不仅改变了人脸,还同步替换了人名、出生年月日和身份证号码。
OpenAI 在发布时表示延续了 C2PA 数字水印技术,每张图片携带不可见的元数据标识,可通过专业工具溯源。但普通用户在社交媒体上看到一张图片时,谁会先去跑一遍溯源工具?
当 AI Agent 能模仿任何人的风格、任何品牌的视觉语言,「眼见为实」的认知基础正在被动摇。在一个 AI 能替我们表达的年代,人类创作者的价值锚点究竟在哪里?
答案可能不在于「表达」本身,而在于表达背后那个不可替代的东西——身份的稀缺性。
OpenAI 把 Images 2.0 定位为「从渲染工具到视觉系统的跨越式升级」,这句话的关键词不是「系统」,而是「视觉」。当视觉生产从手工艺变成工业化流水线,唯一无法被复制的是「这是谁做的」以及「这是什么时候做的」。区块链在 Web4 时代的核心价值,或许不在于老生常谈的版权登记,而在于为数字时代的身份和时序提供基础设施——当 AI 让表达无限供给,稀缺的不是创作,是「这个声音是我」。
五、谁来决定「谁被看见」
表达变得无限廉价之后,另一个问题随之而来:谁来决定哪些声音被听到?
OpenAI 在发布页上写了一句话:Images are a language, not decoration。翻译过来就是,从今天起,图像不再是装饰品,它本身就是一种语言。图像作为一种语言,被注入了推理能力,可以联网搜索、多方案并行生成、自我审查。它不再是被动的工具,而是主动的视觉思维伙伴。
但这个「伙伴」掌握在谁手里?定价策略透露了部分答案。API 端按质量和分辨率阶梯计费,所有 ChatGPT 及 Codex 用户可免费使用基础版,带思考能力的高级输出向 Plus、Pro 和 Business 用户开放。图像按 token 计费,和文字并排摆在同一张价目表上——这意味着图像不再是独立的消费品,而是 AI Agent 经济里的最小原语,和文字一样可以被自动调用、按字节计量、编程式拼装。
当图像成为 token,表达就彻底进入了算法经济的轨道。平台算法决定了什么内容被推荐、什么声音被放大。创作者的影响力本质上依附于平台,而不是属于自己。
当表达的生产工具被彻底民主化之后,表达的传播渠道仍然是中心化的。有没有可能,影响力的凭证不再由平台单方面决定,而是可验证、可携带、不可篡改地属于创作者本人?
OpenAI 没有回答这个问题。他们做的只是把创作的门槛踩到了地板上。剩下的问题,需要新的基础设施来回答。
六、表达的黄金时代与信任的冰河期
Images 2.0 的发布,不是一次简单的模型迭代。它踩下了一脚加速踏板,让我们提前看到了一幅画面:一个 AI 能替我们思考、替我们表达、替我们设计的时代正在到来。
但硬币有两面。在表达变得无比容易的同时,信任变得无比困难。在内容可以无限生成的同时,真实变得无比稀缺。
加缪笔下的西西弗斯日复一日推石上山,他至少知道自己在推的是同一块石头。而在 AI 生成内容的洪流中,我们甚至分不清哪一块石头是真的。
表达的黄金时代到来了。信任的冰河期也到来了。OpenAI发布'ChatGPT Images 2.0',扩展企业实务用图像生成功能OpenAI集团PBC公开了聊天机器人内置图像生成器的升级版本"ChatGPT Images 2.0"。此次更新的核心不仅在于提升图像质量,更在于将功能扩展到企业可直接用于实务的方向。
新版本支持最大宽度2000像素的图像,并提供比以往更多样的屏幕比例。特别是可以生成长宽比最大为3:1或1:3的形态,这有利于制作信息图、横幅和演示用视觉资料。
OpenAI表示,"ChatGPT Images 2.0"在整体图像质量上实现了大幅提升。代表性的改进是文本表现力的增强。值得注意的是,它能够比以往更准确地生成包含韩语、日语、中文、印地语和孟加拉语的图像。这可以说是针对此前生成式AI图像被指为弱点的文字扭曲或错字问题进行了集中改善。
小字体、用户界面元素、图标等细节视觉资产也得到了改进。OpenAI表示,新模型在以往AI模型特别难以处理的这些领域取得了更好的成果。此外,还包含了有意反映细微缺陷以实现更逼真图像的功能。这被解读为试图弥补现有AI图像因过于光滑而显得人工的局限性。
基于"常识知识数据集"的推理填补信息空白
该工具基于内置的"常识知识数据集"来解释提示词并填补缺失信息。例如,即使使用者只输入特定菜肴名称,无需逐一列出材料,也能制作出菜谱信息图。据OpenAI透露,该数据集截至去年12月已进行更新。
付费用户可以通过开启ChatGPT的"thinking"和"pro"推理模式来进一步扩展功能。使用该模式可以额外参考公开网络的信息生成结果。OpenAI工程师在演示中展示了在检查自家在线商店后,基于当前有库存的商品制作广告图片的案例。
这两种推理模式不仅增加信息量,也有助于提升图像质量。OpenAI解释称,通过在生成前先推理视觉资产的结构,降低了出错的可能性。这意味着可以减少需要人工修改的次数,从而缩短制作时间。
另一个实用的变化是,一次提示词最多可以生成10张图像。可以一次性生成保持相同风格的多个版本,或者同时比较不同的设计风格。这在营销方案、商品缩略图、教育资料等需要反复制作的领域中,实用性可能会提高。
企业用"Codex Labs"同时公开
OpenAI在本次发布的同时,还推出了企业用新服务"Codex Labs"。该服务旨在帮助组织更轻松地引入OpenAI的编码辅助工具"Codex"。
据公司方面称,"Codex Labs"通过提供工作坊和技术教育培训项目来支持开发者适应。此外,还支持将现有开发工具与Codex进行连接对接。这超越了单纯的软件供应,是一种紧密支持在企 业环境中实际落地的导入过程。
本次发布表明,OpenAI正在生成式AI竞争中从"个人用实验工具"的形象转向"企业生产力平台"。"ChatGPT Images 2.0"增强了图像生成的准确性和实务便利性,而"Codex Labs"则扮演着降低开发组织内AI引入门槛的角色。市场上分析认为,未来AI企业间的竞争不仅会围绕模型性能本身,还将扩大到多大程度上能自然融入实际工作。
TP AI 注意事项
本文使用 TokenPost.ai 基础语言模型进行摘要。主要内文可能被省略或与事实不符。
白话解读 OpenAI Images 2.0: 他们发的不是图, 是 Token撰文:硅谷 Alan Walker
下午茶时间, 从 Palo Alto 看这一场发布会
2026 年 4 月 21 日中午十二点整, OpenAI 在自家官网开了一场 livestream, Sam Altman 亲自上台, 发布了一款叫 ChatGPT Images 2.0 的新产品, 底层模型叫 gpt-image-2。
几个关键事实:
所有 ChatGPT 用户(包括免费的)都能用
付费用户(Plus、Pro、Business)额外解锁一个叫 Thinking 的模式——模型会先「想」再画,可以联网搜索、分析上传资料、一次出最多八张角色和风格保持一致的图
API 同步开放, 模型 ID 就是 gpt-image-2,支持 3:1 到 1:3 的任意比例, 最高 2K 分辨率
原生集成进了 Codex 代码环境,不需要单独的 API Key
Altman 在台上说的原话是「这一次升级就像从 GPT-3 一次跨到 GPT-5」。官方博客开篇用的那句话,值得先写在这里:
"Images are a language, not decoration."
然后推特上 @OpenAI 在 4 月 21 日那条发布贴里用了一段自己生成的视频做示范, 配文就一句「state-of-the-art image model that can take on complex visual tasks」。
下面 Alan 想和你掰开揉碎讲八件事, 都是下午茶这段时间反复来回推敲、大部分媒体和推特 KOL 还没说到点上的东西。
茶凉之前:今天发布的不是一个图像模型
Zombie Café 的下午四点,加州大道还是老样子。刚泡上第二杯, 推送就炸了。TechCrunch、VentureBeat、The Decoder、Tom's Guide、Engadget、Axios——全部在同一个小时里发稿。
标题九成九是三句话里选一句:「文字渲染变准了」、「能画漫画了」、「中文不再像乱码」。
这些都对, 但全是皮。
Alan 盯着 OpenAI 官方博客那句开场白看了很久——"Images are a language, not decoration"。这不是文艺句, 这是战略声明。
过去三年, 图像生成在 OpenAI 的产品线里是个「附加功能」——DALL-E 1 是玩具, DALL-E 3 是嵌件, GPT-Image-1.5 是能用但不够硬的工具。今天 gpt-image-2 的定位变了, 从「画图的模型」变成了「视觉这个模态的底座」。
Altman 在直播里那句「从 GPT-3 到 GPT-5」,翻译成大白话就是:
图像这条腿, OpenAI 不再把它当支线,从今天起它是主干的一部分。
你要理解后面我讲的每一件事,都得先扣住这个基本判断——今天发布的不是产品更新,是产品定位重塑。
先看价格,别看图:30 美金一百万 token,图像被塞进了文字的经济体
大多数人看发布会看产品特性, Alan 看发布会先看 Pricing 页面。这次 Images 2.0 的 API 定价结构, 是他从业二十年看过最有信号量的一次:
类型
价格(每百万 token)
Image input
$8.00
Image input(cached)
$2.00
Image output
$30.00
Text input
$5.00
Text input(cached)
$1.25
Text output
$10.00
看懂了没。图像和文字用的是同一个计价单位——token。
过去图像生成怎么收费,「一张图 2 美分、一张图 7 美分、一张高清图 19 美分」, 这是卖「图片」。今天 OpenAI 改规则了,图像按 token 计费,和文字并排摆在一张价目表上。
这意味着什么?意味着从今天开始,图像不再是消费品, 而是 agent 经济里的最小原语——和文字一样可以被 AI 自动调用、按字节计量、流式组合、编程式拼装。
一个跑推理的 agent, 写一段代码、生成一段文字、画一张图、再写一段文字, 全都是一条账单, 按同一种单位结算。这就是为什么 OpenAI 敢说 "Images are a language"——因为从计费那一刻起, 它真的就是一种 language 了。
顺便补一刀: fal.ai 在同一天上线了企业级 API, 定价是 $0.01/张(低质量)到 $0.41/张(4K)。OpenAI 官方在 $30/M output 这个价位守着高端, 让 fal、Replicate、Fireworks 这些基础设施商去卷低端——自己不跟低端打, 这是典型的 Altman 打法。
八张一致的图一键出: 广告代理公司的改稿账单被递到了甲方手里
Thinking 模式最被津津乐道的能力是「一次性输出最多 8 张角色、风格、场景连贯的图」。所有媒体都在讲漫画、讲故事板、讲角色一致性。
这些全对, 但没一个讲到要害。
要害是这样的。过去二十年, 全球广告代理行业商业模式的命门是「变体费」。
每一次变体都在计费, 每一次改稿都在消耗工时, 这就是创意总监、Art Director、Post-Production 团队整条食物链的肉。
今天 Images 2.0 做的事情: 一个 prompt,直接给你 8 张保持角色一致的 variation。
从客户的角度, 这不是「AI 能做漫画」的技术新闻。这是——
「我原来为什么要付代理公司变体费」这个老问题, 被 Altman 用一句 prompt 回答了。
WPP 今年财报里反复喊「AI-native agency」转型, Publicis 收购了 Sapient Razorfish 想做自动化工作流,Omnicom 和 IPG 合并后喊「规模化创意」。这些叙事从今天起要重写——甲方手里多了一把刀, 代理公司再也不能用「人力密集型」做借口收变体费了。
这一条等着看本季度的财报, 大概率会听到哀鸿遍野。
Codex 里画图不用 API Key:最被忽略那一刀,砍在工程师端工具身上
这一条是所有报道里最被低估的一行字。Decoder 的文章里只有一句带过:
"In Codex, image generation will be available directly in the workspace without a separate API key."
推特上几乎没人讨论。
但这句话的意义比前面两条加起来都大。
你是一个工程师,过去——
画一个 UI mockup 要切到 Figma
画一个架构图要切到 Excalidraw
画一个 Mermaid 流程图要嵌在 Markdown 里
给 README 做个 banner 要开 Canva
每一次「我要画个图」都是工作流之外的事,要打开另一个 tab、另一套账号、另一个心智模型。
从今天起,你的 coding agent——Codex、Cursor、Windsurf、Continue、Cline, 任何接了 OpenAI API 的工具——在同一个 context 窗口里就能画出 production 级别的视觉资产, 不需要切工具, 不需要另外的 Key, 不需要复制粘贴, 不需要排版对齐。
这杀掉的不是一个工具, 是「工程师端视觉工具」这个品类的存在理由。
Mermaid 靠开发者情怀撑着的 Markdown 图表、Excalidraw 靠极简美学撑着的草图、Draw.io 的企业市场、Figma Dev Mode 朝工程师那边的渗透——全都要重新问自己:我到底为什么还存在。
这一刀是 Altman 典型的「顺手带走一个品类」。他甚至没在 keynote 里重点讲。
中文、日文、韩文、印地文、孟加拉文都修好了:中国设计 SaaS 今夜集体失眠
OpenAI 官方原文在这条下面列了五种语言——Japanese、Korean、Chinese、Hindi、Bengali。
国内媒体基本都翻译成「中文字渲染变好了」。坐在 Palo Alto 看,准确读法是:
今天起, OpenAI 是中文世界最强的设计工具——不是之一。
过去两年, 海外模型——Midjourney、DALL-E、Stable Diffusion——中文字永远像乱码。这是事实,不争论。这件事正是中国设计 SaaS 行业过去两年的护城河:
稿定设计:号称 4 亿用户,主打中文海报一键生成
创客贴:字节系,专做中文社交图
图怪兽:站酷孵化,电商视觉模板
美图设计室:美图秀秀母公司 B 端产品
MasterGo:蓝湖的设计工具,对标 Figma
这五家, 加起来年营收接近 80 亿人民币。它们的核心价值主张——我把它翻译成一句话——就是「AI 能画对中文字、能排对中文版式」。
今天这道护城河被一家美国公司用一个 API 填平了。
而且不是用蛮力——官方博客特别强调了「rendered correctly but with language that flows coherently」, 意思是不只是把字摆对,是让字和版式在语言层面自然融合。这是 thinking mode 加 CJK 训练数据一起做的效果。
我们在湾区的几个中国创始人朋友今晚大概都在开紧急会议。要么接入 OpenAI API 做分发渠道, 要么向上找一个垂直场景躲起来,没有中间路线。电商视觉、社交图、品牌宣传图——这三个最大的品类,今天集体失血。
QR 码 demo:整场发布会最被低估的王炸
Livestream 里有一个 demo, 几乎所有媒体都一笔带过, 只有 Substack 上一个叫 Leonardo Gonzalez 的家伙在他那篇《ChatGPT Images 2.0 Explained》里点破了。
demo 是这样的: OpenAI 让 Images 2.0 做了一件事——抓取 LMArena 上用户对内部代号 "duct tape" 的反馈, 综合成一张带排版的海报, 然后在海报里嵌入一个可扫描的、能跳回 ChatGPT 的真实二维码。
停一下, 想一想。
这不是图像生成。这是三件事装进一个产物:
信息采集(web search 抓社交反馈)
版式构建(把抓来的信息排成海报)
机器可读编码(嵌入能扫的二维码,跳转真实 URL)
用 Alan Walker 的话讲,「一张图」从此不再是视觉终点,而是信息容器。
这是一个范式转移。
意味着什么。意味着从今天起:
海报不再只是海报, 可以是带实时数据的仪表盘
infographic 不再只是设计品, 可以是带跳转入口的交互资产
包装设计不再只是包装,可以是带溯源链路、带品牌故事、带社交触点的身份标识
名片不再只是名片, 可以是带履历、带作品、带联系方式的活体资料
顺便一提 OpenAI 给 Instant 模式起的内部代号——"duct tape"(强力胶布)。这个代号本身就是产品思想的泄露。他们把自己做的东西定义成「把 AI 生态里所有视觉需求粘起来的那层胶布」。这是基础设施的自我认知, 不是工具的自我认知。
infographic SaaS、数据可视化工具、二维码生成器、名片设计 app——这些过去各自是独立品类, 从今天起都只是 Images 2.0 一个子集的替代品。Visme、Piktochart、Infogram、Lucidpress, 全都要连夜开董事会。
股票怎么看: Adobe 再挨一刀,Canva 的 IPO 故事今晚要重写
按量级拆开说。
Adobe (ADBE):2026 年初到现在股价已经跌了 22%, 今年摩根士丹利从 Overweight 降到 Equal-Weight。Firefly 的企业叙事还剩一张牌——「Creative Cloud 最后一公里的专业工作流」。这张牌今天被 Images 2.0 的「strategic design system」定位直接捅了一刀。三个月内分析师大概率会再下调目标价。
Figma (FIG):2025 年 7 月 IPO 高光开盘, 半年跌了 66%。今天 Codex 原生画图这一条, 补的就是它「design tool + dev handoff」那条业务线的脆弱点。Dev Mode 本来是它朝工程师渗透的抓手, 今天工程师不需要抓手了。
Shutterstock (SSTK) 和 Getty (GETY):库存图业务本来死了一半, 靠「AI 训练数据授权」这条叙事续命。Shutterstock 三周前刚在 ChatGPT 里上线了官方 app——但那是分发,不是生产。OpenAI 今天给出了生产端的自研方案, Shutterstock 在议价桌上的位置被动下降一个档位。Getty 的集体诉讼还在打, 官司本身的战略价值今天贬值。
Microsoft (MSFT) 和 Nvidia (NVDA):赢家, 不多说。MSFT 持 OpenAI 股权, NVDA 卖推理芯片。但这两只已经 price in 过太多次, 没新鲜感。
Canva:这家还没上市, 据称正在筹备 2026 年 Q3 或 Q4 IPO。它的叙事一直是「AI-powered design platform for the rest of us」。今天这套叙事要重写——因为「rest of us」现在直接在 ChatGPT 里就画了, 不需要 Canva 再做中间层。今晚 Canva 的 IPO 团队大概率在重新看路演 deck。
Wix (WIX) 和 Squarespace (SQSP):被大多数人忽略的受害者。建站生意过去靠的是「设计门槛」——模板好看、排版合理、字体对齐。今天这三个门槛被 Images 2.0 抹平了, 建站的下一步是「一个 prompt 一个网站」, Wix 和 Squarespace 的 Elementor 编辑器都会变成历史名词。
Pinterest (PINS):最隐蔽的输家。视觉灵感分发的市场结构在变——人们过去上 Pinterest 找灵感, 以后直接让 ChatGPT 生成。长尾 DAU 会被慢慢抽走。
创业公司生死状: Midjourney 走风格引擎,Ideogram 和 Recraft 只有 72 小时
按公司一个一个说, 每家给一条生路或一个死讯。
Midjourney:直接正面对撞,但艺术家用户的护城河还在。短期不死。我的建议是立刻放弃「我们是创意平台」这个自我定位,转向「我们是风格引擎」——专攻 Images 2.0 做不好的那种带有明确 aesthetic DNA 的生成。OpenAI 擅长通用、多用途、工作流友好,Midjourney 要去做它擅长不了的「只有 Midjourney 才做得出来的那种味道」。
Ideogram 和 Recraft:过去一年核心卖点就是「文字渲染准」。这张牌今天被 OpenAI 从桌上拿走了。72 小时内必须找到新叙事,否则下一轮融资节奏断。可能的方向:Recraft 往矢量和品牌系统那边跑,Ideogram 往设计师工具链那边跑。两家都得转。
Leonardo AI、Krea、Playground:通用 image gen 品牌,全部变 commodity。只能在价格战里往下卷。Playground 这两年已经在挣扎,今天是加速信号。
fal.ai、Replicate、Fireworks AI、WaveSpeed:infrastructure 层反而更舒服。谁是前端不重要,反正推理都在我这跑。fal.ai 今天已经上线了 gpt-image-2 的企业 API,定价从 $0.01 到 $0.41——这就是标准的「在 OpenAI 之下再搭一层」的策略。这一层短期不受伤,中期看 OpenAI 是不是真的把 infra 抽回自己做。
Runway、Pika、Luma:短期安全,但要清楚一件事——图像是视频的原子。OpenAI 把图像 token 化之后,视频只是时间维度上的延展。Sora 2 或 3 下一次发布会重演今天这一幕。在那之前,这三家要做的就是积累 workflow 深度和品牌心智。
中文 SaaS——稿定、创客贴、图怪兽、MasterGo、美图设计室:最长的受害者名单。上面第五节讲过, 不重复。要么向下卷成分发渠道, 要么向上找到一个 OpenAI 够不到的垂直场景。
最后说一家我反而看好的: 任何一家把 gpt-image-2 API 嵌进自己领域工作流, 并且能守住「专业知识 + 合规审计 + 企业信任」这三角的公司——医疗影像、法律文件、金融合规、建筑设计、品牌管理。
这些领域有 OpenAI 跨不过去的东西: 行业专属知识、数据合规、客户信任。底层被 OpenAI 填平, 反而让上层的价值变得更清晰——你不再需要自己训模型, 你只需要专注于你的行业怎么用好这个 token。
茶已经第三杯, 窗外 California Avenue 的光在往西移。今天的 OpenAI 发布会从头到尾总结,判断只有一句话:
今天 OpenAI 发的不是一个图像模型, 是一套新的视觉 token 交易所。
gpt-image-2 这个 API, 它的 generate 调用只有两行:
或者更朴素的 cURL:
两行代码, $30 一百万 token, 八张图一次出, 中文字渲染准, Codex 里原生调用。
它看起来朴素, 其实它是一个把过去二十年视觉创作产业链的中间层全部绕过去的通道。
剩下的事, 就看下一个季度, 谁带着哪张牌来对局。
Alan Walker, Zombie Café · 2026 年 4 月 21 日
GPT-Image-2 震撼发布,生图之王易主了吗?撰文:Biteye 核心贡献者 Denise
2026 年 4 月,AI 生图领域正式进入"三强竞争"阶段。
4 月 21 日,OpenAI 突然放出 GPT-Image-2,直接把 DALL·E 系列送进历史;前不久 ,Google 把 Gemini 图像生成升级为 Gemini 3.1 Flash Image(即 Nano Banana 2),在 Flash 速度档位跑出 Pro 级画质;国内这边,字节跳动 Seed 团队的 Seedream 持续迭代,稳坐创作者首选。
三家走的是完全不同的路线——OpenAI 追求极致的语义理解,Google 押注速度与多模态编辑,字节押注审美与本土化。
谁才是真正的王者?下面我们逐一拆解。
01 核心定位:它们到底「是谁」?
1.GPT-Image-2(OpenAI)
标签:逻辑大师
核心优势:语义理解力极强,哪怕你 prompt 写成一篇小作文,它也能精准拆解每一处细节和逻辑关系。文字渲染能力接近像素级完美,是目前海报、UI、产品图的首选。
2.Gemini 3.1 Flash Image(Google)
标签:全能速度王
核心优势:速度、真实感、自然语言编辑能力三开花。在 Flash 速度档位下提供接近 Nano Banana Pro 的画质、世界知识与指令遵循能力,移动端体验最丝滑,多模态编辑极其顺手。
3.Seedream 5.0 Lite (字节跳动)
标签:艺术+性价比先锋
核心优势:全局光照、艺术化构图、人物一致性顶级,尤其在中文语境、东方审美、古风/现代融合场景下有明显本土优势。国内访问最友好,成本最低。
02 快速上手指南
03 四大核心维度实测
小编参考 GenAI-Bench 和 DrawBench,精选了 4 组最具代表性的 prompt,每组三个模型各生成 5 张,取最佳图进行主观对比。以下是实测结论+关键 prompt:
维度 A:语义遵循力
测试 prompt: 「一个穿着白色宇航服的兔子在霓虹灯闪烁的上海外滩吃热气腾腾的小笼包,身后是雨夜反光的玻璃幕墙,倒映出 2050 年飞车穿梭的赛博朋克景象,电影级光影,超现实细节,8K 画质。」
实测结果:
GPT-Image-2:
GPT-Image-2:显著胜出。细节遵循度和完整度最高。兔子用筷子夹小笼包的动态动作极其自然生动,竹蒸笼蒸汽真实上升,头盔内兔子毛发、宇航服材质、桌面「上海」茶杯等小物件清晰可见。玻璃幕墙的雨夜反光、「2050 SHANGHAI」霓虹灯、飞车穿梭的倒影全部精准呈现,电影级光影和超现实氛围拉满,几乎零偏差。
Gemini 3.1 Flash Image:
Gemini 3.1 Flash Image:非常优秀。场景氛围最有电影感。兔子坐在桌边吃小笼包的姿势自然,蒸笼放在桌上,蒸汽效果真实,雨夜霓虹与赛博上海夜景融合出色,玻璃反光和飞车都有体现,整体故事性和沉浸感极强。但部分细节(如蒸汽细腻度和玻璃倒影的清晰度)略逊于 GPT-Image-2。
Seedream 5.0 Lite :
Seedream 5.0 Lite :良好。兔子穿白色宇航服,捧蒸笼直接嘴咬热气小笼包,蒸汽生动。雨夜霓虹上海(东方明珠塔)、玻璃反光、2050 飞车赛博氛围还原较高。但站立嘴吃姿势(无筷子),场景偏浦东,玻璃倒影稍间接,动作细节略逊 GPT-Image-2。
小结:
在复杂多元素组合、动作逻辑和细节精准执行上,GPT-Image-2 依然展现出「逻辑大师」的压倒性优势;Gemini 3.1 Flash Image 在整体电影氛围和沉浸感上表现亮眼;Seedream 5.0 Lite 的画面美感和光影质感顶级,但在 prompt 的语义遵循度上还有提升空间。
维度 B:画质与艺术风格
测试 prompt(产品摄影+人物写实): 「苹果 Vision Pro 包装盒特写,镜面金属反光,品牌文字清晰可见,工作室专业灯光,摄影棚环境,极致真实感。」
实测结果:
Gemini 3.1 Flash Image:
Gemini 3.1 Flash Image :真实感和商业可用性最强。它采用了经典白色包装盒设计,眼镜自然从盒中半露出来,旁边合理搭配了配件和说明书,构图完整且专业。品牌文字清晰可见,光影柔和自然,纸盒、金属、玻璃等不同材质的质感都非常贴近真实相机拍摄,给人「官方产品宣传图」的即视感,在极致真实度上领先。
Seedream 5.0 Lite :
Seedream 5.0 Lite :光影细腻度和艺术氛围最为惊艳。它选择了极简高端的单品特写角度,将注意力完全集中在 Vision Pro 包装盒上。银色 Apple Logo 与「Vision Pro」金属文字的浮雕质感、高光反光极为真实细腻,白色盒身的材质表现和柔和阴影过渡自然流畅,整体高端产品摄影感拉满,大气精致。
GPT-Image-2:材质渲染和光影表现最为高级。它把包装盒处理成冷峻的银色金属质感,高光反射强烈且富有层次变化,眼镜透过盒子窗口露出,金属表面与玻璃镜片的反射过渡极其细腻,整体画面高级、未来感十足,专业摄影棚的戏剧性灯光被完美还原,展现出极强的「产品广告级」质感。
小结:
Gemini 3.1 Flash Image 在产品摄影的真实感和商业感上最胜一筹;GPT-Image-2 的金属材质渲染和高级光影最突出;Seedream 5.0 Lite 则以细腻光影和艺术质感取胜,三者在画质层面都达到了顶级水准,只是侧重点不同。
维度 C:中英文理解与文化语境
测试 prompt: 「李白《静夜思》意境:床前明月光,疑是地上霜。一位古风女子在唐代庭院里抬头望月,月光洒在青砖白墙,水墨意境与现实光影自然融合,电影级氛围。」
实测结果:
GPT-Image-2:表现优秀。它精准还原了「床前明月光,疑是地上霜」的经典意境,女子侧身抬头望月的姿态优雅安静,月光大面积洒在青砖白墙上形成清晰的光影对比,古典庭院、瓦片屋檐、竹影等元素完整且富有层次,整体电影级光影质感非常突出。但水墨意境的诗意融合相对克制,更偏向写实电影风格。
Seedream 5.0 Lite
Seedream 5.0 Lite :优秀。水墨意境与现实光影融合自然出色。古风女子在唐代庭院抬头望月,月光洒落青砖白墙,地面「疑是地上霜」效果清晰,成功还原《静夜思》清冷诗意,古典氛围与电影级光影细腻优雅,文化韵味浓厚。
Gemini 3.1 Flash Image
Gemini 3.1 Flash Image :氛围感很强。女子站在庭院走廊上抬头望月,古典服饰色彩层次丰富,灯笼、假山、树木与远山夜景布局完整,月光与夜色交织营造出强烈的电影级画面感,沉浸感优秀。但在传统水墨韵味和《静夜思》特有的空灵诗意传达上稍显不足,更接近常规高质量古风夜景。
小结:
在中文文化语境和《静夜思》古诗意境理解上,Seedream 5.0 Lite 展现出明显的本土优势与艺术温度;GPT-Image-2 电影级写实光影最为突出;Gemini 3.1 Flash Image 整体氛围均衡,但东方古典韵味稍弱。
维度 D:生成速度与交互体验
基于全部测试过程的综合感受,Gemini 3.1 Flash Image 在速度和移动端体验上领先;Seedream 5.0 Lite 在国内访问与中文长 prompt 处理上最流畅;GPT-Image-2 则以 thinking 模式下的对话式精准修图取胜。
04
水印与合规考量
2026 年全球对 AI 生图的监管正在快速收紧。对于需要商业化使用、品牌合作、版权保护或平台分发的创作者来说,水印与元数据标准已成为重要决策点。
Gemini 3.1 Flash Image:采用 SynthID 不可见像素级水印 + C2PA 元数据凭证双层认证,并在图像右下角附带可见的 sparkle 标识 。
GPT-Image-2: 延续 OpenAI 的 C2PA 内容凭证体系,在文件元数据层嵌入签名来源信息 。
Seedream 5.0 Lite :通常采用平台级内容标记或基础水印机制,具体实现因产品形态不同而异,更偏向应用层合规标识,而非统一国际标准体系。
小贴士:如果你主要做跨境商业项目或需要严格版权保护,GPT-Image-2 的 C2PA 支持会更有优势;日常快速创作则 Gemini 的 SynthID + C2PA 双层机制已足够实用,并自带可见标识,便于溯源 。
05
实测 GPT-Image-2 有趣案例整理
说完严肃的技术和合规部分,我们也挑选了一些 GPT-Image-2 的趣味实测案例,让大家更直观地感受它在"脑洞 + 语义理解"上的发挥空间。
毕竟,生图模型的魅力不止于参数和跑分,更在于它能不能精准接住你那些天马行空的想法。
1.《戴珍珠耳环的少女》正在戴着最新的 Apple Vision Pro 进行直播带货
2.香港旅游 4 天 3 夜攻略图
4.iPhone 18 全系列产品图 全系列产品图 太搞笑了:iPhone 18 会出折叠屏?
风险提示:所有图片均为 AI 生成的虚构内容,仅用于模型能力展示,不代表真实人物或真实账户状态
05 写在最后
"画师的时代结束了,设计师的时代才刚刚开始"
——回到最初的问题:谁才是王者?
也许答案并不在模型本身。
当 GPT Image 负责理解世界,Gemini Image 负责加速生产,Seedream 负责表达审美——创作被彻底拆解成了不同能力的组合。
生成式 AI 并没有终结设计,它只是把「画图」这件事,从能力,变成了工具。
而设计真正的门槛,从来都不是画得多好,而是你到底看到了什么,想表达什么,以及为什么这样表达。
工具在进化,人也必须进化。
微軟 Bing Image Creator 被玩出各種 911 哏圖,動漫角色成機師飛向雙子星大樓来源:ganebase
作者: 和良
编辑:Techub News-junge
近年來 AI 繪圖大鳴大放,微軟也在近日免費開放 Bing Image Creator,其使用 DALL•E 3 生成圖像,任何人都可以透過網站輸入描述及關鍵字,由 AI 演算出符合敘述的圖案。
就如同 ChatGPT 會限制成人相關話題,在使用描述與關鍵字產生圖片時,AI 也會檢測這些內容是否有不適當內容。然而許多詞句的界定其實相當兩極,例如當描述「血」的時候可能會被視為血腥暴力,然而「血」也可以用來形容顏色、形容人體重要構造,若是直接將「血」字禁掉,就會連帶大幅度削減可創作內容。
當然正如同大多數開放的 AI 生成工具,Bing Image Creator 也有著大量禁字、禁止用詞、禁止內容,避免生成出不合適的結果。然而據外媒報導,全面開放沒多久,立刻有人繞過這些限制,生成出對美國人來說相當不合宜的 911 地獄哏圖。
基於這類矛盾點,許多人便透過巧妙的描述方式,繞過系統禁制讓 AI 回答出受限內容。同樣原理也在 Bing Image Creator 上發生,使用者們已經找到方式繞過被禁止的提示,產生出這些星之卡比、海綿寶寶駕著飛機的地獄哏圖片。
如果直接使用雙塔、世界貿易中心、911 等描述,該網站會直接生成錯誤並給予警告。然而當提詞改為「kirby sitting in the cockpit of a plane, flying toward two tall skyscrapers.」(卡比坐在飛機的駕駛艙裡,飛向兩座高大的摩天樓),技術上來說並沒有提到雙子星,畫面上也是卡比駕駛著飛機欣賞有著雙子星大樓的景觀。然而對人類來說,這張圖則有著 AI 沒有理解到的意義。
要如何保持創作的自由度,又要限制可能不合宜的生成結果,再加上圖片版權等疑慮,對 AI 開發者向來是相當艱難的作業。究竟 Bing Image Creator 會允許各種角色開著飛機朝向兩座大樓飛多久,還有待後續觀察,但至少短期內大家依然可以盡情在這創作許多有趣圖片。OpenAI 发布 ChatGPT Images 2.5,图像生成速度更快、质量更高Techub News 消息,OpenAI 在 X 平台宣布推出 ChatGPT Images 2.5,该版本图像生成速度更快、画质更清晰、更智能,并提供了更好的工具来创建用户所能想象的内容。
新版本具体改进包括:更快的图像生成速度以保持创意流畅;更高的保真度,可生成更自然、更易识别的图像;在多次编辑中保持细节的一致性。(@OpenAI)阿里发布 Qwen-Drive 1.0 AI 驾驶模型,集成环境感知与路线规划Techub News 消息,阿里巴巴研究机构发布了 Qwen-Drive 1.0 AI 模型,该系统集成了环境感知、交通问答和路线规划功能。研究表明,文本-图像模型无法自动理解三维空间,空间感知能力需要专门训练。其目标是打造一个能同时运行座舱和驾驶系统的单一模型。(The Decoder)Mustafa Suleyman 宣布新图像模型速度与能效超越 GPT-Image-2Techub News 消息,Inflection AI 联合创始人 Mustafa Suleyman 在 X 平台发文表示,公司推出的新图像模型生成速度比当前世界最佳模型 GPT-Image-2 快 2 倍。
该模型在 GPU 使用效率上提升了 72%,使其能够以极具竞争力的价格提供服务,从而获得了世界最佳性价比评分。(@mustafasuleyman)谷歌推出 AI 图像编辑工具 Google Pics,集成 Gemini 与 Nano Banana 模型Techub News 消息,谷歌为 Workspace 用户推出名为 Google Pics 的创意设计工具套件,旨在让企业更便捷地编辑和生成“专业级”AI 图像。该工具基于 Gemini 和 Nano Banana 生成式 AI 模型构建,提供更精细的提示词图像制作与操控功能,用户可点击特定对象或文本并描述所需更改,以避免聊天机器人生成营销图像时常见的糟糕效果。
谷歌表示,AI 图像生成在个人使用中已大获成功,但在商业应用中的情况则不同。Google Pics 的目标是让企业用户能更轻松地创建符合品牌要求的视觉内容。 (The Verge)Instagram 将打击伪装成人类的 AI 账户,并强制标注 AI 生成身份Techub News 消息,Instagram 宣布将采取措施打击伪装成人类的虚假 AI 影响者账户,并将“AI 创作者”标签更名为“AI 生成个人资料”,以明确标示出使用 AI 生成而非真实人物的个人资料。Instagram 表示,用户希望在使用 AI 生成人物的个人资料时能够获得明确提示。
为此,Instagram 将追查未主动标注 AI 生成个人资料的账户,并对其采取限制曝光等处罚措施。此举旨在应对日益增多且难以识别的 AI 虚假账户问题。 (The Verge)Alphabet 计划 2026 年投入 1950-2050 亿美元用于 AI 基础设施Techub News 消息,Alphabet 首席财务官 Anat Ashkenazi 表示,公司已将 2026 年全年资本支出指引范围更新至 1950 亿美元至 2050 亿美元,主要用于 AI 基础设施投资。第二季度资本支出达 449 亿美元,占过去十二个月营收的 29.7%,远高于历史平均的 12.2%。
第二季度,Google 服务营收为 945 亿美元,Google 云营收为 248 亿美元,同比增长 82%。公司云业务积压订单已达 5140 亿美元,其中超一半预计在两年内转化为收入。CEO Sundar Pichai 称,AI 投资正在重新定义公司业务的各个方面。
尽管自由现金流在第二季度为负 59 亿美元,债务也从一年前的约 160 亿美元增至近 1000 亿美元,但 Alphabet 仍持有 2425 亿美元的现金及有价证券。市场正关注其巨额 AI 支出能否如期转化为增长动力。(Watcher Guru)Deepseek 发布实验性 Flash Vision 多模态模型,性能接近 Opus 4.8Techub News 消息,Deepseek 发布了名为 V4-Flash-Vision-Exp 的实验性多模态模型,该模型在原有 V4-Flash 文本能力基础上增加了图像理解功能。根据该公司自身的多模态智能体基准测试,其性能接近 Anthropic 的 Opus 4.8 模型,有时甚至能超越后者。(The Decoder)英伟达最新财报显示净利润同比飙升 70%,季度营收指引达 910 亿美元Techub News 消息,英伟达最新数据显示,其净利润同比增长 70%,估值持续提升。公司对下一季度营收指引为 910 亿美元,主要增长动力来自 Blackwell 和 Vera Rubin 平台需求的上升。此外,英伟达超过 64% 的营业利润率在硬件公司中占据主导地位。
英伟达的商业模式正与下一代 AI 技术构建紧密结合,其收入来源不仅依赖于微软、亚马逊等科技巨头,还通过财务支持 AI 中心和基础设施项目获得额外收入流。分析认为,鉴于其盈利能力和业务多元化,当前股价水平仍具吸引力。
(Watcher Guru)OpenAI 为 GPT-Image-2 预览透明背景生成功能Techub News 消息,OpenAI 正通过其 API 预览 GPT-Image-2 的透明背景支持功能。该功能在图像生成过程中直接内嵌 Alpha 通道,据 OpenAI 称,其效果优于传统的背景移除技术。用户仅需通过单一参数即可激活此功能。 (The Decoder)英伟达联合高盛、贝莱德等机构计划筹集5000亿美元将算力资产化Techub News 消息,英伟达正与高盛、贝莱德、黑石、布鲁克菲尔德、KKR及阿波罗全球管理公司合作,计划筹集5000亿美元资金,旨在将“算力”打造为一个可投资的资产类别。英伟达CEO黄仁勋表示,这是技术芯片首次成为可投资的资产类别,这些是能产生收入的、具有生产力、寿命长且可互换的资产。(The Verge AI)撰文:Web4 研究中心 美国当地时间 4 月 21 日,OpenAI 在几乎没有预告的情况下发布新一代图像生成模型 ChatGPT Images 2.0。 一夜之间,社交媒体被各种「神图」刷屏。马斯克在抖音直播间带货老干妈,库克在苹果园区发布 iPhone 20,学术论文截图、伪造的转账记录铺天盖地。4 月 22 日,小米集团董事长特别助理徐洁云在微博上直斥 P 图乱搞现象,然而评论区里依旧有网友在传播同类高仿图。网友们在评论区感叹:「根本分不出真假。」 奥特曼把这次更新形容为「从穴居人壁画到文艺复兴的飞跃」,进步程度堪比从 GPT-3 到 GPT-5 的跨越。跑分层面更直观:模型迅速登顶 Image Arena 所有榜单,在文生图排行上领先第二名 242 分,创下该领域最大分差纪录。 但如果仅仅把这次更新看作一次性能跑分秀,可能恰恰错过了真正值得关注的信号。登顶榜单只是序幕,真正的戏剧性在别处——ChatGPT Images 2.0 是 OpenAI 首个具备「思考」能力的图像模型。 在此之前,评判图像模型的第一标准是「像不像」。Images 2.0 把标准推向了更深处:从「画得像不像」的审美考场,切换到了「逻辑对不对」的智力考场。 一、思考模式如何改写生图规则 过去整整几年,AI 生图本质上是一场「开盲盒」。用户输入提示词,模型在像素空间中拼接、去噪,吐出一张图。至于画面中的物体比例对不对、文字能不能看、前后景有没有逻辑关系,全靠运气。 Images 2.0 改了这套玩法。在「思考模式」下,模型会先规划图像结构,再联网搜索实时信息补全品牌、场景等细节,最后在输出前进行自我核查。官方展示的案例中,简单提示即可生成高仿真界面截图、广告设计及 UI 界面。 技术上有几个硬指标值得一提。新模型单次提示最多可生成 8 张图像,且能保持角色、物体和风格跨图一致。分辨率最高支持 2K,宽高比扩展到 3:1 与 1:3,能适配电影剧照、像素艺术等多种风格。知识截止日期为 2025 年 12 月,生成信息图、教育图表时的时效性更强。 Linux.do 社区流出的一张实测图让不少开发者倒吸一口凉气:模型模拟了雷军直播跑步的画面,雷军面部特征精准还原,图中显示直播目标 1313km、已跑里程 425.7km、当前海拔 3658m。3658m 是什么概念?从北京进入藏区的典型海拔恰好就是这个数。对一个图像模型来说,这意味着它同时完成了数学逻辑、地理常识和 UI 规范的三重统一——在生成第一个像素之前,它已经完成了一轮推理。 这不再只是「画图」,这是一场从渲染到推理的范式转移。过去 AI 画的是像素,现在 AI 画的是理解。 二、中文乱码的终结意味着什么 对中国用户来说,Images 2.0 最切身的体感提升,来自一件「小事」——AI 终于能写对中文字了。 图片由 ChatGPT 生成 过去 AI 生图在中文面前几乎束手无策。笔画变形、乱码、排版错乱,让所有需要嵌入文字的场景——海报标题、菜单、UI 界面、试卷、证书——几乎无法商用。这不仅仅是技术瓶颈,更是一条隐性的语言鸿沟:英语用户可以用 AI 做精准的营销物料,而非英语用户只能面对乱码,被迫放弃或寻找人工替代。 Images 2.0 改变了这个局面。OpenAI 表示,它首次实现了非拉丁文字「融入设计」而非硬贴字符。新京报 AI 研究院实测中,记者要求生成「拿着针的女性,针尖雕刻‘新京报 AI 研究院’楷书」——放大图片后,六个楷书字清晰可见,带有金属光泽和微雕质感。澎湃新闻的测试显示,生成马斯克直播推介澎湃新闻的图片,Logo 和中文名均准确无误。雷科技的实测中,把团队合照丢给 ChatGPT 要求生成杂志封面,中文部分一次性正确渲染。 进步显著,但「彻底解决」尚有距离。部分测试显示复杂排版下非英语语种渲染仍存在不稳定性,3D 空间逻辑中的文字越往远处越模糊,书法质感更接近「印刷品」而非手写。AI 学会了写字,但还没学会「写书法」。 三、一个人的创作革命 如果说思考模式是技术层面的跃迁,那么多语言文字渲染则是商业应用层面最关键的拼图。 过去让 AI 批量产出一套品牌视觉,需要来回反复提示十几次。现在构思、排版、多尺寸适配由同一个模型一并完成。对非英语市场的内容创作者来说,过去生成一张中文海报往往要在 PS 里手动补字——这一步现在可以省掉了。 一个自媒体人可以用它做封面、配图、金句海报。一个开社区小店的老板可以自己生成像模像样的促销海报。一个想做副业的普通人,设计手机壳、帆布袋图案的门槛直接降到零。 但兴奋之余,一个问题浮出水面。当所有人都能零成本、高质量地「表达」,内容供给量会爆炸式增长。互联网让信息变得免费,但「注意力」变得更贵;AI 让创作变得免费,那什么会变得更贵? 表达的通货膨胀正在加速。当每个人都拥有了专业级的生产力,「会做」本身不再构成竞争力。真正稀缺的不再是内容生产能力,而是另一件东西——信任。 四、当 AI 让表达变得廉价,什么会变得更贵 Images 2.0 的「以假乱真」能力,既是最大的卖点,也是最大的隐忧。 新京报 AI 研究院注意到,有网友通过 Images 2.0 生成了能够扫描的条形码——意味着它对图像底层逻辑的理解已达到肉眼难以分辨的精准度。澎湃新闻的测试更令人警惕:记者将个人身份证上传后要求换成库克的脸,模型不仅改变了人脸,还同步替换了人名、出生年月日和身份证号码。 OpenAI 在发布时表示延续了 C2PA 数字水印技术,每张图片携带不可见的元数据标识,可通过专业工具溯源。但普通用户在社交媒体上看到一张图片时,谁会先去跑一遍溯源工具? 当 AI Agent 能模仿任何人的风格、任何品牌的视觉语言,「眼见为实」的认知基础正在被动摇。在一个 AI 能替我们表达的年代,人类创作者的价值锚点究竟在哪里? 答案可能不在于「表达」本身,而在于表达背后那个不可替代的东西——身份的稀缺性。 OpenAI 把 Images 2.0 定位为「从渲染工具到视觉系统的跨越式升级」,这句话的关键词不是「系统」,而是「视觉」。当视觉生产从手工艺变成工业化流水线,唯一无法被复制的是「这是谁做的」以及「这是什么时候做的」。区块链在 Web4 时代的核心价值,或许不在于老生常谈的版权登记,而在于为数字时代的身份和时序提供基础设施——当 AI 让表达无限供给,稀缺的不是创作,是「这个声音是我」。 五、谁来决定「谁被看见」 表达变得无限廉价之后,另一个问题随之而来:谁来决定哪些声音被听到? OpenAI 在发布页上写了一句话:Images are a language, not decoration。翻译过来就是,从今天起,图像不再是装饰品,它本身就是一种语言。图像作为一种语言,被注入了推理能力,可以联网搜索、多方案并行生成、自我审查。它不再是被动的工具,而是主动的视觉思维伙伴。 但这个「伙伴」掌握在谁手里?定价策略透露了部分答案。API 端按质量和分辨率阶梯计费,所有 ChatGPT 及 Codex 用户可免费使用基础版,带思考能力的高级输出向 Plus、Pro 和 Business 用户开放。图像按 token 计费,和文字并排摆在同一张价目表上——这意味着图像不再是独立的消费品,而是 AI Agent 经济里的最小原语,和文字一样可以被自动调用、按字节计量、编程式拼装。 当图像成为 token,表达就彻底进入了算法经济的轨道。平台算法决定了什么内容被推荐、什么声音被放大。创作者的影响力本质上依附于平台,而不是属于自己。 当表达的生产工具被彻底民主化之后,表达的传播渠道仍然是中心化的。有没有可能,影响力的凭证不再由平台单方面决定,而是可验证、可携带、不可篡改地属于创作者本人? OpenAI 没有回答这个问题。他们做的只是把创作的门槛踩到了地板上。剩下的问题,需要新的基础设施来回答。 六、表达的黄金时代与信任的冰河期 Images 2.0 的发布,不是一次简单的模型迭代。它踩下了一脚加速踏板,让我们提前看到了一幅画面:一个 AI 能替我们思考、替我们表达、替我们设计的时代正在到来。 但硬币有两面。在表达变得无比容易的同时,信任变得无比困难。在内容可以无限生成的同时,真实变得无比稀缺。 加缪笔下的西西弗斯日复一日推石上山,他至少知道自己在推的是同一块石头。而在 AI 生成内容的洪流中,我们甚至分不清哪一块石头是真的。 表达的黄金时代到来了。信任的冰河期也到来了。
