GPT Image 2 vs GPT Image 1.5:速度陷阱
OpenAI 从两阶段到单阶段推理的跃迁,不只是像素生成更快,而是在改变图像生成本身。
营销人员会告诉你,GPT Image 2 “快了 3 到 5 倍”。泄露的 benchmark 显示,生成时间从八秒降到三秒以内。但很少有人讨论的是,当想法和图像之间的间隔被压缩到这种程度时,你的大脑会发生什么变化。
过去一周,我观察了一些早期测试者在 OpenAI 的灰度发布中使用 GPT Image 2。差别不是渐进式提升,而是类别变化。GPT Image 1.5 像是在点客房服务,GPT Image 2 像是在拧开水龙头。听起来只是小小的便利,直到你发现自己不再认真规划提示词,而是开始直接“把想法说出来”。
没人主动关心的架构变化
GPT Image 1.5 使用两阶段管线。第一步先生成 latent plan,第二步再通过 diffusion 过程补齐像素。这个设计很优雅,但也是你盯着加载图标等十秒、看模型“思考”的原因。GPT Image 2 据称转向了单次推理。一次通过,一个模型,一口气完成。
这也是黄色偏色消失的原因。在两阶段系统中,色温会很早被决定并锁定,后面的细节阶段很难推翻它。Image 1.5 的早期用户学会了在提示词里加上 “cool white lighting” 或 “overcast daylight”,只为对抗那层琥珀色调。Image 2 不再需要这些技巧。颜色和材质在同一个时刻被协调,这更接近真实光线的工作方式。
速度是架构变化的副作用,但正是这个副作用改变了一切。
三秒对工作流意味着什么
八秒时,图像生成是一个决策。你写提示词、等待、评估、迭代。这像是在和自己开会。三秒时,它变成一种反射。灰度测试组的用户并没有生成更少的图片。相反,他们生成了十倍数量,然后丢掉其中九成。探索成本降到了接近零。
一位和我聊过的设计师受 NDA 限制,我们叫她 M。她说,用 Image 1.5 时,自己的流程像是在“给自由职业者写 brief”。用 Image 2 时,更像是“拿铅笔速写”。她不再试图第一次就写出完美提示词,而是先生成四个变体,找到姿态正确的一张,然后沿着那个方向继续变化。对话从提示词工程变成了视觉即兴。
这听起来像小事,但不是。当循环从分钟缩短到秒,创意不再像计划好的 campaign,而更像现场表演。工具消失了,剩下的是你和图像本身。
分辨率的烟雾弹
是的,Image 2 据称原生支持 4K,最高 4096×4096。营销材料一定会把它放在最前面。可以忽略。对 95% 的使用场景来说,社交帖子、网站头图、应用商店截图,1536px 已经足够。分辨率提升对印刷设计师和档案场景重要。对其他人来说,它只是一个不错的附加项,远不如速度关键。
高分辨率真正重要的地方,是文字渲染。GPT Image 1.5 可以生成一块远看可信的街道路牌,只要你别放大。Image 2 据称正在接近 99% 的字符级准确率。我看过一张泄露截图,是一张假的 IKEA 标签,眯眼看完全能过关。瑞典语产品名拼对了。字体粗细有一点不对,但那种不对像人类失误,而不是模型坏掉。图像中文字的恐怖谷正在被跨过去。
代价
问题总会有。GPT Image 1.5 目前在 LM Arena 以 1264 的 ELO 排名第一,是生产环境里更稳的选择。Image 2 仍然通过 “packingtape-alpha” 这类遮掩代号泄露出来。如果你今天要搭 API 管线,就不能依赖它。价格还没有下降,SLA 也不存在。而当 OpenAI 真正打开开关时,4K 档几乎肯定会比当前高分辨率档更贵,而当前高分辨率已经是每张 0.133 美元。
速度还有心理层面的副作用。当生成这么快时,你会停止认真看每一张图,开始用平均表现来判断。你评价一个模型时看的不再是二十张里最好的一张,而是最差的一张。这会把一致性的要求抬高到一个单靠速度无法解决的水平。
结论
如果你是 ChatGPT Plus 用户,并且 Image 2 推送到了你的账号,直接用,不必回头。单是色彩准确度省下的时间,就会超过速度宣传本身。如果你是在 API 上构建产品,现在先继续使用 Image 1.5,但把代码里的 model 参数设计成变量,而不是常量。OpenAI 的历史说明,发布可能会突然到来,价格也可能在第一个季度内调整两次。
GPT Image 1.5 让图像生成变得可靠。GPT Image 2 正在让它变得隐形。可靠和隐形之间的区别,就是“你在使用一个工具”和“你忘了自己在使用工具”的区别。这就是速度设下的陷阱:一旦你尝过三秒,八秒就像拨号上网。之后就很难回去了。