OpenAI最新发布的GPT-Image 2.5模型,最受关注的升级点在于极稳定的一致性:它能精确执行用户的编辑需求,同时避免额外的画面变化、漂移或抖动。这一特性催生了一种新玩法——用ChatGPT Work(或Codex)配合GPT-Image 2.5,一次性生成多张图片作为视频帧,再合成GIF动图。
常规做法是让模型先在一张图里按4x4阵列排布16帧画面,再由ChatGPT Work切分成16张小图并合成GIF;过程中若发现偏差还会自动修正。更烧token的方式则是每一帧都独立生成,有案例显示,GPT-Image 2生成的画面存在明显漂移,而GPT-Image 2.5的版本已接近视频级甚至实拍级的流畅度。这种稳定性有望改善营销图片微调、视频修帧等场景,并减少对PS等专业软件的依赖。
不过,实际测评结果并不如网上案例那般惊艳。测试以一位粘土风格的持剑少年为主角,分为基础类和极限类两大场景。基础类涵盖动作、运镜、环境空间和物理效果。
在动作测试中,简单的踢腿动作表现流畅,16帧能正确循环回第一帧,主体细节没有随机漂移。但把动作复杂化——加入拔剑、挥砍并扩展到48张图片后,人物出现明显随机抖动,拔剑和入鞘动作有错误,帧与帧之间还出现了左右腿互换的生物准确性错误。让主体原地旋转360度时,旋转并不匀速,后半段有快速跳变,不过头发这类高复杂度对象基本保持一致。两个主体同时做不同动作时,水平方向出现明显画面漂移。
运镜测试中,镜头拉远推近完成得不错;但垂直环绕运镜在从头顶绕到背后时出现突兀跳变,模型把相机上下位翻转了。环境与空间测试难度更高:背景变化时,不参与跳舞的山体、城堡、月亮等对象无法保持静止;空间透视处理中剑的透视效果尚可,但随机抖动增多,持剑手有生物准确性错误,腿部前后脚被一致放大,违背了近大远小的原则。穿透三维空间的测试观感较差,室内走动一帧带过,增加图片数并提高思考强度后整体流畅不少,但第20帧到第21帧仍有明显跳变。物理测试中,水被处理得像凝胶,篮球弹跳时出现不符合物理规律的拉伸变形。
极限类测试要求每一帧都独立生成,每秒10帧、时长3到5秒。还原参考案例时,仅“持剑少年原地旋转360度”就耗时30分钟,效果远达不到展示案例的丝滑程度;换成更简单的皮克斯风格也没有改善,甚至出现发型变化。把图片数从30张增加到72张、每秒24帧后,结果反而更差。变形金刚变身案例中,变形过程整体没有严重随机抖动,前半部分遵循了机械变形物理特性,后半部分则转向流体性质的变形手法,最终形态与参考图仍有距离。
总体来看,GPT-Image 2.5在基础测试中基本只擅长透明或纯色背景下单主体的简单动作和简单运镜,难度稍增就容易翻车,触发随机抖动和人体结构错误等低级问题。极限测试中,连最简单的旋转动作都无法稳定实现。即便改用GPT-Image 2.5 Sunburst Max生成帧分解图,旋转过程中仍有明显的头部摆动。
值得注意的是,即便输出完美结果,也是GPT-Image 2.5与GPT-6 Astra合力的功劳——后者会在执行过程中持续检查画面连续性并修复错误图片。但GPT-Image 2.5仍达到了里程碑式进步:这些基础动效过去需要专业动画软件才能实现,其背后反映的是图像生成工作流最关心的指标——抽卡成功率预计将大幅提升,直接对应生产成本的下降。另一个隐含优势是,连续生成30到72张图像后,画质仍保持一定水准,没有出现其他模型常见的多轮编辑后模糊、噪点、线条扭曲等缺陷,从而能更好支持深度工作。
GPT-Image 2.5发布后,图像模型的竞争焦点预计将转向长流程、多步骤、强约束任务中的稳定性和成本效益。