OpenAI最新發布的GPT-Image 2.5模型,最受關注的升級點在於極穩定的一致性:它能精確執行使用者的編輯需求,同時避免額外的畫面變化、漂移或抖動。這一特性催生了一種新玩法——用ChatGPT Work(或Codex)配合GPT-Image 2.5,一次性生成多張圖片作為影片幀,再合成GIF動圖。

常規做法是讓模型先在一張圖裡按4x4陣列排布16幀畫面,再由ChatGPT Work切分成16張小圖併合成GIF;過程中若發現偏差還會自動修正。更燒token的方式則是每一幀都獨立生成,有案例顯示,GPT-Image 2生成的畫面存在明顯漂移,而GPT-Image 2.5的版本已接近影片級甚至實拍級的流暢度。這種穩定性有望改善營銷圖片微調、影片修幀等場景,並減少對PS等專業軟體的依賴。

不過,實際測評結果並不如網上案例那般驚豔。測試以一位粘土風格的持劍少年為主角,分為基礎類和極限類兩大場景。基礎類涵蓋動作、運鏡、環境空間和物理效果。

在動作測試中,簡單的踢腿動作表現流暢,16幀能正確迴圈回第一幀,主體細節沒有隨機漂移。但把動作複雜化——加入拔劍、揮砍並擴充套件到48張圖片後,人物出現明顯隨機抖動,拔劍和入鞘動作有錯誤,幀與幀之間還出現了左右腿互換的生物準確性錯誤。讓主體原地旋轉360度時,旋轉並不勻速,後半段有快速跳變,不過頭髮這類高複雜度物件基本保持一致。兩個主體同時做不同動作時,水平方向出現明顯畫面漂移。

運鏡測試中,鏡頭拉遠推近完成得不錯;但垂直環繞運鏡在從頭頂繞到背後時出現突兀跳變,模型把相機上下位翻轉了。環境與空間測試難度更高:背景變化時,不參與跳舞的山體、城堡、月亮等物件無法保持靜止;空間透視處理中劍的透視效果尚可,但隨機抖動增多,持劍手有生物準確性錯誤,腿部前後腳被一致放大,違背了近大遠小的原則。穿透三維空間的測試觀感較差,室內走動一幀帶過,增加圖片數並提高思考強度後整體流暢不少,但第20幀到第21幀仍有明顯跳變。物理測試中,水被處理得像凝膠,籃球彈跳時出現不符合物理規律的拉伸變形。

極限類測試要求每一幀都獨立生成,每秒10幀、時長3到5秒。還原參考案例時,僅“持劍少年原地旋轉360度”就耗時30分鐘,效果遠達不到展示案例的絲滑程度;換成更簡單的皮克斯風格也沒有改善,甚至出現髮型變化。把圖片數從30張增加到72張、每秒24幀後,結果反而更差。變形金剛變身案例中,變形過程整體沒有嚴重隨機抖動,前半部分遵循了機械變形物理特性,後半部分則轉向流體性質的變形手法,最終形態與參考圖仍有距離。

總體來看,GPT-Image 2.5在基礎測試中基本只擅長透明或純色背景下單主體的簡單動作和簡單運鏡,難度稍增就容易翻車,觸發隨機抖動和人體結構錯誤等低階問題。極限測試中,連最簡單的旋轉動作都無法穩定實現。即便改用GPT-Image 2.5 Sunburst Max生成幀分解圖,旋轉過程中仍有明顯的頭部擺動。

值得注意的是,即便輸出完美結果,也是GPT-Image 2.5與GPT-6 Astra合力的功勞——後者會在執行過程中持續檢查畫面連續性並修復錯誤圖片。但GPT-Image 2.5仍達到了里程碑式進步:這些基礎動效過去需要專業動畫軟體才能實現,其背後反映的是影像生成工作流最關心的指標——抽卡成功率預計將大幅提升,直接對應生產成本的下降。另一個隱含優勢是,連續生成30到72張影像後,畫質仍保持一定水準,沒有出現其他模型常見的多輪編輯後模糊、噪點、線條扭曲等缺陷,從而能更好支援深度工作。

GPT-Image 2.5釋出後,影像模型的競爭焦點預計將轉向長流程、多步驟、強約束任務中的穩定性和成本效益。