Back to archive
#ai#news#aigen#benchmarks

OpenAI wydało ChatGPT Images 2.5

OpenAI wydało 8 września ChatGPT Images 2.5. Wdrażanie obejmuje wszystkie plany ChatGPT, ChatGPT Work i Codex, w aplikacjach oraz w przeglądarce. W API dostępne są dwa modele: Sunburst, nastawiony na precyzyjne poprawki, i szybszy Flare. Mają lepiej zachowywać szczegóły obrazów referencyjnych oraz elementy, których użytkownik nie chce zmieniać przy kolejnych edycjach.

Modele przyjmują tekst i obrazy, a zwracają obrazy. API nalicza za milion tokenów 5 dolarów za tekst wejściowy, 8 za obrazy wejściowe i 30 za obrazy wyjściowe. Obsługuje rozdzielczości do 4K, z dłuższym bokiem nie większym niż 3840 pikseli; rozmiary powyżej 2560 × 1440 są eksperymentalne. Nadal obowiązuje filtrowanie poleceń i wyników. Karta systemowa Images 2.5 opisuje testy obu wariantów oraz zabezpieczenia odziedziczone po wersji 2.0.

Dwa modele i obsługa generowania w API

Dokumentacja Sunburst wskazuje go do zadań, w których ważna jest zgodność edycji z poleceniem. Flare ma skracać oczekiwanie przy codziennym generowaniu. Według producenta Flare oferuje wyższą jakość i opóźnienie mniejsze o 50% względem GPT Image 2. To deklaracja OpenAI, bez niezależnego pomiaru czasu dla przedstawionych niżej prób Arena.

W Image API można bezpośrednio wybrać model i zlecić generowanie lub edycję. Responses API udostępnia je jako narzędzie modelu prowadzącego rozmowę, który może przekształcić polecenie przed przekazaniem go generatorowi. Integracja pozwala kontynuować edycje z zachowaniem kontekstu wcześniejszych odpowiedzi. Wyniku takiego procesu nie należy przypisywać wyłącznie modelowi obrazowemu. Przewodnik API opisuje oba sposoby wywołania.

Sunburst i Flare dodają ustawienia jakości xhigh i max do dotychczasowych low, medium i high. Dostępne formaty to PNG, JPEG i WebP; przezroczystość wymaga PNG albo WebP. Przed użyciem modeli może być konieczna weryfikacja organizacji w API.

Arena: generowanie, edycja jednego obrazu i wielu referencji

Arena porównuje odpowiedzi modeli ukrytych pod anonimowymi oznaczeniami; uczestnik poznaje ich nazwy po oddaniu głosu. Metoda mierzy preferencje użytkowników, więc wynik punktowy nie jest procentem poprawnie wykonanych zadań.

Poniższe odczyty rankingu zestawiają nowe warianty z GPT Image 2 przy ustawieniu medium. Arena oznacza wyniki Images 2.5 jako wstępne. Przy ich nazwach nie podaje analogicznego ustawienia jakości, dlatego tabela nie jest porównaniem przy jednakowym budżecie obliczeń.

Próba ArenaSunburstFlareGPT Image 2 (medium)
Generowanie obrazu z tekstu1421 ±131399 ±131381 ±4
Edycja jednego obrazu1520 ±91491 ±91461 ±3
Edycja z wieloma obrazami wejściowymi1535 ±91501 ±81454 ±4

Wynik Arena Score i raportowana niepewność. Źródła: Text-to-Image, Single Image Edit, Multi Image Edit; odczyt 9 września 2026 roku. Każdy wiersz pochodzi z odrębnego rankingu, więc punktów nie należy porównywać między wierszami.

W generowaniu z tekstu Sunburst miał 3149 głosów, a Flare 2856, wobec 78 731 dla poprzednika. Arena przypisuje obu nowym modelom możliwe miejsca od pierwszego do drugiego. Sam porządek wierszy nie rozstrzyga więc jeszcze ich kolejności.

chatgpt-images-2-5-arena-score.png

Źródłowy wykres Arena dla edycji jednego obrazu: Arena Score i przedziały ufności dla czołowych modeli. GPT Image 2 oceniano przy medium; Sunburst i Flare mają status wyników wstępnych. Źródło: Image Edit Arena, dane strony z 8 września 2026 roku.

W edycji jednego obrazu Sunburst zebrał 6704 głosy, Flare 5676, a GPT Image 2 ponad 235 tys. Nowe warianty prowadzą w tym odczycie, ale mają znacznie krótszą historię ocen.

chatgpt-images-2-5-arena-wins.png

Drugi wykres Image Edit Arena przedstawia średni odsetek wygranych przeciw poszczególnym przeciwnikom, po wyłączeniu remisów: 76,73% dla Sunburst, 72,20% dla Flare i 64,52% dla GPT Image 2 (medium). To inna miara niż Arena Score i nie oznacza odsetka bezbłędnych edycji. Dane strony z 8 września 2026 roku.

Szkic i komentarze ułatwiają wskazanie poprawki

Nowy interfejs dodaje szkicowanie, szablony i komentarze umieszczane przy wybranym fragmencie obrazu. Użytkownik może wskazać miejsce zmiany bez opisywania jego położenia w długim poleceniu. Są to funkcje aplikacji, których nie daje samo wybranie nazwy modelu w API.

Graham Barlow z TechRadar testował wydanie przez dobę. Zwraca uwagę na komentarze, szkice i możliwość wracania do wcześniejszych wersji po każdej edycji. To praktyczne ułatwienia przy poprawianiu projektu, ale jego próby nie są kontrolowanym porównaniem modeli. Ina Fried z Axios sprawdzała edycję własnego zdjęcia kota, projektu tatuażu i znaku graficznego.

Dokumentacja nadal ostrzega przed błędami w napisach, niedokładnym rozmieszczaniem elementów i utratą spójności powracających postaci lub oznaczeń marki. Maska edycji jest wskazówką dla modelu, a nie gwarancją zachowania każdego piksela poza zaznaczeniem. W pracy nad materiałem ze ściśle określonym tekstem lub identycznym logo potrzebna pozostaje kontrola tych elementów po każdej poprawce.

Testy bezpieczeństwa i porównanie z Images 2.0

Karta Images 2.0 opisywała już filtrowanie poleceń i obrazów, metadane o pochodzeniu zgodne z C2PA oraz niewidoczny znak wodny. Rozumowanie i korzystanie z wyszukiwania w odpowiednim trybie też nie pojawiają się dopiero w 2.5.

Nowa karta porównuje obie wersje na ustalonym zbiorze celowo trudnych poleceń. Odsetek niedozwolonych obrazów, które dotarły do użytkownika mimo zabezpieczeń, wyniósł 1,09% dla Sunburst, 1,41% dla Flare i 1,64% dla Images 2.0. Żadna różnica tej miary nie była istotna statystycznie przy progu p < 0,05. Nie jest to potwierdzona poprawa bezpieczeństwa ani pomiar częstości takich zdarzeń w zwykłym ruchu.

W testach wiedzy biologicznej i cybernetycznej model odpowiadał tekstem narysowanym na obrazie. Oceniano odpowiedź końcową, bez wykonywania działań przez agenta. Żaden wariant nie przekroczył firmowego progu High; OpenAI zachowuje jednak ostrożnościowe zabezpieczenia dla ryzyka biologicznego.

Images 2.5 stosuje C2PA i znak wodny SynthID od Google DeepMind w ChatGPT, Codex i API. Nowa karta nazywa mechanizm znakowania wprost. Warstwowa ocena wejścia i wygenerowanego obrazu pozostaje potrzebna także przy edycjach, w których szkodliwy sens może wynikać z połączenia polecenia z dostarczoną fotografią.

Równe stawki nie oznaczają równego rachunku

Sunburst i Flare mają identyczne stawki za token. Odczyt tekstu z pamięci podręcznej kosztuje 1,25 dolara za milion tokenów, a analogiczny odczyt obrazów 2 dolary. Rachunek za obraz zależy jednak od liczby zużytych tokenów i jakości. Przy Responses API dochodzi praca modelu prowadzącego rozmowę.

Przy porównywaniu kosztów warto zapisać model, rozmiar, jakość i zużycie zwrócone w polu usage, a następnie policzyć również ponowienia i czas kontroli. Wyższy wynik Sunburst w rankingu edycji nie rozstrzyga, czy oszczędzi więcej poprawek w konkretnym zestawie materiałów. Dla aplikacji wykonującej dużo edycji przydatny będzie test na tych samych obrazach wejściowych, z osobnym liczeniem błędów w obszarach, które miały pozostać bez zmian.

Źródła

Źródła pierwotne

Niezależne analizy i relacje

Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.