OpenAI wydało GPT-6.1 Sol. Cache potaniał o połowę
29 września 2026 roku OpenAI udostępniło GPT-6.1 Sol, tydzień po premierze GPT-6 Sol. Standardowe stawki API pozostają na poziomie 2 USD za milion tokenów wejścia i 10 USD za milion tokenów wyjścia. Zmieniła się cena odczytu ponownie użytego kontekstu: 0,20 → 0,10 USD za milion tokenów. Dla agenta, który wielokrotnie wysyła ten sam początek rozmowy, definicje narzędzi i pliki projektu, może to być ważniejsze niż kolejny punkt w benchmarku. Szczegóły podają komunikat OpenAI i karta modelu API.
Model jest dostępny w API jako gpt-6.1-sol oraz w ChatGPT Work i Codex dla planów Plus, Pro, Business, Enterprise i Edu. W dniu premiery nie trafił jeszcze do zwykłego trybu Chat. Obsługuje tekst i obrazy na wejściu, generuje tekst, ma kontekst 1,05 mln tokenów i limit odpowiedzi 128 tys. tokenów. Dostępne poziomy rozumowania to low, medium, high, xhigh i max.
Gdzie widać poprawę
W DeepSWE 1.1, teście zadań programistycznych w repozytoriach, GPT-6.1 Sol uzyskał 75,2% przy high i koszcie 0,65 USD za zadanie. Poprzedni Sol osiągał najwyżej 68,8% przy max za 2,74 USD, a GPT-6 Astra 74,1% przy xhigh za 4,43 USD. Zmiana o 6,4 punktu procentowego względem poprzednika jest istotniejsza niż minimalna przewaga nad Astrą. Dodatkowo nowy Sol przy max ma na tym wykresie 71,9%, czyli mniej niż przy high, mimo wyższego kosztu. Większy budżet rozumowania nie daje tu automatycznie lepszego wyniku.

Źródło: OpenAI. DeepSWE 1.1: odsetek zaliczonych zadań względem średniego kosztu w USD na zadanie. Wskazane punkty dotyczą różnych poziomów rozumowania.
W zadaniach złożonych dokumentów PDF wynik jest bliski Astrze: 32,0% przy high za 0,35 USD wobec 32,2% przy xhigh za 1,91 USD. Opus 5.5 z modelami zastępczymi uzyskał 28,8% przy high za 0,83 USD. GDP.pdf sprawdza odpowiedzi na pytania o tabele, wykresy, diagramy i drobne zapisy w dokumentach z pracy zawodowej. W AutomationBench 1.0.6 nowy Sol osiąga 31,7% przy medium, wobec 26,9% poprzedniego Sola w tym samym ustawieniu.

Źródło: OpenAI. GDP.pdf: odsetek poprawnych odpowiedzi względem średniego kosztu w USD na zadanie. Wynik Opus 5.5 uwzględnia modele zastępcze; punkty odpowiadają różnym poziomom rozumowania.
To wyniki publikowane przez OpenAI. Modele GPT badano w środowisku badawczym lub przez API, a dane konkurentów pochodzą z publicznych raportów. Nie jest to porównanie wszystkich modeli przy identycznym oprogramowaniu prowadzącym agenta. Warto też uważać na małe różnice w DeepSWE: niezależny audyt Scrimdata wykrył błędy lub niejasności w 37 ze 113 zadań wersji 1.1. Audyt dotyczył wcześniejszych modeli, więc nie koryguje wyniku GPT-6.1 Sol. Tym bardziej nie rozstrzyga przewagi 75,2% nad 74,1% Astry.
Koszt rzeczywistej pracy agenta
Nowa stawka 0,10 USD dotyczy odczytu kontekstu zachowanego w cache. Zwykłe wejście kosztuje 2 USD, zapis kontekstu 2,50 USD, a wyjście 10 USD za milion tokenów. Trafienia w cache trzeba zatem mierzyć, a nie zakładać. Po przekroczeniu 272 tys. tokenów wejścia cena wejścia oraz odczytu i zapisu cache rośnie dwukrotnie, a wyjścia o połowę, dla całego żądania. Na rachunek wpływają też długość odpowiedzi, ponowienia nieudanych zadań i wybrany poziom rozumowania.
Stawki API nie mówią również, jaki limit pracy dostaje użytkownik abonamentu Codex czy ChatGPT Work. Przy wyborze modelu sprawdziłbym na własnym zestawie zadań trzy rzeczy: odsetek zadań zakończonych bez poprawek, łączny koszt wraz z ponowieniami oraz zużycie limitu planu. Wykres DeepSWE daje dodatkowy powód, by zacząć od high, a nie odruchowo wybierać max.
Granice samodzielności
Dodatek do karty systemowej klasyfikuje GPT-6.1 Sol na poziomie Critical w cyberbezpieczeństwie oraz High w biologii i chemii; OpenAI stosuje zabezpieczenia przewidziane dla tych progów. W prowokowanym teście z tablicą wiadomości między agentami model wykonał nieautoryzowaną czynność w 3% przypadków, w których odkrył tablicę, wobec 11% dla GPT-6 Sol. W innym teście niepożądane próby kontynuowania działania mimo ostrzeżenia wystąpiły w 23,5% prób. To osobne scenariusze skonstruowane tak, by wywołać błąd, a nie częstość incydentów w codziennym użyciu.
Lepszy wynik benchmarku nie znosi potrzeby kontroli uprawnień agenta. Jeśli ma czytać pliki, wywoływać narzędzia i zmieniać stan systemu, jakość odpowiedzi oraz poszanowanie granic dostępu trzeba mierzyć oddzielnie.
Źródła
- OpenAI: premiera GPT-6.1 Sol i wyniki testów.
- OpenAI API: karta GPT-6.1 Sol, możliwości i ceny.
- OpenAI: dodatek do karty systemowej GPT-6.1 Sol.
- Scrimdata: audyt zadań DeepSWE 1.1.
Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.