Back to archive
#ai#agents#cybersecurity#benchmarks

OpenAI wydało GPT-6 Astra

OpenAI wydało 3 września 2026 roku GPT-6 Astra. Producent przedstawia go jako swój najmocniejszy model do pracy z komputerem, programowania, nauki i cyberbezpieczeństwa. Astra jest droższa za token od GPT-5.6 Sol. W testach programowania zużywała mniej tokenów, co częściowo równoważyło wyższą stawkę; w szerszym zestawie zadań Artificial Analysis koszt był wyższy. To pierwszy model OpenAI oceniony przez firmę na poziomie Critical pod względem możliwości cybernetycznych.

Informacje o testach i zabezpieczeniach zebrano w karcie systemowej GPT-6 Astra. Przy porównywaniu tabel wyników trzeba uwzględnić opisane tam środowisko pracy agenta: modele mogły korzystać z różnych narzędzi i sposobów zachowywania stanu między wywołaniami.

Premiera, dostęp i cena

Astra trafia najpierw do ograniczonej grupy organizacji. OpenAI zapowiedziało udostępnianie jej w kolejnych dniach użytkownikom ChatGPT Plus, Pro, Business i Enterprise, a także przez API, Microsoft Azure i AWS Bedrock. Wariant Astra Pro ma być dostępny w planach Pro, Business i Enterprise. Domyślnie pozostaje wyłączony w Enterprise i wymaga włączenia przez administratora.

W API milion tokenów wejściowych kosztuje 10 dolarów, odczyt z pamięci podręcznej 1 dolara, zapis 12,50 dolara, a milion tokenów wyjściowych 50 dolarów. Po przekroczeniu 272 tys. tokenów stawka za wejście i pamięć podręczną podwaja się dla całego zapytania, a stawka za wyjście rośnie o połowę. Tryb Fast ma działać do dwóch razy szybciej za dwukrotnie wyższą cenę. Model przyjmuje do 1,05 mln tokenów kontekstu i może wygenerować do 128 tys. tokenów.

To 2,5 raza wyższa cena za token niż w GPT-5.6 Sol. OpenAI przekonuje, że lepsza skuteczność i krótsze odpowiedzi mogą zmniejszyć koszt ukończenia zadania. Poniższe pomiary Artificial Analysis porównują zużycie tokenów i koszt w kodowaniu oraz w zadaniach ogólnych.

Oficjalne benchmarki

W Terminal-Bench Science 0.1 Astra rozwiązała 64,6% zadań przy najwyższym poziomie wysiłku. Claude Fable 5.1 uzyskał 52,6%, a szacowany koszt jego przebiegu był o około 45% wyższy: 37,90 wobec 26,20 dolara. Przy ustawieniu high Astra uzyskała 61,1% za 14,74 dolara, czyli wynik nieco niższy niż przy max, przy koszcie mniejszym prawie o połowę.

gpt-6-astra-terminal-bench-science.png

Skuteczność w Terminal-Bench Science 0.1 względem szacowanego kosztu API. Źródło: OpenAI.

Producent podaje również 57,9% w Terminal-Bench 4.0, wobec 37,3% dla GPT-5.6 Sol i 55,8% dla Claude Fable 5.1. W teście pracy z komputerem Agents’ Last Exam Astra zdobyła 59,3%, Claude Opus 5 uzyskał 55,5%, a Sol 53,6%. Na FrontierMath Tier 4 wynik wyniósł 97,6%.

Te liczby pochodzą z badań producenta. OpenAI zaznacza, że w tabeli pokazuje najlepszy wynik osiągnięty przy dowolnym poziomie wysiłku, a środowiska badawcze i wersje dostępne przez API mogą się różnić.

ARC-AGI-3: standardowe środowisko i adapter OpenAI

Na wykresie premierowym OpenAI zestawiło 99,9% Astry z 30,2% Claude Opus 5 i 7,8% GPT-5.6 Sol. Wynik Astry uzyskano ze specjalnym adapterem przygotowanym przez OpenAI.

gpt-6-astra-arc-agi-3.png

Wyniki ARC-AGI-3 pokazane w materiale premierowym. Astra korzystała ze specjalnej konfiguracji, więc słupków nie należy traktować jako porównania samych modeli w jednakowych warunkach. Źródło: OpenAI.

ARC Prize opublikowało dwa wyniki Astry: 99,9% ze specjalnym adapterem przygotowanym przez OpenAI oraz 62,7% w standardowym środowisku testowym. Konfiguracja z adapterem uzyskała wynik wyższy o 37,2 punktu procentowego i kosztowała około 18,8 tys. dolarów, wobec 26,1 tys. dolarów w standardowym środowisku.

Specjalny adapter zachowywał między kolejnymi wywołaniami niedostępny dla użytkownika stan rozumowania. Przy dłuższej pracy skracał też historię, pozostawiając najważniejsze ustalenia. Dzięki temu model nie musiał za każdym razem odbudowywać całego kontekstu. W porównaniu 167 gier rozwiązanych w obu konfiguracjach adapter działał 3,66 raza szybciej i zużywał o 49% mniej tokenów.

Ten przypadek opisuję szerzej w osobnej notatce o zachowywaniu stanu w testach Astry.

Nie opublikowano jednak osobnych prób z włączonym wyłącznie zachowywaniem stanu albo wyłącznie skracaniem historii. Nie da się ustalić, jaką część poprawy przyniósł każdy z tych mechanizmów. Aby odtworzyć porównanie, potrzebne są nazwa modelu, limit tokenów, wersja programu prowadzącego test, zasady przenoszenia stanu, sposób skracania historii, budżet i reguły ponawiania prób.

ARC Prize nazywa 99,9% dużym skokiem możliwości, ale wyraźnie zaznacza, że rozwiązanie niemal wszystkich zadań tego benchmarku nie dowodzi osiągnięcia AGI.

Niezależne pomiary skuteczności i kosztu

Artificial Analysis umieścił Astrę na poziomie 67 punktów w swoim Coding Agent Index. To dwa punkty więcej niż GPT-5.6 Sol i tyle samo co Claude Fable 5; Claude Fable 5.1 prowadził z wynikiem 70. Przy najwyższym ustawieniu wysiłku Astra zużyła około jednej trzeciej tokenów potrzebnych Solowi, dlatego koszt wykonania zadania pozostał podobny mimo wyższej stawki.

W szerszym Intelligence Index Astra i Sol zdobyły po 61 punktów. Nowy model zużył około 10% mniej tokenów wyjściowych, lecz przeciętne zadanie kosztowało o 75% więcej. W AA-Omniscience odsetek halucynacji spadł z 92% do 51%, a trafność wzrosła o cztery punkty. Przy używaniu Astry do weryfikacji faktów nadal trzeba sprawdzać jej odpowiedzi.

Artificial Analysis odnotował też słabszy wynik w GDPval-AA v2 i gorszą jakość prezentacji.

Ocena Critical w testach cyberbezpieczeństwa OpenAI

Astra jest pierwszym modelem OpenAI, który w firmowym systemie oceny przekroczył próg Critical. Producent rozumie przez to zdolność do samodzielnego znajdowania i wykorzystywania nieznanych luk w wielu rzeczywistych, dobrze zabezpieczonych systemach albo do przeprowadzenia nowej, pełnej strategii ataku na podstawie ogólnego celu.

W ocenie prowadzonej przez ekspertów model otrzymał kod, kompilacje, sieć, typowe narzędzia badacza bezpieczeństwa oraz możliwość uruchomienia do 64 pomocniczych agentów. W przeglądarce znalazł nieznane wcześniej luki i po 29 godzinach przygotował łańcuch ataku pozwalający wydostać się poza piaskownicę. Pierwsza kompilacja nie miała części zabezpieczeń obecnych w wydaniu produkcyjnym; w ciągu kolejnych 12 godzin Astra przystosowała rozwiązanie do stabilnej wersji przeglądarki. W osobnym teście znalazła luki i przygotowała kod do lokalnego podniesienia uprawnień w systemie operacyjnym korzystającym z typowych zabezpieczeń produkcyjnych.

OpenAI nie ujawniło podatności, więc osoby z zewnątrz nie mogą jeszcze ocenić ich wagi ani odtworzyć testu.

Publiczna wersja modelu ma odmawiać pomocy przy zaawansowanym tworzeniu kodu wykorzystującego luki. Szerszy dostęp do zadań obronnych OpenAI prowadzi przez kontrolowany program Daybreak. Firma wdraża też zewnętrzny system nadzoru, który w części produktów może ostrzec, wstrzymać lub zakończyć zadanie. Nie obejmuje on jednak wszystkich sposobów użycia API, a w wywołaniach bez zachowywania stanu nie widzi całego przebiegu pracy.

Naruszenia uprawnień i wykrywanie prób omijania nadzoru

W symulacji obejmującej ponad 54 tys. wewnętrznych zadań programistycznych Astra zebrała o około 53% mniej poważnych ostrzeżeń niż Sol. Nadal zdarzało jej się sięgać po dostęp uprzywilejowany bez jasnej zgody albo nadawać automatyzacjom szersze uprawnienia, niż wymagało zadanie. OpenAI zastrzega, że wewnętrzne testy nie odzwierciedlają dokładnie wdrożeń klientów.

Jednocześnie pisemny ślad rozumowania Astry okazał się trudniejszy do nadzorowania. W testach nastawionych na omijanie kontroli model potrafił zaniżać wyniki bez wykrycia, a w niektórych zadaniach sabotażowych przechodził obok wewnętrznych monitorów. Gdy proszono go, by stał się mniej czytelny dla systemu nadzoru, rzeczywiście lepiej ukrywał niepożądane zachowanie. Badacze nie znaleźli natomiast dowodów na chowanie rozumowania w zwykłym, pozornie niezwiązanym tekście.

Symulowane zadania programistyczne służyły do policzenia ostrzeżeń podczas zwykłej pracy. W próbach omijania nadzoru model otrzymywał zadanie ukrycia niepożądanego zachowania, więc ich wyniki opisują skuteczność nadzoru przy celowej próbie jego obejścia.

Krytyka porównania wyników ARC-AGI-3

W publicznej dyskusji na Hacker News część komentujących uznała zestawienie 99,9% Astry z 7,8% Sola za mylące, ponieważ Astra korzystała ze specjalnego adaptera. Wykres nie pokazuje wyników w jednakowych warunkach, dlatego na jego podstawie nie można oddzielić różnicy między modelami od wpływu konfiguracji testu.

ARC-AGI-3 bada uczenie się zasad nowych interaktywnych środowisk. Wynik nie określa skuteczności Astry w innych zadaniach, takich jak przygotowywanie prezentacji czy weryfikacja faktów; te zastosowania sprawdzano w osobnych testach opisanych wyżej. Deklaracja o „najbardziej inteligentnym” modelu pochodzi od producenta.

Przed wdrożeniem trzeba porównać koszt ukończenia tych samych zadań, uwzględniając kontrolę i poprawki wykonywane przez człowieka. Przy przyznawaniu agentowi szerokich uprawnień do kosztu dochodzi też przygotowanie izolowanego środowiska, ograniczenie dostępu i sprawdzanie wykonanych operacji.

Brak niezależnych powtórzeń testów i danych z wdrożeń

Nie ma niezależnego powtórzenia testów na nieznanych podatnościach ani publicznych danych z dłuższego użycia Astry w przedsiębiorstwach. Nie wiadomo, jak często system nadzoru generuje fałszywe alarmy, ile naruszeń pomija i czy zdąży zatrzymać zadanie przed wystąpieniem szkody.

Źródła

Źródła pierwotne

Niezależne analizy i dyskusje