Back to archive
#ai#llm#agents#benchmarks#news#aigen

Gemini 3.8 Flash i Flash Cyber. Możliwości, demonstracje i koszty

W jednej z demonstracji Google agent buduje mapy w stylu DOS: z trasami i pikselowym Street View. W drugiej tworzy grę, w której czarodziej przemierza zamek. Za oboma projektami stoi Gemini 3.8 Flash, przedstawiony 2 września 2026 roku razem z wariantem 3.8 Flash Cyber, przeznaczonym do wyszukiwania i naprawiania luk w kodzie. Komunikat Google pokazuje efekty, a karta modelu pozwala sprawdzić ograniczenia nowego wydania.

Flash jest dostępny publicznie, Cyber wymaga przyjęcia do programu

Zwykły Flash ma status ogólnej dostępności i identyfikator API gemini-3.8-flash. Można korzystać z niego przez Google AI Studio, Gemini API i Antigravity. Google udostępnia go także w swoich produktach konsumenckich abonentom AI Pro i Ultra. Dostęp przez płatną subskrypcję aplikacji oraz rozliczenie API to odrębne warunki użycia.

Dokumentacja modelu podaje 1 048 576 tokenów wejścia i maksymalnie 65 536 tokenów wyjścia. Model przyjmuje tekst, obrazy, wideo, audio i PDF-y, a zwraca tekst. Potrafi więc obejrzeć zrzut interfejsu i napisać kod, który odtworzy jego układ. Sam Flash nie generuje obrazów ani dźwięku; do takich elementów aplikacji potrzebne są inne narzędzia.

Do dyspozycji są wywołania funkcji, wykonywanie kodu, wyszukiwanie w plikach i sieci, odpowiedzi według schematu oraz obsługa komputera w wersji Preview. Poziomy rozumowania to low, medium i high. minimal nie jest obsługiwany i powoduje błąd. Opis migracji wskazuje medium jako ustawienie domyślne. Poziom warto ustawić jawnie i zachować go przy porównywaniu wyników.

Cyber jest udostępniany przez Fairwind Program. Google sprawdza organizacje ubiegające się o dostęp, wymaga kontroli uprawnień i dopuszcza wykorzystanie modelu do obrony oraz badań. Partnerzy mogą używać go również w CodeMender, agencie przygotowującym poprawki bezpieczeństwa. Publiczna strona programu nie podaje osobnego cennika tokenowego Cyber; stawek zwykłego Flasha nie należy automatycznie przypisywać temu wariantowi.

Trzy demonstracje: gra, mapy i przekroje terenu

Poniższe kadry pochodzą z oficjalnych nagrań Google. Pokazują wybrane rezultaty pracy modelu, bez niezależnego odtworzenia procesu tworzenia tych aplikacji.

gemini-3-8-flash-demo-gra-zrzut.png

Gra 3D z oficjalnej demonstracji Google: wnętrze zamku, cele zadania i pasek zaklęć. Źródło: nagrania przy premierze.

Gra powstała w Antigravity z poleceniem dalszej pracy w pętli. Tekstury dostarczał Nano Banana.

gemini-3-8-flash-demo-mapy-dos-zrzut.png

Mapy w stylu DOS: pikselowa mapa z wyznaczoną trasą oraz projekt otwarty w Antigravity. Kadr z demonstracji Google.

Interfejs retro łączy pobieranie danych, nawigację i ich nietypową prezentację.

gemini-3-8-flash-demo-topografia-zrzut.png

Model terenu i jego rzut z poziomicami. Kadr z demonstracji Google; aplikację zbudowano z użyciem danych USGS.

Mapa topograficzna pozwala oglądać przekroje i rzuty 2D. Taki interfejs może pomóc zrozumieć związek między kształtem góry a poziomicami. Sam atrakcyjny obraz nie sprawdza jednak poprawności transformacji danych. Przy zastosowaniu edukacyjnym lub naukowym trzeba jeszcze porównać współrzędne, skalę i przekroje z materiałem wejściowym.

Dłuższa praca nad zadaniem ma swoją cenę

Dokumentacja nowego Flasha opisuje zmianę sposobu pracy: model dzieli trudny problem na mniejsze kroki, wielokrotnie korzysta z narzędzi i sprawdza wynik. To może pomóc przy zmianie obejmującej wiele plików, gdy po pierwszej poprawce trzeba jeszcze uruchomić testy i usunąć wykryte błędy. Więcej takich kroków oznacza jednak dodatkowe tokeny, szczególnie przy wysokim wysiłku rozumowania.

Cennik Gemini API rozróżnia cenę promocyjną i późniejszą. Kwoty poniżej dotyczą miliona tokenów w trybie Standard:

OkresWejścieWyjście, w tym rozumowanie
Do 31 grudnia 20260,75 USD3,75 USD
Od 1 stycznia 20271,50 USD7,50 USD

Batch i Flex mają stawki tokenowe o połowę niższe od Standard. Ponowny odczyt kontekstu z pamięci podręcznej kosztuje obecnie 0,075 USD za milion tokenów, a przechowywanie 0,50 USD za milion tokenów na godzinę. Te dwie stawki również podwajają się od stycznia. Wyszukiwanie Google ma osobne rozliczenie: po 5000 bezpłatnych żądaniach miesięcznie, współdzielonych przez modele Gemini 3.x, kosztuje 14 USD za tysiąc żądań.

Przykładowe 100 tys. tokenów wejściowych i 20 tys. wyjściowych kosztuje dziś 0,15 USD, a od stycznia 0,30 USD. To własne obliczenie dla Standard, bez pamięci podręcznej i płatnych narzędzi; zakłada, że podane wyjście obejmuje już rozumowanie. W pracy agenta trzeba zsumować wszystkie wywołania potrzebne do ukończenia zadania.

Programowanie: wynik zależy także od narzędzi

gemini-3-8-flash-deepswe-oficjalny-wykres.png

Oficjalny wykres Google dla DeepSWE v1.1: odsetek ukończonych zadań względem średniego kosztu zadania w USD. Oś kosztu jest odwrócona, więc taniej oznacza bardziej w prawo. Wynik Flasha pochodzi z pomiaru Google w mini-swe-agent przy high; porównania korzystają z rankingu Datacurve. Metodologia.

Tabela premierowa podaje 73,7% w DeepSWE v1.1, wobec 65,3% dla 3.7 Flash. Metodologia Google zaznacza, że dla konkurentów wybrano najwyżej punktowane ustawienia z publicznego rankingu. To porównanie gotowych konfiguracji agentów. Sama podmiana modelu we własnej aplikacji nie odtwarza programu prowadzącego test ani jego warunków.

Podobnie Terminal-Bench 2.1 korzysta w tym zestawieniu z programu Terminus 2. Google raportuje dla Flasha 89,4%, ale w nowszym Terminal-Bench 4.0, obejmującym ogólniejsze zadania agentowe, jest to 19,1%. To różne zestawy zadań, więc różnica nie oznacza spadku sprawności w tym samym teście. Pokazuje, dlaczego oceny programowania nie można rozciągać na dowolną pracę z komputerem.

Niezależny pomiar pokazuje duże zużycie tokenów

Artificial Analysis, w stanie sprawdzonym 7 września, przyznaje wariantowi high 47 punktów w Intelligence Index v4.2. Indeks łączy dziesięć ewaluacji; nie jest procentem poprawnych odpowiedzi ani tą samą skalą co wcześniejsze wersje rankingu.

Serwis mierzy około 281 tokenów wyjściowych na sekundę, ale przeprowadzenie indeksu wymagało około 140 mln tokenów wyjściowych, wobec mediany 79 mln w jego grupie porównawczej. Ważony średni koszt zadania wyniósł 0,74 USD. Szybkość dotyczy generowania po rozpoczęciu strumienia, więc nie opisuje całego oczekiwania na gotowy rezultat.

Dla własnego repozytorium użyteczniejszym porównaniem będzie rachunek za poprawnie zakończoną zmianę: koszt wszystkich prób, czas wykonania i czas poprawek człowieka. Próba na medium i high pokaże, czy dodatkowe rozumowanie usuwa błędy, które rzeczywiście pojawiają się w danym projekcie.

Cyber: znaleźć lukę i naprawić ją bez regresji

W CWE-Bench agent dostaje repozytorium i polecenie audytu oraz naprawy. Nie otrzymuje nazwy szukanej luki. Zestaw obejmuje 100 prywatnych zadań i 54 rodzaje słabości. Test zalicza próbę dopiero wtedy, gdy exploit przestaje działać, a wcześniejsze testy nadal przechodzą.

gemini-3-8-flash-cyber-cwe-bench-oficjalny-wykres.png

Oficjalny wykres Google oparty na CWE-Bench: Pass@1 względem średniego kosztu pojedynczego przebiegu w USD. Gemini 3.8 Flash Cyber pracował w Antigravity z high; wynik obliczył Collinear AI. Metodologia Cyber.

Ranking podaje 47,2% przy 3,64 USD za przebieg dla Cyber oraz 47,8% przy 10,27 USD dla Fable 5. To zbliżona skuteczność przy wyraźnie innym koszcie. Fable działał jednak w Claude Code, więc porównanie obejmuje również oprogramowanie agentowe. Pass@1 oznacza tutaj średnią skuteczność pojedynczego przebiegu, wyliczaną z prób dla poszczególnych zadań. Ponad połowa prób Cyber nadal nie spełnia pełnego kryterium naprawy.

Raport metodologiczny Cyber rozróżnia te wyniki od testów wykonanych wewnątrz Google. CyberGym zmierzono we własnej wersji Antigravity, a osobny test wykrywania luk obejmował 1200 potwierdzonych podatności historycznych. Deklarowane ponad 70% skuteczności na tym zbiorze oznacza odnajdywanie znanych organizatorom błędów. Nie jest odsetkiem nowo odkrytych luk ani skutecznością tworzenia poprawek.

Co zmieniło się w zabezpieczeniach

Karta 3.8 Flash nadal wymienia halucynacje i sporadyczne opóźnienia. Automatyczna ocena bezpieczeństwa wielojęzycznego pogorszyła się o 5,4 punktu procentowego względem 3.7, przy metryce, w której mniej znaczy lepiej. Google podaje zarazem, że ręczne przeglądy wykazały głównie fałszywe alarmy lub przypadki o mniejszej wadze. Nie należy utożsamiać wzrostu wyników programistycznych z poprawą każdej kategorii bezpieczeństwa.

Ocenę najpoważniejszych zagrożeń dla wersji 3.8 Google częściowo opiera na badaniu poprzednika. Google uzasadnia to brakiem istotnego wzrostu zdolności w ocenianych domenach. Wersja 3.7 pozostawała poniżej progów krytycznych, choć osiągnęła próg ostrzegawczy w cyberbezpieczeństwie. Te ustalenia dotyczą zwykłego Flasha; Cyber ma odrębne warunki dostępu i mniej restrykcyjne zabezpieczenia dla badań bezpieczeństwa.

Osobny test Gray Swan sprawdzał odporność na prompt injection, czyli polecenia przemycane w materiale, który agent miał przeczytać. Metodologia opisuje użycie gotowych ataków przeniesionych na badane modele, bez obsługi komputera. Wynik nie obejmuje więc wszystkich sposobów sterowania przeglądarką czy pulpitem. Przy wdrożeniu agenta uprawnienia do zapisu, dostęp do sieci i kontrola poprawek nadal wymagają sprawdzenia w docelowym środowisku.

Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.