Back to archive
#llm#gemini#gemini-3#google#benchmarks

Google wydało Gemini 3

Google wydało 18 listopada 2025 roku Gemini 3 Pro. Model pojawił się w aplikacji Gemini, AI Studio, Vertex AI, trybie AI w wyszukiwarce oraz w nowym środowisku agentowym Google Antigravity. Był to natywnie multimodalny model rozumujący z kontekstem do 1 mln tokenów.

Karta Gemini 3 Pro opisuje dane, zastosowania, ograniczenia i testy bezpieczeństwa. Google wskazuje styczeń 2025 jako granicę wiedzy modelu i ostrzega m.in. przed halucynacjami, sporadyczną powolnością oraz pogorszeniem w rozmowach wieloturowych.

Benchmarki

gemini3-model-card-evaluation.png

Tabela wyników z oficjalnej karty Gemini 3 Pro. Źródło: Google DeepMind.

W wynikach z listopada 2025 Gemini 3 Pro uzyskał 37,5% w Humanity's Last Exam bez narzędzi i 45,8% z wyszukiwaniem oraz kodem, 31,1% w ARC-AGI-2, 91,9% w GPQA Diamond, 54,2% w Terminal-Bench 2.0 i 76,2% w SWE-bench Verified.

Nie wygrywa wszędzie. Claude Sonnet 4.5 ma 77,2% w SWE-bench Verified, a koszt w Vending-Bench 2 jest wyraźnie niższy. Tabela dobrze pokazuje też, jak dostęp do narzędzi zmienia wynik tego samego modelu.

Mocny model, droższe użycie

Przy wejściu do 200 tys. tokenów API kosztowało 2 dolary za milion tokenów wejściowych i 12 dolarów za milion wyjściowych. Powyżej tego progu stawki rosły do 4 i 18 dolarów. To wzrost wobec Gemini 2.5 Pro. Cena nadal była konkurencyjna względem Claude Sonnet 4.5, ale pełny rachunek zależał od długości kontekstu, rozumowania i liczby ponowień.

Moje pierwsze próby potwierdzały mocne rozumowanie i generowanie prototypów, ale zdarzały się też proste błędy oraz zbyt rozbudowany kod. To spójne z kartą: wysoki wynik zbiorczy nie gwarantuje niezawodności w każdym zadaniu.

Warto też zachować ostrożność przy danych treningowych. Karta wymienia dane publiczne, licencjonowane, syntetyczne i dane użytkowników usług Google, zgodnie z regulaminami oraz ustawieniami kontroli. Nie oznacza to automatycznie użycia każdej prywatnej wiadomości, ale wymaga sprawdzenia zasad konkretnego produktu i konta.

Źródła

Modele LLM

Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.