Haiku 5.5 czy Sonnet 5.5. Kiedy warto dopłacić do większego modelu
Haiku 5.5 warto sprawdzić tam, gdzie Sonnet dziś wykonuje powtarzalną, wydzieloną pracę: odczytuje pola, przerabia tekst albo wprowadza zmianę według gotowego planu. Sonneta zostawiłbym jako punkt startu przy diagnozie nieznanego błędu, sprzecznych źródłach i zadaniach, w których model sam wybiera kolejne kroki. Granicę wyznacza przede wszystkim koszt sprawdzenia i poprawienia wyniku, a nie długość promptu.
Premiera Haiku 5.5 z 7 października daje powód, żeby ponownie sprawdzić zadania odrzucone po próbach z Haiku 4.5: nowy model jest znacznie tańszy i ma regulowany poziom rozumowania. Poniżej porównuję Haiku 5.5 z Sonnetem 5.5 pod kątem wyboru do pracy. Pełniejsze opisy premier: Haiku 5.5 i Sonnet 5.5.
Gdy wiadomo, co zrobić, łatwiej skorzystać z Haiku
„Wyciągnij datę, numer zamówienia i nazwę produktu z tego zgłoszenia” to dobry kandydat dla Haiku. Dostaje dane, konkretne pola i określony format odpowiedzi. „Ustal, dlaczego klient otrzymał niewłaściwy produkt, porównując zgłoszenie, historię zamówienia i logi magazynu” wymaga już wyboru dowodów oraz rozstrzygnięcia, które informacje sobie przeczą. Tu rozsądniej zacząć od Sonneta.
Poniższa tabela przedstawia proponowane punkty startu, a nie wyniki osobnego eksperymentu:
| Obszar | Zadanie dla Haiku | Kiedy zacząć od Sonneta |
|---|---|---|
| Dokumenty | Wyciągnięcie wskazanych pól i fragmentów z dostarczonego tekstu | Porównanie dokumentów, wykrycie sprzeczności, wyprowadzenie wniosku |
| Wiadomości | Skrócenie maila, poprawa języka, zmiana formatu | Przygotowanie argumentacji wymagającej kontekstu i wyczucia odbiorcy |
| Kod | Mała zmiana według ustalonego planu, z testem sprawdzającym zachowanie | Diagnoza nieznanego błędu, zmiana architektury, zależności między komponentami |
| Logi | Wyszukanie błędów według znanego wzorca i uporządkowanie zdarzeń | Ustalenie przyczyny awarii z niepełnych lub sprzecznych śladów |
| Obsługa klienta | Wybór kategorii zgłoszenia i odpowiedź z zatwierdzonej bazy wiedzy | Nietypowy przypadek wymagający interpretacji kilku zasad |
| Agent z narzędziami | Jedna wydzielona czynność z jasnym kryterium zakończenia | Samodzielne planowanie, zmiana podejścia po porażce i kontrola całego zadania |
Krótka prośba o znalezienie błędu współbieżności może być trudniejsza niż przepisanie kilkuset rekordów. Duża liczba dokumentów też nie przesądza o modelu Sonnet: jeśli każdy ma ten sam układ, a trzeba odczytać jedno pole, można przetwarzać je osobno. Trudność rośnie, kiedy wynik zależy od relacji między nimi.
Przy kodzie oddałbym Haiku zmianę z gotowym kryterium odbioru, ale koszt diagnozy nieznanego błędu liczyłbym razem z nieudanymi próbami i poprawkami. Sam zielony build nie wystarcza; szerzej o tym we wpisie o niezależnej weryfikacji kodu agenta.
Co pokazują pomiary, a czego nie pokazują
W Terminal-Bench 4.0 Anthropic raportuje 39,2% dla Haiku 5.5 i 70,6% dla Sonneta 5.5. Oba modele działały w Claude Code --bare przy max. Zestaw obejmował 66 zadań, z dziesięcioma próbami dla Haiku i pięcioma dla Sonneta. Haiku pracował bez internetu i zastępowania go po odmowie; w 1,5% przebiegów Sonneta część żądań obsłużył inny model. To duża różnica w tym zestawie, ale nie czysty pomiar modelu w każdej możliwej konfiguracji. Karta systemowa, sekcja 8.4.
W FrontierCode 1.1 Main różnica jest mniejsza: Haiku uzyskał 46,4% przy max, Sonnet 52,1% przy xhigh. Przy samym max Sonnet miał 46,2%. Cognition mierzyło tu przygotowanie zmian kodu na 100 najtrudniejszych zadaniach swojego zestawu, po pięć prób. Najwyższy poziom rozumowania nie dał więc Sonnetowi najlepszego wyniku. Karta systemowa, sekcja 8.3.
Niezależne zestawienie Artificial Analysis pokazuje 43 punkty dla Haiku przy max i 56 dla Sonneta przy max w Intelligence Index v4.3.2. Haiku przy medium ma 34 punkty, a Sonnet przy high 47. Wyniku reklamowanego dla Haiku przy max nie należy zatem przypisywać jego zwykłemu ustawieniu medium. Konfiguracja Sonneta w tym zestawieniu dopuszcza model zastępczy. Indeks obejmuje dziesięć testów i jest przede wszystkim anglojęzyczny; nie mierzy osobno jakości polskiej korespondencji.
Wynik całego zestawu nie mówi jednak, czy Haiku poprawnie wykona konkretną transformację w naszej aplikacji.
Dwadzieścia razy tańsze tokeny mają warunek
Przy wyborze do agenta kluczowy jest próg cenowy Haiku przy 100 tys. tokenów wejścia w żądaniu. Sama informacja o tanich tokenach nie wystarcza, jeśli model będzie pracował z długą historią i wynikami narzędzi.
Stawki Claude API na 8 października 2026, w USD za milion tokenów:
| Rodzaj tokenów | Haiku: wejście do 100 tys. | Haiku: wejście powyżej 100 tys. | Sonnet |
|---|---|---|---|
| Nowe wejście | 0,10 | 0,50 | 2,00 |
| Wyjście | 0,50 | 2,50 | 10,00 |
| Odczyt z pamięci podręcznej promptu | 0,01 | 0,05 | 0,10 |
Źródło: cennik Claude Platform. Tabela nie uwzględnia zapisu pamięci podręcznej, rabatu za przetwarzanie wsadowe ani opłat za narzędzia i wybraną lokalizację inferencji. Wyższa stawka Haiku dotyczy całego wywołania, łącznie z wyjściem, a nie tylko tokenów wejścia ponad próg.
Własne wyliczenie: pojedyncze wywołanie z 10 tys. nowych tokenów wejścia i 1 tys. tokenów wyjścia kosztuje 0,0015 USD w Haiku oraz 0,03 USD w modelu Sonnet. Przy takim samym zużyciu tokenów Haiku jest dwadzieścia razy tańszy. Dla 120 tys. nowych tokenów wejścia i 1 tys. wyjścia koszt wynosi odpowiednio 0,0625 i 0,25 USD — przewaga spada do czterech razy. To przykłady rachunku, nie pomiar zużycia obu modeli na tym samym zadaniu; wyjście obejmuje również naliczane tokeny rozumowania.
Nie zakładałbym więc, że podagent obsługujący krótkie polecenie zmieści się w niższym progu. Decyduje pełne wejście do wywołania, wraz z historią i narzędziami. Również przy cache promptu warto liczyć koszt całej sesji.
W abonamencie, jeśli Sonnet działa dobrze i limit nie przeszkadza, niższa cena API nie obniży stałej miesięcznej opłaty. Wtedy przejście na Haiku musi mieć inny powód, np. krótszy czas oczekiwania albo oszczędzanie dostępnego limitu.
Reddit: krótkie wywołania, rosnąca historia i błędy przy cytatach
Dyskusje z 7–8 października pokazują pierwsze doświadczenia po premierze Haiku 5.5. Nie tworzą reprezentatywnego testu, a część komentarzy opisuje wcześniejsze Haiku albo dopiero planowane zastosowania.
W wątku na r/ClaudeCode użytkownik igobyraymond opisuje używanie Haiku do zamiany swobodnej komendy głosowej na polecenie w aplikacji z zadaniami: model wybiera operację i jej parametry. To konkretny przykład, w którym instrukcję można wypowiedzieć na różne sposoby, ale zestaw możliwych działań jest ograniczony. Komentarz nie podaje wersji modelu. W tej samej dyskusji kevin7254 wskazuje na tanie modele do wydzielonych prac rozliczanych przez API, a pigletmonster pisze, że delegowanie zadań programistycznych w jego konfiguracji było wolniejsze i droższe. Brak opisu porównywalnego testu pozwala potraktować to jako sygnał, żeby mierzyć również narzut delegowania.
Autor wątku „Haiku 5.5 token usage”, ceramgcf, zgłasza przekraczanie 100 tys. tokenów nawet w krótkich zadaniach agentowych. ohrajaaa opisuje przebieg, w którym kontekst przekroczył ten próg około dwudziestego wywołania modelu. To relacje użytkowników, nie zweryfikowane logi. Pokazują jednak, dlaczego sama etykieta „podagent Haiku” nie wystarcza: jeśli dostanie całe duże zadanie, jego historia również urośnie.
Najbardziej pouczający kontrprzykład podaje Strange-Pin-2998 w tym samym wątku. Haiku 5.5 odnajdywał wskazane fragmenty książki, ale popełniał błędy przy ich przypisywaniu. To jeden przypadek; pokazuje problem, którego nie wychwyci samo sprawdzenie, czy cytat występuje w książce. Kontrola wyniku musi obejmować również jego przypisanie.
Jak wyznaczyć granicę dla własnej pracy
Pierwszym kandydatem do przeniesienia z Sonneta powinno być zadanie, które wykonujesz często i którego wynik już umiesz sprawdzić. Porównaj koszt całej sesji, czas do poprawnego wyniku i potrzebne poprawki przy tych samych materiałach i narzędziach. Jeśli pracujesz po polsku, własne polskie przykłady powiedzą więcej niż anglojęzyczny ranking.
Dla Haiku 5.5 Anthropic zaleca medium jako punkt startu. Low częściej pomija wyszukiwanie lub sprawdzenie; xhigh i max wydłużają rozumowanie i odpowiedzi. Jeśli Haiku jest blisko wymaganej jakości, wyższy poziom może pomóc, ale wtedy porównaj też czas i koszt z Sonnetem. Wynik benchmarku przy max nie opisuje automatycznie pracy przy medium.
Wróciłbym do Sonneta po błędnym przypisaniu źródła, zgadywaniu brakujących danych, pomijaniu zależności albo powtarzaniu nieskutecznej poprawki. To sygnały, że oszczędność na pojedynczym wywołaniu może przegrywać z kosztem doprowadzenia zadania do końca. Pewna siebie odpowiedź Haiku nie jest kryterium odbioru.
W pracy z dwoma modelami Sonnet może ustalić plan i kryteria, a Haiku wykonać wydzieloną część. Warto przekazać mu tylko potrzebne materiały oraz wymagać jawnego zgłoszenia braków zamiast zgadywania. Trzeba jednak doliczyć przekazanie zadania i sprawdzenie odpowiedzi przez Sonneta. Przy pojedynczej małej zmianie uruchamianie dwóch agentów może kosztować więcej czasu niż wykonanie jej jednym.
Dla krótkiego wywołania z wcześniejszego przykładu różnica w cenie wynosi zaledwie 0,0285 USD. Kilka minut poprawiania wyniku Haiku łatwo przeważy taką oszczędność. Przy milionie powtarzalnych, dobrze sprawdzanych wywołań te same stawki oznaczają natomiast 1500 USD zamiast 30 tys. USD, przed dodatkowymi opłatami i rabatami. Dlatego sens Haiku jest szczególnie wyraźny w zadaniach wykonywanych wielokrotnie, dla których kontrola jakości już działa.
Źródła
- Anthropic: premiera Claude Haiku 5.5 i karta systemowa, zwłaszcza sekcje 8.3–8.4.
- Claude Platform: cennik i zalecenia dotyczące Haiku 5.5.
- Artificial Analysis: porównanie Haiku 5.5 z Sonnetem 5.5 przy różnych poziomach rozumowania i metodologia Intelligence Index v4.3.2.
- Reddit: dyskusja o premierze na r/ClaudeCode i „Haiku 5.5 token usage” na r/ClaudeAI, 7–8 października 2026.
Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.