Back to archive
#ai#llm#aigen

Ile naprawdę kosztuje cache promptów w API LLM?

Aplikacja analizująca dokumenty może wysyłać modelowi te same instrukcje i ten sam materiał przy każdym nowym pytaniu. Cache promptów pozwala dostawcy ponownie użyć obliczeń wykonanych dla wspólnego początku żądań. Czy obniży rachunek, zależy od tego, ile razy ten początek zostanie użyty, jak szybko nadejdą kolejne pytania i za co dostawca pobiera opłatę.

Musi zgadzać się początek promptu

Cache przechowuje stan obliczony dla prefiksu, czyli niezmiennego początku wejścia. Nowe pytanie można umieścić za instrukcjami i dokumentem. Jeśli aplikacja zmieni coś wcześniej, na przykład treść instrukcji albo definicję narzędzia, dalsza część może przestać pasować do zapisanego stanu. Dwa podobne znaczeniowo dokumenty nie tworzą automatycznie trafienia. Sam mechanizm obliczeniowy opisuje Prefix Caching. Dokumentacja OpenAI i dokumentacja Anthropic opisują dopasowanie wspólnego prefiksu oraz wpływ zmian w żądaniu.

Model nadal przetwarza nowe pytanie i generuje odpowiedź. Cache nie oznacza ponownego użycia gotowej odpowiedzi. Nie powiększa też okna kontekstu.

Pierwszy zapis też kosztuje

Przyjmijmy wspólny prefiks o długości 10 tys. tokenów, użyty dwa razy w czasie życia cache. Dla GPT-5.6 i nowszych modeli OpenAI zapis tego prefiksu kosztuje 1,25 stawki zwykłych tokenów wejściowych, a odczyt przy trafieniu 0,1 stawki. Dwa użycia kosztują zatem równowartość 13,5 tys. tokenów wejściowych po zwykłej stawce, zamiast 20 tys. Bez drugiego żądania zapis byłby droższy od zwykłego przetworzenia. To rachunek wyłącznie za wspólny prefiks; nowe pytania i odpowiedzi są rozliczane osobno. OpenAI podaje stawki zapisu i odczytu oraz sposób liczenia kosztu z danych o użyciu.

W Claude pięciominutowy cache ma tę samą stawkę zapisu: 1,25 zwykłej ceny wejścia. Stawka trafienia zależy od modelu; dla Claude Sonnet 5 wynosi 0,1. Cache godzinny kosztuje przy zapisie 2 razy tyle co zwykłe wejście. Przy jednym zapisie i tylko jednym późniejszym trafieniu daje to 2,1 jednostki kosztu za prefiks, wobec 2 jednostek bez cache. Dopiero następne trafienie odwraca ten wynik. Cennik i czasy życia cache Anthropic pokazują, dlaczego dłuższy czas przechowywania nie jest darmowym ulepszeniem.

Odstęp między pytaniami ma znaczenie

Pięciominutowy cache Claude odnawia swój czas życia po trafieniu. OpenAI podaje dla GPT-5.6 i nowszych modeli co najmniej 30 minut od ostatniego zapisu lub użycia. To różne warunki dla aplikacji, w której użytkownik zadaje serię pytań bez przerwy, i dla zadania wracającego raz na kilka godzin. Nawet długi, identyczny prefiks nie da oszczędności, jeśli kolejne żądanie nie trafi już w dostępny wpis. OpenAI opisuje czas życia swoich wpisów, a Anthropic wyjaśnia odnowienie pięciominutowego cache.

Gemini dodaje rozróżnienie między API. W Interactions API działa cache automatyczny: Google przekazuje oszczędność, jeśli żądanie rzeczywiście trafi w zapisany kontekst. To API nie pozwala tworzyć jawnych obiektów cache. W generateContent można nimi zarządzać, lecz przy cache jawnym dochodzi opłata zależna od liczby przechowywanych tokenów i czasu przechowywania. Dokumentacja Interactions API i dokumentacja cache w generateContent opisują te dwa tryby.

Trafienia trzeba zobaczyć w danych

Dostawcy pokazują, ile tokenów odczytano z cache. OpenAI rozdziela cached_tokens i cache_write_tokens. Claude podaje cache_read_input_tokens oraz cache_creation_input_tokens. W Interactions API Gemini liczba trafionych tokenów jest dostępna jako usage.total_cached_tokens. Te pola pozwalają policzyć koszt rzeczywistych żądań, zamiast zakładać, że powtarzany tekst zawsze został odzyskany. OpenAI, Anthropic i Google opisują swoje dane o użyciu.

Trzeba też sprawdzić minimalną długość prefiksu. Dla GPT-5.6 i nowszych modeli OpenAI to 1024 widoczne tokeny wejściowe, a dla Gemini 3.8 Flash w Interactions API 4096 tokenów. Jeśli cały wspólny prefiks jest krótszy od progu danego modelu, samo zachowanie identycznego początku nie wystarczy do trafienia. OpenAI, Google.

Źródła

Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.