Back to archive
#ai#aigen#llm#inference

Usługi inferencji mogą rosnąć na modelach trenowanych za granicą

Firma obsługująca zapytania do modelu i laboratorium, które go wytrenowało, mogą działać w różnych krajach. Publicznie dostępne wagi pozwalają budować usługę bez samodzielnego przechodzenia przez trening modelu bazowego. Dlatego wzrost krajowego rynku inferencji może współistnieć z rosnącym udziałem modeli pochodzących z zagranicy.

Dostępne wagi rozdzielają trening i obsługę zapytań

Nathan Lambert opisuje w Interconnects amerykańskie firmy rozwijające usługi na chińskich modelach. Wśród przykładów wymienia wykorzystanie Kimi przez DoorDash, Qwen przez Airbnb i DeepSeek przez Perplexity. Są to przykłady adopcji wskazane przez autora, bez podziału ruchu tych firm na poszczególne modele.

Model z otwartymi wagami można uruchamiać poza infrastrukturą laboratorium, które go stworzyło, w granicach jego licencji. Operator dostarcza moc obliczeniową i obsługuje żądania, a aplikacja korzysta z możliwości zapisanych w cudzych parametrach. Ten podział pozwala kilku firmom oferować inferencję na tym samym modelu. Miejsce wykonywania obliczeń i pochodzenie modelu opisują więc dwa różne elementy usługi.

Ruch na platformie może rosnąć wraz z udziałem zagranicznych wag

Przytoczone dane OpenRouter pokazują wzrost tygodniowego ruchu dotyczącego otwartych modeli z około 1 bln tokenów we wrześniu 2025 roku do około 80 bln we wrześniu 2026 roku. W tym samym porównaniu udział modeli chińskich wzrósł z około 70% do ponad 80%. OpenRouter zapewnia wspólny interfejs do modeli wielu dostawców; ten pomiar dotyczy ruchu przechodzącego przez platformę.

Wolumen tokenów wskazuje skalę użycia, ale nie pozwala obliczyć przychodu ani marży operatorów. Nie jest też pomiarem całego rynku. Autor zaznacza, że część dostawców, w tym Together AI i Fireworks AI, nie ujawnia ruchu w podziale na modele, a wdrożenia prywatne pozostają poza tym obrazem. Można zatem wskazać silną koncentrację pochodzenia wag w obserwowanym kanale, bez przypisywania tego samego udziału wszystkim wdrożeniom.

Własna infrastruktura nie odtwarza procesu treningu

Przechowywanie wag i wykonywanie obliczeń daje operatorowi kontrolę nad uruchomioną kopią modelu. Sam dostęp do parametrów nie dostarcza jednak danych i kodu potrzebnych do odtworzenia treningu. Interconnects odróżnia pod tym względem modele open-weight od pełniejszych publikacji open-source; przykład takiego szerszego udostępnienia opisuje notka o OLMo 3.

Z tego rozdzielenia wynika ograniczenie w interpretacji inwestycji w inferencję: dodatkowe serwery zwiększają zdolność obsługi zapytań, lecz nie świadczą o zdolności do wytrenowania konkurencyjnego następcy używanego modelu. Operator może samodzielnie rozwijać usługę na istniejących wagach. Dostęp do kolejnych modeli zależy już od tego, kto je wytrenuje i na jakich warunkach je udostępni.

Przy opisie zależności wdrożenia warto więc osobno wskazać dostawcę inferencji oraz laboratorium i wersję wag. Zmiana operatora przy zachowaniu tego samego modelu nie zmienia pochodzenia jego możliwości. Zastąpienie modelu inną rodziną wymaga ponownego sprawdzenia jakości na zadaniach aplikacji. To odrębna decyzja od przeniesienia obliczeń na inne serwery.

Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.