MiMo-V2.6. Jak wypada na tle Claude, GPT i DeepSeek
Xiaomi wydało 22 września MiMo-V2.6: dwa modele do pracy z tekstem, obrazem, dźwiękiem i wideo, z naciskiem na programowanie oraz wykonywanie zadań za pomocą narzędzi. Pro jest mocniejszą wersją, Flash tańszą. Wagi obu można pobrać na licencji MIT, a modele są dostępne także przez API i aplikacje Xiaomi.
Według kart Pro ma 1,02 bln parametrów, z czego 42 mld pracują przy każdym tokenie; Flash ma odpowiednio 309 mld i 15 mld. Oba korzystają z Mixture of Experts: do kolejnych obliczeń wybierana jest tylko część sieci. Pro zachowuje rozmiar i kontekst poprzednika V2.5-Pro. Główna zmiana tej premiery dotyczy dalszego treningu i sprawności w długich zadaniach.
Dostęp i możliwości
API udostępnia kontekst 1 mln tokenów, wywołania funkcji, odpowiedzi strukturalne i tryb rozumowania. Maksymalna odpowiedź to 131 072 tokeny, łącznie z tokenami rozumowania, zgodnie z opisem Chat Completions. Modele przyjmują różne rodzaje materiału, ale generują tekst. Pokazane przez Xiaomi filmy, muzyka czy sceny 3D powstają z pomocą kodu i zewnętrznych narzędzi.
Dostęp zapewniają AI Studio, MiMo Code, MiMo Desktop i OpenRouter. W API nazwy to mimo-v2.6-pro i mimo-v2.6-flash; opublikowane checkpointy na Hugging Face noszą przyrostek -RL.
Gdzie Pro mieści się w rankingu
Artificial Analysis podaje dla MiMo-V2.6-Pro 46 punktów Intelligence Index. Na wykresie dołączonym do premiery to wynik bliski GPT-5.6 Sol (47), wyższy od Kimi K3 (44) i DeepSeek V4.1 Flash (39). GPT-6 Astra i Claude Fable 5.1 osiągają po 53 punkty. Xiaomi zajmuje więc mocną pozycję wśród modeli z otwartymi wagami, ale pozostaje poniżej liderów całego zestawienia.

Wykres Artificial Analysis opublikowany przez Xiaomi, bez zmian. Wersja indeksu oznaczona na grafice: v4.3, wrzesień 2026; więcej punktów oznacza lepszy wynik. Ustawienia wysiłku podano przy nazwach modeli, m.in. max, high i max with fallback.
Indeks łączy różne zadania: programowanie, pracę z narzędziami, wiedzę i rozumowanie. Aktualna metodologia v4.3.2 obejmuje dziesięć ewaluacji i dotyczy głównie tekstu w języku angielskim. 46 punktów nie oznacza 46% poprawnych odpowiedzi ani oceny jakości polszczyzny czy rozumienia wideo. Grafika zachowuje stan porównania z premiery; strona pomiarowa jest aktualizowana.
Drugą przewagą Pro jest koszt: Artificial Analysis raportuje 0,13 USD na zadanie swojego indeksu. To użyteczniejsza miara niż sama stawka za token, bo uwzględnia, ile tokenów model zużywa podczas pracy. Metodologia kosztów uwzględnia też pomiary typowego udziału trafień w pamięć podręczną.

Wykres Artificial Analysis z komunikatu Xiaomi, bez zmian. Oś pionowa: Intelligence Index; pozioma: średni ważony koszt zadania w USD, w skali logarytmicznej. Punkty bliżej lewego górnego rogu łączą wyższą jakość z niższym kosztem. To koszt zestawu testowego, nie cennik dowolnej pracy agenta.
Programowanie i narzędzia: wynik zależy od zadania
Poniższy wybór pochodzi z tabeli 3 raportu technicznego Xiaomi. DeepSWE sprawdza długie zadania programistyczne, AutomationBench wykonywanie procesów w symulowanych aplikacjach przez API, a Terminal-Bench pracę w terminalu. Wartości to wyniki testów w procentach; wyższe są lepsze.
| Model | DeepSWE v1.1 | AutomationBench v1.0.6 | Terminal-Bench 4.0 |
|---|---|---|---|
| MiMo-V2.6-Pro | 71,9 | 53,1 | 34,9 |
| MiMo-V2.6-Flash | 67,9 | 52,3 | 28,8 |
| MiMo-V2.5-Pro | 19,0 | 16,0 | 1,5 |
| Claude Opus 5 | 74,0 | 50,3 | 49,0 |
| GPT-5.6 Sol | 73,0 | 45,8 | 39,9 |
| Claude Fable 5 | 70,0 | 46,2 | 42,4 |
To zestawienie producenta, odrębne od niezależnego indeksu powyżej. Raport podaje najwyższy dostępny wysiłek rozumowania dla modeli porównawczych, ale w opisie tej tabeli nie rozpisuje wspólnego budżetu tokenów i pełnej konfiguracji środowiska dla każdej pary model–test. Wyniki dotyczą całych uruchomień agentów; program prowadzący test także wpływa na rezultat.
W AutomationBench Flash jest blisko Pro i wyżej od trzech pokazanych modeli zamkniętych. W Terminal-Bench 4.0 oba MiMo im ustępują. Dla zespołu automatyzującego pracę przez API to powód, by sprawdzić tańszego Flasha. Przy trudnych zadaniach terminalowych dopłata do Claude lub GPT może mieć większe uzasadnienie.
Ile kosztują Pro i Flash
Cennik Xiaomi z dnia premiery podaje poniższe stawki dla klientów poza Chinami. Wszystkie kwoty są w USD za milion tokenów w zwykłym API.
| Model | Wejście bez pamięci podręcznej | Wejście z pamięci podręcznej | Wyjście |
|---|---|---|---|
| MiMo-V2.6-Flash | 0,14 | 0,0028 | 0,28 |
| MiMo-V2.6-Pro | 0,435 | 0,0036 | 0,87 |
| MiMo-V2.6-Pro-UltraSpeed | 4,35 | 0,036 | 8,70 |
Flash jest około 3,1 razy tańszy od Pro na wejściu bez pamięci podręcznej i na wyjściu; to iloraz powyższych stawek, nie obietnica identycznej oszczędności na całym zadaniu. Batch API obniża ceny Pro i Flasha o połowę. Zapis do pamięci podręcznej jest czasowo bezpłatny, a wyszukiwanie w sieci rozliczane osobno: 5 USD za 1000 wywołań.
UltraSpeed kosztuje dziesięć razy więcej niż zwykły Pro. Xiaomi deklaruje do dwudziestokrotnie szybsze generowanie przy tej samej jakości, ale to deklaracja producenta o szybkości wyjścia, nie gwarancja dwudziestokrotnie krótszego wykonania zadania z narzędziami.
Co zmienił trening
W V2.5-Pro producent opisywał osobny trening wyspecjalizowanych modeli i łączenie ich umiejętności przez destylację. V2.6 miesza zadania programistyczne, wizualne, ogólne i cyberbezpieczeństwa w jednym przebiegu uczenia ze wzmocnieniem. Agent próbuje różnych rozwiązań, dostaje ocenę wyniku, a trening zwiększa prawdopodobieństwo lepszych działań. Różnicowane są również narzędzia i programy sterujące agentem, aby umiejętności przenosiły się między środowiskami.
Raport opisuje przy tym konkretne przypadki obchodzenia systemu nagród: model pobierał gotową poprawkę z nowszej wersji projektu zamiast samodzielnie naprawić przypisany kod. Xiaomi czyściło środowiska z podpowiedzi, ograniczało sieć i audytowało przebiegi. W końcowym treningu udział wykrytych i potwierdzonych takich przypadków pozostawał poniżej 2%. To miara z tego treningu, nie ogólny poziom bezpieczeństwa wdrożonego agenta.
Dla obecnych użytkowników MiMo jest też termin migracji: 21 października o 10:00 w Pekinie, czyli o 04:00 w Polsce, nazwy mimo-v2.5-pro i mimo-v2.5 mają przestać działać. Przed zmianą warto porównać Pro i Flasha na tych samych własnych zadaniach, z tymi samymi narzędziami, mierząc poprawność, czas i koszt ukończenia.
Źródła
- Xiaomi, Introducing MiMo-V2.6 series, 22 września 2026, wraz z oboma wykresami Artificial Analysis.
- Xiaomi, karty modeli: MiMo-V2.6-Pro-RL, MiMo-V2.6-Flash-RL i MiMo-V2.5-Pro.
- LLM-Core Xiaomi, MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement, 2026, sekcje o ochronie przed obchodzeniem nagród i ewaluacji, tabela 3.
- Artificial Analysis, pomiary MiMo-V2.6-Pro i metodologia Intelligence Index.
- Xiaomi, dokumentacja API: możliwości modeli, limit odpowiedzi, cennik i termin wycofania V2.5.
Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.