Back to archive
#ai#llm#models#coding#benchmarks

MiniMax wydało model M2.5

MiniMax wydało 12 lutego 2026 roku M2.5, model nastawiony na programowanie, obsługę narzędzi i długie zadania agentowe. Producent udostępnił też wariant M2.5 Lightning, który ma generować około 100 tokenów na sekundę przy zachowaniu tych samych możliwości.

Karta modelu MiniMax M2.5 uzupełnia komunikat premierowy o konfigurację i sposób uruchomienia otwartych wag.

Benchmarki

minimax-m25-benchmarks.png

Oficjalne zestawienie benchmarków MiniMax M2.5. Źródło: MiniMax.

MiniMax podaje 80,2% w SWE-bench Verified, 51,3% w Multi-SWE-bench i 76,3% w BrowseComp z zarządzaniem kontekstem. W oddzielnych przebiegach agentowych M2.5 zdobywa 79,7% w Droid wobec 78,9% Claude Opus 4.6 oraz 76,1% w OpenCode wobec 75,9%.

Te ostatnie liczby dobrze pokazują problem porównań. Ten sam model osiąga różne wyniki z różnymi programami prowadzącymi zadanie, a niewielka przewaga może zniknąć po zmianie harnessu. Dlatego nie traktuję jej jako dowodu, że M2.5 jest ogólnie lepszy.

Szybkość i koszt

Producent podaje średnio 22,8 minuty i 3,52 mln tokenów na zadanie SWE-bench, wobec 31,3 minuty dla M2.1. W API Lightning kosztuje 0,30 dolara za milion tokenów wejściowych i 2,40 dolara za milion wyjściowych. Zwykły M2.5 ma połowę tych stawek i około 50 tokenów na sekundę.

To atrakcyjna oferta, jeśli deklarowana zgodność jakości obu wariantów utrzyma się poza testami producenta. Do pełnego rachunku trzeba jednak doliczyć ponowienia, długość śladów i poprawki człowieka. Cena tokenu nie jest ceną ukończonego zadania.

Źródła

Zobacz też: 42bj⁝ Benchmark modelu obejmuje stan utrzymywany przez harness.

Modele LLM

Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.