Back to archive
#ai#llm#models#open-source#benchmarks

Ai2 wydało OLMo 3

Ai2 wydało 20 listopada 2025 roku rodzinę OLMo 3. Najważniejszą informacją nie jest pojedynczy wynik, lecz zakres publikacji: oprócz wag dostępne są dane treningowe Dolma 3, kod, kolejne checkpointy i receptury ewaluacji. To model otwarty w szerszym sensie niż typowe „open weights”.

Karta rodziny OLMo 3 opisuje warianty Base, Instruct i Think. Ai2 udostępniło modele 7B i 32B, a korpus Dolma 3 obejmuje 5,9 bln tokenów.

Benchmarki

olmo3-benchmarks.png

Wyniki OLMo 3 Think 32B i kolejnego checkpointu 3.1 w późniejszym raporcie technicznym. Kolumna „Final Think 3.0” odpowiada modelowi z premiery. Źródło: Ai2.

Wariant Think 32B z premiery uzyskuje 72,5 w AIME 2025, 83,5 w LiveCodeBench v3, 89,0 w IFEval i 58,1 w GPQA. Nie prowadzi w każdej kolumnie: Qwen 3 VL 32B ma lepsze wyniki w części testów matematycznych, rozumowaniu i wiedzy. Najciekawsza jest możliwość prześledzenia, jak rezultat zmieniał się między etapami treningu, ponieważ Ai2 publikuje artefakty pośrednie, a nie tylko końcową tabelę.

Nie należy jednak mieszać wariantów. Base służy jako model bazowy, Instruct jest dostrojony do wykonywania poleceń, a Think do rozumowania z dłuższym śladem. Ich wyniki odpowiadają innym sposobom użycia.

Co jest tu naprawdę nowe

OLMo 3 nie próbuje wygrać wyłącznie skalą. Jego wartością jest możliwość niezależnego badania danych, treningu i ewaluacji. „Otwarte wagi” pozwalają uruchomić model; pełniejsza publikacja Ai2 pozwala również sprawdzić, skąd model się wziął i spróbować odtworzyć proces.

To nie usuwa kosztu reprodukcji ani ryzyka błędów w dokumentacji, ale daje badaczom znacznie więcej niż sam plik z parametrami. Benchmarki warto więc czytać jako część udokumentowanego procesu, nie jedyny argument za modelem.

Źródła

Modele LLM

Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.