Modele LLM
To kuratorska lista premier, które są warte osobnej notatki. Nie próbuję katalogować całego rynku: przy setkach nowych modeli pełny spis szybko staje się mniej użyteczny niż dobry wybór.
Każdy wpis premierowy łączy komunikat producenta z kartą modelu lub kartą systemową, pokazuje opublikowane benchmarki i oddziela wynik modelu od wpływu narzędzi, budżetu obliczeniowego oraz programu prowadzącego test. Rozwinięcie tego problemu: benchmark mierzy także harness.
2026
-
10 września — DeepSeek V4.1-Flash
-
3 września — GPT-6 Astra
-
2 września — Gemini 3.8 Flash i Flash Cyber
-
2 września — Muse Spark 1.3
-
1 września — Claude Fable 5.1 i Mythos 5.1
-
28 sierpnia — Hy4 Preview
-
16 kwietnia — Claude Opus 4.7
-
7 kwietnia — Claude Mythos Preview — ograniczony program dla partnerów, nie premiera publiczna
-
17 lutego — Tiny Aya
-
16 lutego — Ling 2.5 i Ring 2.5
-
15 lutego — Qwen3.5
-
13 lutego — Nanbeige4.1-3B
-
12 lutego — MiniMax M2.5
-
12 lutego — GLM-5
-
2 lutego — Qwen3-Coder-Next
-
2 lutego — Step 3.5 Flash
-
27 stycznia — Kimi K2.5
-
27 stycznia — Trinity Large Preview
2025
- 18 grudnia — GPT-5.2-Codex
- 11 grudnia — GPT-5.2
- 24 listopada — Claude Opus 4.5
- 20 listopada — OLMo 3
- 19 listopada — GPT-5.1-Codex-Max
- 18 listopada — Gemini 3
- 12 listopada — GPT-5.1
- 26 sierpnia — Nano Banana / Gemini 2.5 Flash Image
- 20 stycznia — DeepSeek R1
Kontekst i metodologia
- Harness agenta — warstwa narzędzi i sterowania otaczająca model.
- 42bj⁝ Benchmark modelu obejmuje stan utrzymywany przez harness — dlaczego dwóch wyników tego samego modelu nie zawsze można porównywać wprost.
- Humanity's Last Exam nie mierzy wiarygodności modeli.
- Chińskie laboratoria AI — mapa organizacji i rodzin modeli.
- 42a2⁝ Gemini CLI — narzędzie, nie osobna premiera modelu.