Knowledge graph

One node per note. Available translations open in the selected language; other texts show their source language.

Linked thinking

Knowledge Graph

414 notes1293 links394 connected
Scroll to zoom · drag to move · rotate with controls
AI [Polski]TokenModele LLM [Polski]AI Harness [Polski]TransformerFine-tuningReinforcement LearningKV Cache42ah⁝ Czy możemy zbudować teorię fizyki procesu uczenia, która przewiduje makroskopowe zachowania sieci? [Polski]Learning rate to za mało. Liczy się ELR [Polski]Autoregressive Language ModelingCross-entropyPrefillSoftmaxCausal MaskingDecodePre-trainingToken EmbeddingKnowledge DistillationMulti-Head AttentionOptimizer State [Polski]Stochastic Gradient Descent [Polski]TemperatureAdam [Polski]Prefix CachingHy4 Preview ma limit 1M tokenów, lecz receptury SGLang pokazują 262K [Polski]KV-cache scaling problem in LLM inference [Polski]LoRASelf-attentionThe same ranking yields different decisions after reorderingVoting lies. Disagreement usually does notChinese AI Labs [Polski]Model uczony pojedynczych poprawek rozwija harness na nowym benchmarku [Polski]Prefix Sliding. Myślenie może być długie, pamięć nie [Polski]Quantization errors partly cancel out across model layersReinforcement Learning with GRPO Fine-Tuning a Small Language Model for Chain-of-Thought Math Reasoning. Similar to Deepseek R1 training [Polski]Tensor Parallelism [Polski]Time to First TokenWeryfikacja kodu generowanego przez agentów wymaga niezależnych kryteriów [Polski]ZeRO [Polski]Lepsza pierwsza próba nie gwarantuje skuteczniejszych powtórek agenta [Polski]LLM [Polski]LLM inference speed is fundamentally memory-bandwidth bound [Polski]Mixed Precision Training [Polski]Positional EncodingPredicting command outputs helps with later agent trainingZachowywanie stanu w testach GPT-6 Astra na ARC-AGI-3 [Polski]100⁝ Software Engineering [Polski]27⁝ Books [Polski]All-reduce [Polski]Circuit Condensation skupia obliczenie w mniejszym grafie przyczynowym [Polski]Disaggregated Serving [Polski]Gradient Accumulation [Polski]Grouped-Query AttentionInter-token Latency [Polski]Momentum [Polski]Residual connectionScaled Dot-Product AttentionTop-k SamplingTop-p SamplingUnderstanding the Attention Mechanism in Transformer Models [Polski]Weight decay27f⁝ AMD Ryzen 9 9950X3D2 [Polski]bfloat16 [Polski]Data Parallelism [Polski]Google wydało Gemini 3 [Polski]Gradient Clipping [Polski]Idempotency Keys [Polski]KV cache między modelami. Nvidia zmniejsza koszt przełączania [Polski]Layer NormalizationLM headLoss Scaling [Polski]PagedAttentionPipeline Parallelism [Polski]Position-wise Feed-Forward NetworkReinforcement Learning from Human Feedback [Polski]Reward hacking. Wykorzystywanie luk w systemie nagród [Polski]Robot wyszedł poza planszę. Benchmark uznał to za sukces [Polski]Software engineering in AI era new (old) paradigm [Polski]Speculative DecodingTest-time scalingAll-gather [Polski]Byte Pair EncodingChunked Prefill [Polski]Continuous BatchingGRPOJava [Polski]KL DivergenceMulti-Query AttentionOpenAI wydało GPT-6 Astra [Polski]OpenAI wydało GPT-6 Sol i GPT-6 Luna [Polski]RMSNormRotary Position EmbeddingSequence PackingAdamW [Polski]Agent sam przepisał malware do zaufanej biblioteki [Polski]Anthropic wydało Claude Haiku 5.5 [Polski]Anthropic wydało Claude Opus 4.7 [Polski]Beam SearchCodex czy Claude Code. Ceny, limity i możliwości we wrześniu 2026 [Polski]Direct Preference Optimization [Polski]Greedy DecodingHP ZGX Fury. Architektura GB300, modele LLM, testy i cena [Polski]HyperballLoss maskingMiMo-V2.6. Jak wypada na tle Claude, GPT i DeepSeek [Polski]Muse Spark 1.3. Wyniki, koszty i ujawnione szczegóły architektury [Polski]Oczekiwany wynik testu musi być niezależny od kodu agenta [Polski]Reduce-scatter [Polski]ScholarCatalyst: agent nie poprawił wyszukiwania użytecznych prac [Polski]w LLM-ach koszt treningu jest ogromny. Mamy trzy ograniczenia: [Polski]20⁝ Philosophy [Polski]42ac⁝ ChatJimmy.ai - 15-17k tokenów na sekundę [Polski]Activation Checkpointing [Polski]AgentMachine [Polski]Anthropic wydało Claude Opus 5.5 [Polski]Anthropic wydało Claude Sonnet 5.5 [Polski]Astra i looped transformers. Jak model ponownie używa warstw [Polski]Catastrophic Forgetting [Polski]Deepseek R1 note [Polski]Distributed System [Polski]Everyone will say that 2025 is the year of AI agents. But I think it's far from ready [Polski]Goodput [Polski]Haiku 5.5 czy Sonnet 5.5. Kiedy warto dopłacić do większego modelu [Polski]Masked Language ModelingMVUEH. Co potwierdza odzyskanie jednego meldunku Enigmy [Polski]NVIDIA [Polski]On-policy self-distillationOpenAI wydało GPT-6.1 Sol. Cache potaniał o połowę [Polski]pass@kPerplexityScale invarianceScaling LawsSzybkość inferencji zwiększa możliwości systemów AI [Polski]Test-time ComputeTest-time training100c1a⁝ Idempotency Keys - DRAFT [Polski]42ac1⁝ Taalas [Polski]42ad⁝ Najbardziej efektywny model dla OpenClaw [Polski]42m1⁝ We are near the end of the exponential [Polski]Ai2 wydało OLMo 3 [Polski]Anthropic pokazało Claude Mythos Preview [Polski]Anthropic wydał Fable 5.1 i Mythos 5.1 [Polski]API [Polski]ASIC [Polski]Attention sinkClaude wskazał układ ART w genomach fagów. Jego funkcja pozostaje nieznana [Polski]Cognitive Debt [Polski]Conscious AGI [Polski]Conscious AGI And Anthropic Principle [Polski]Critical Batch SizeCross-attentionDelayed accelerationElixir jako system operacyjny dla agentów. Przemyślenia z budowy AgentMachine [Polski]EXO [Polski]FlashAttentionFrobenius normIle naprawdę kosztuje cache promptów w API LLM? [Polski]Implicit Regularization Through HyperparametersMiniMax wydało model M2.5 [Polski]Nesterov Momentum [Polski]Note on paper Training Large Language Models to Reason in a Continuous Latent Space [Polski]OpenAI wydało GPT-5.1 [Polski]OpenAI wydało GPT-5.1-Codex-Max [Polski]Self-distillation jako ważny kierunek rozwoju LLM [Polski]Sliding windowTypeSafe wydało Jev. Model do klasyfikacji i ocen liczbowych [Polski]