Map the garden

Knowledge Graph

The original Quartz-style map of linked notes, rebuilt as a sleek interactive graph from the notebook's wikilinks and internal references.

Linked thinking

Knowledge Graph

403 notes1189 links382 connected
Scroll to zoom · drag to move · rotate with controls
AITokenModele LLMAI HarnessTransformerKV Cache42ah⁝ Czy możemy zbudować teorię fizyki procesu uczenia, która przewiduje makroskopowe zachowania sieci?Fine-tuningAutoregressive Language ModelingLearning rate to za mało. Liczy się ELRCross-entropyPrefillSoftmaxDecodeToken EmbeddingKnowledge DistillationMulti-Head AttentionOptimizer StateAdamCausal MaskingPre-trainingStochastic Gradient DescentTemperatureGłosowanie kłamie. Niezgoda zwykle nieHy4 Preview ma limit 1M tokenów, lecz receptury SGLang pokazują 262KKV-cache scaling problem in LLM inferencePrefix CachingSelf-attentionTen sam ranking daje inne decyzje po zmianie kolejnościBłędy kwantyzacji częściowo znoszą się między warstwami modeluChinese AI LabsLoRATensor ParallelismTime to First TokenZeROLLMLLM inference speed is fundamentally memory-bandwidth boundMixed Precision TrainingPrefix Sliding. Myślenie może być długie, pamięć nieWeryfikacja kodu generowanego przez agentów wymaga niezależnych kryteriów100⁝ Software Engineering27⁝ BooksAll-reduceCircuit Condensation skupia obliczenie w mniejszym grafie przyczynowymDisaggregated ServingGradient AccumulationGrouped-Query AttentionInter-token LatencyLepsza pierwsza próba nie gwarantuje skuteczniejszych powtórek agentaModel uczony pojedynczych poprawek rozwija harness na nowym benchmarkuMomentumPositional EncodingPrzewidywanie wyników poleceń pomaga w późniejszym treningu agentaReinforcement Learning with GRPO Fine-Tuning a Small Language Model for Chain-of-Thought Math Reasoning. Similar to Deepseek R1 trainingScaled Dot-Product AttentionTop-k SamplingTop-p SamplingUnderstanding the Attention Mechanism in Transformer ModelsWeight decayZachowywanie stanu w testach GPT-6 Astra na ARC-AGI-327f⁝ AMD Ryzen 9 9950X3D2bfloat16Data ParallelismGradient ClippingIdempotency KeysLayer NormalizationLM headLoss ScalingPagedAttentionPipeline ParallelismPosition-wise Feed-Forward NetworkResidual connectionSoftware engineering in AI era new (old) paradigmSpeculative DecodingTest-time scalingAll-gatherByte Pair EncodingChunked PrefillContinuous BatchingGoogle wydało Gemini 3JavaKV cache między modelami. Nvidia zmniejsza koszt przełączaniaMulti-Query AttentionOpenAI wydało GPT-6 AstraOpenAI wydało GPT-6 Sol i GPT-6 LunaRMSNormRobot wyszedł poza planszę. Benchmark uznał to za sukcesRotary Position EmbeddingAdamWAgent sam przepisał malware do zaufanej bibliotekiAnthropic wydało Claude Opus 4.7Beam SearchGreedy DecodingGRPOHP ZGX Fury. Architektura GB300, modele LLM, testy i cenaHyperballOczekiwany wynik testu musi być niezależny od kodu agentaReduce-scatterReward hacking. Wykorzystywanie luk w systemie nagródw LLM-ach koszt treningu jest ogromny. Mamy trzy ograniczenia:20⁝ Philosophy42ac⁝ ChatJimmy.ai - 15-17k tokenów na sekundęActivation CheckpointingAgentMachineAnthropic wydało Claude Opus 5.5Codex czy Claude Code. Ceny, limity i możliwości we wrześniu 2026Distributed SystemEveryone will say that 2025 is the year of AI agents. But I think it's far from readyGoodputKL DivergenceMasked Language ModelingMiMo-V2.6. Jak wypada na tle Claude, GPT i DeepSeekMVUEH. Co potwierdza odzyskanie jednego meldunku EnigmyNVIDIAOn-policy self-distillationpass@kPerplexityScale invarianceScaling LawsScholarCatalyst: agent nie poprawił wyszukiwania użytecznych pracTest-time ComputeTest-time training100c1a⁝ Idempotency Keys - DRAFTAnthropic wydał Fable 5.1 i Mythos 5.1APIASICAstra i looped transformers. Jak model ponownie używa warstwAttention sinkCognitive DebtConscious AGIConscious AGI And Anthropic PrincipleCritical Batch SizeCross-attentionDeepseek R1 noteDelayed accelerationElixir jako system operacyjny dla agentów. Przemyślenia z budowy AgentMachineEXOFlashAttentionImplicit Regularization Przez HyperparametryLoss maskingMuse Spark 1.3. Wyniki, koszty i ujawnione szczegóły architekturyNesterov MomentumNorma FrobeniusaNote on paper Training Large Language Models to Reason in a Continuous Latent SpaceOpenAI wydało GPT-5.1OpenAI wydało GPT-5.1-Codex-MaxOpenAI wydało GPT-6.1 Sol. Cache potaniał o połowęSelf-distillation jako ważny kierunek rozwoju LLMSliding windowSzybkość inferencji zwiększa możliwości systemów AI