<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
<channel>
  <title>Paweł Dubiel Tech Blog</title>
  <link>https://paweldubiel.com</link>
  <atom:link href="https://paweldubiel.com/es/rss.xml" rel="self" type="application/rss+xml" />
  <description>A public digital garden about AI, software engineering, books, and learning.</description>
  <language>es</language>
  <lastBuildDate>Wed, 07 Oct 2026 00:00:00 GMT</lastBuildDate>
<item>
  <title>Empaquetado de secuencias</title>
  <link>https://paweldubiel.com/es/notes/42gq%E2%81%9D%20Sequence%20Packing</link>
  <guid>https://paweldubiel.com/es/notes/42gq%E2%81%9D%20Sequence%20Packing</guid>
  <pubDate>Wed, 07 Oct 2026 00:00:00 GMT</pubDate>
  <description>Enseñas al modelo a escribir respuestas breves para clientes: «Muchas gracias», «No» y «Sí». Tras dividirlas en fragmentos de texto, es decir, tokens, suponemos que los ejemplos tienen 3, 2 y 2 posiciones, incluyendo el </description>
</item>
<item>
  <title>Aprendizaje por refuerzo</title>
  <link>https://paweldubiel.com/es/notes/42gk%E2%81%9D%20Reinforcement%20Learning</link>
  <guid>https://paweldubiel.com/es/notes/42gk%E2%81%9D%20Reinforcement%20Learning</guid>
  <pubDate>Mon, 05 Oct 2026 00:00:00 GMT</pubDate>
  <description>Quieres enseñar a un programa a ganar en un juego pequeño. En una bifurcación puede elegir la ruta A, recoger dos monedas de inmediato y terminar el segundo turno sin monedas nuevas. La ruta B no da nada en el primer tur</description>
</item>
<item>
  <title>Predecir los resultados de los comandos ayuda en el entrenamiento posterior del agente</title>
  <link>https://paweldubiel.com/es/notes/42eo%E2%81%9D%20Przewidywanie%20wynik%C3%B3w%20polece%C5%84%20pomaga%20w%20p%C3%B3%C5%BAniejszym%20treningu%20agenta</link>
  <guid>https://paweldubiel.com/es/notes/42eo%E2%81%9D%20Przewidywanie%20wynik%C3%B3w%20polece%C5%84%20pomaga%20w%20p%C3%B3%C5%BAniejszym%20treningu%20agenta</guid>
  <pubDate>Sun, 20 Sep 2026 00:00:00 GMT</pubDate>
  <description>Un agente que trabaja en una terminal intenta ejecutar un programa. Envía un comando, lee un mensaje de error y elige la siguiente acción. Para ello, debe relacionar el resultado con el comando anterior: reconocer si fal</description>
</item>
<item>
  <title>Enmascaramiento de la pérdida</title>
  <link>https://paweldubiel.com/es/notes/42eo1%E2%81%9D%20Loss%20masking</link>
  <guid>https://paweldubiel.com/es/notes/42eo1%E2%81%9D%20Loss%20masking</guid>
  <pubDate>Sun, 20 Sep 2026 00:00:00 GMT</pubDate>
  <description>Entrenas a un agente con registros de conversaciones con herramientas. El registro contiene sus órdenes y las respuestas de las herramientas. Quieres evaluarlo por determinados fragmentos, pero permitirle seguir leyendo </description>
</item>
<item>
  <title>pass@k</title>
  <link>https://paweldubiel.com/es/notes/42eo2%E2%81%9D%20pass%40k</link>
  <guid>https://paweldubiel.com/es/notes/42eo2%E2%81%9D%20pass%40k</guid>
  <pubDate>Sun, 20 Sep 2026 00:00:00 GMT</pubDate>
  <description>El modelo ha preparado diez programas y uno ha superado las pruebas. ¿Significa eso que una respuesta individual tiene una buena tasa de éxito? Necesitas distinguir «funcionó a la primera» de «encontramos un éxito entre </description>
</item>
<item>
  <title>Batching continuo</title>
  <link>https://paweldubiel.com/es/notes/42el%E2%81%9D%20Continuous%20Batching</link>
  <guid>https://paweldubiel.com/es/notes/42el%E2%81%9D%20Continuous%20Batching</guid>
  <pubDate>Sun, 20 Sep 2026 00:00:00 GMT</pubDate>
  <description>El servidor genera dos respuestas al mismo tiempo. Una termina pronto y la otra es larga. Si el siguiente usuario tiene que esperar a que termine toda la pareja, la plaza liberada se desperdicia durante muchos pasos. Con</description>
</item>
<item>
  <title>Caché de prefijos</title>
  <link>https://paweldubiel.com/es/notes/42em%E2%81%9D%20Prefix%20Caching</link>
  <guid>https://paweldubiel.com/es/notes/42em%E2%81%9D%20Prefix%20Caching</guid>
  <pubDate>Sun, 20 Sep 2026 00:00:00 GMT</pubDate>
  <description>Haces cinco preguntas sobre el mismo documento largo. Cada entrada empieza con una instrucción idéntica y el texto del documento; solo al final aparece la nueva pregunta. Volver a calcular el mismo principio repetiría el</description>
</item>
<item>
  <title>PagedAttention</title>
  <link>https://paweldubiel.com/es/notes/42ek%E2%81%9D%20PagedAttention</link>
  <guid>https://paweldubiel.com/es/notes/42ek%E2%81%9D%20PagedAttention</guid>
  <pubDate>Sun, 20 Sep 2026 00:00:00 GMT</pubDate>
  <description>El servidor atiende conversaciones de distinta longitud. Si reserva de antemano para cada una una gran zona contigua de memoria para toda la respuesta futura, parte del espacio queda sin utilizar. Quieres asignar fragmen</description>
</item>
<item>
  <title>Tiempo hasta el primer token</title>
  <link>https://paweldubiel.com/es/notes/42en%E2%81%9D%20Time%20to%20First%20Token</link>
  <guid>https://paweldubiel.com/es/notes/42en%E2%81%9D%20Time%20to%20First%20Token</guid>
  <pubDate>Sun, 20 Sep 2026 00:00:00 GMT</pubDate>
  <description>Pulsas «Enviar» y miras el chat vacío. Para la comodidad del usuario importa cuándo aparece el principio de la respuesta, aunque escribirla entera lleve mucho más tiempo. Necesitas medir esa primera espera. Time to First</description>
</item>
<item>
  <title>Decode</title>
  <link>https://paweldubiel.com/es/notes/42eg%E2%81%9D%20Decode</link>
  <guid>https://paweldubiel.com/es/notes/42eg%E2%81%9D%20Decode</guid>
  <pubDate>Fri, 18 Sep 2026 00:00:00 GMT</pubDate>
  <description>Ya ha aparecido el primer fragmento de la respuesta. El siguiente debe tener en cuenta lo que acaba de escribirse: después de «Hoy bebo té», el modelo tiene un contexto distinto que después de «Hoy bebo agua». Hay que de</description>
</item>
<item>
  <title>Decodificación especulativa</title>
  <link>https://paweldubiel.com/es/notes/42ei%E2%81%9D%20Speculative%20Decoding</link>
  <guid>https://paweldubiel.com/es/notes/42ei%E2%81%9D%20Speculative%20Decoding</guid>
  <pubDate>Fri, 18 Sep 2026 00:00:00 GMT</pubDate>
  <description>El modelo grande genera texto correctamente, pero despacio. Un modelo pequeño puede proponer con rapidez varios fragmentos siguientes. Quieres aprovechar su trabajo manteniendo el control del modelo grande sobre el resul</description>
</item>
<item>
  <title>FlashAttention</title>
  <link>https://paweldubiel.com/es/notes/42eh%E2%81%9D%20FlashAttention</link>
  <guid>https://paweldubiel.com/es/notes/42eh%E2%81%9D%20FlashAttention</guid>
  <pubDate>Fri, 18 Sep 2026 00:00:00 GMT</pubDate>
  <description>Attention compara muchas parejas de fragmentos de texto. Si guardamos todos los resultados intermedios en la gran memoria de la tarjeta de cálculo, transferir los datos puede resultar costoso. Quieres realizar el mismo c</description>
</item>
<item>
  <title>Prefill</title>
  <link>https://paweldubiel.com/es/notes/42ef%E2%81%9D%20Prefill</link>
  <guid>https://paweldubiel.com/es/notes/42ef%E2%81%9D%20Prefill</guid>
  <pubDate>Fri, 18 Sep 2026 00:00:00 GMT</pubDate>
  <description>Envías una pregunta larga al chat y esperas la primera palabra. Antes de añadir la respuesta, el modelo tiene que procesar el contenido que ya ha recibido. Esta etapa inicial puede exigir mucho trabajo, sobre todo con un</description>
</item>
<item>
  <title>Atención de consultas agrupadas</title>
  <link>https://paweldubiel.com/es/notes/42ed%E2%81%9D%20Grouped-Query%20Attention</link>
  <guid>https://paweldubiel.com/es/notes/42ed%E2%81%9D%20Grouped-Query%20Attention</guid>
  <pubDate>Fri, 18 Sep 2026 00:00:00 GMT</pubDate>
  <description>El modelo lee el texto anterior de varias formas en paralelo. Cada uno de esos cálculos es una cabeza de atención, o attention. Quieres reducir la memoria que ocupan esas cabezas, pero compartir por completo un único con</description>
</item>
<item>
  <title>Atención multi-query</title>
  <link>https://paweldubiel.com/es/notes/42ec%E2%81%9D%20Multi-Query%20Attention</link>
  <guid>https://paweldubiel.com/es/notes/42ec%E2%81%9D%20Multi-Query%20Attention</guid>
  <pubDate>Fri, 18 Sep 2026 00:00:00 GMT</pubDate>
  <description>El modelo relaciona el fragmento actual del texto con la conversación anterior mediante varios cálculos paralelos. Estos cálculos se llaman cabezas de atención, o attention. Si cada cabeza almacena sus propias descripcio</description>
</item>
<item>
  <title>Búsqueda en haz</title>
  <link>https://paweldubiel.com/es/notes/42eb%E2%81%9D%20Beam%20Search</link>
  <guid>https://paweldubiel.com/es/notes/42eb%E2%81%9D%20Beam%20Search</guid>
  <pubDate>Fri, 18 Sep 2026 00:00:00 GMT</pubDate>
  <description>Al elegir el primer fragmento de una respuesta, puedes descartar demasiado pronto un camino que más adelante sería mejor. Sin embargo, comprobar todas las secuencias posibles resulta demasiado costoso. Necesitas un conju</description>
</item>
<item>
  <title>Decodificación voraz</title>
  <link>https://paweldubiel.com/es/notes/42ea%E2%81%9D%20Greedy%20Decoding</link>
  <guid>https://paweldubiel.com/es/notes/42ea%E2%81%9D%20Greedy%20Decoding</guid>
  <pubDate>Fri, 18 Sep 2026 00:00:00 GMT</pubDate>
  <description>El modelo puede añadir varios fragmentos distintos. La elección más sencilla es tomar siempre el de mayor probabilidad. Eso evita considerar alternativas, pero ¿el mejor primer paso conduce a la mejor secuencia completa?</description>
</item>
<item>
  <title>Embedding posicional rotatorio</title>
  <link>https://paweldubiel.com/es/notes/42ee%E2%81%9D%20Rotary%20Position%20Embedding</link>
  <guid>https://paweldubiel.com/es/notes/42ee%E2%81%9D%20Rotary%20Position%20Embedding</guid>
  <pubDate>Fri, 18 Sep 2026 00:00:00 GMT</pubDate>
  <description>El modelo compara fragmentos de texto, pero también necesita saber a qué distancia se encuentran. «Ayer» junto al verbo puede desempeñar un papel distinto que la misma palabra en una cita lejana. ¿Cómo incorporar la posi</description>
</item>
<item>
  <title>Caché KV</title>
  <link>https://paweldubiel.com/es/notes/42dy%E2%81%9D%20KV%20Cache</link>
  <guid>https://paweldubiel.com/es/notes/42dy%E2%81%9D%20KV%20Cache</guid>
  <pubDate>Wed, 16 Sep 2026 00:00:00 GMT</pubDate>
  <description>El modelo añade una respuesta fragmento a fragmento. Ya ha calculado mucha información sobre el texto anterior, de modo que calcularla desde cero en cada paso repetiría el trabajo. Quieres recordar los resultados que sig</description>
</item>
<item>
  <title>Destilación de conocimiento</title>
  <link>https://paweldubiel.com/es/notes/42dx%E2%81%9D%20Knowledge%20Distillation</link>
  <guid>https://paweldubiel.com/es/notes/42dx%E2%81%9D%20Knowledge%20Distillation</guid>
  <pubDate>Wed, 16 Sep 2026 00:00:00 GMT</pubDate>
  <description>Un modelo grande realiza bien la tarea, pero resulta demasiado costoso para el uso cotidiano. Un modelo pequeño podría intentar reproducir su comportamiento. Sin embargo, necesita ejemplos o evaluaciones que muestren alg</description>
</item>
<item>
  <title>Divergencia KL</title>
  <link>https://paweldubiel.com/es/notes/42dw%E2%81%9D%20KL%20Divergence</link>
  <guid>https://paweldubiel.com/es/notes/42dw%E2%81%9D%20KL%20Divergence</guid>
  <pubDate>Wed, 16 Sep 2026 00:00:00 GMT</pubDate>
  <description>Dos modelos reparten de forma distinta las probabilidades entre las mismas respuestas. Uno asigna un 90% a A y un 10% a B; el otro les da un 50% a cada una. Quieres medir qué tan bien reproduce el segundo las prediccione</description>
</item>
<item>
  <title>Muestreo top-k</title>
  <link>https://paweldubiel.com/es/notes/42du%E2%81%9D%20Top-k%20Sampling</link>
  <guid>https://paweldubiel.com/es/notes/42du%E2%81%9D%20Top-k%20Sampling</guid>
  <pubDate>Wed, 16 Sep 2026 00:00:00 GMT</pubDate>
  <description>Al sortear el siguiente fragmento, el modelo admite muchas posibilidades muy poco probables. Quieres conservar algo de diversidad, pero eliminar la cola lejana de candidatos. Puedes admitir solo un número determinado de </description>
</item>
<item>
  <title>Muestreo top-p</title>
  <link>https://paweldubiel.com/es/notes/42dv%E2%81%9D%20Top-p%20Sampling</link>
  <guid>https://paweldubiel.com/es/notes/42dv%E2%81%9D%20Top-p%20Sampling</guid>
  <pubDate>Wed, 16 Sep 2026 00:00:00 GMT</pubDate>
  <description>A veces el modelo tiene un líder claro y otras veces muchas continuaciones con puntuaciones parecidas. Admitir siempre cinco candidatos no tiene en cuenta esa diferencia. Quieres ajustar el tamaño del grupo según dónde s</description>
</item>
<item>
  <title>Entropía cruzada</title>
  <link>https://paweldubiel.com/es/notes/42do%E2%81%9D%20Cross-entropy</link>
  <guid>https://paweldubiel.com/es/notes/42do%E2%81%9D%20Cross-entropy</guid>
  <pubDate>Tue, 15 Sep 2026 00:00:00 GMT</pubDate>
  <description>Dos modelos señalan la misma palabra como la mejor continuación, pero el primero le da un 80% de probabilidad y el segundo solo un 20% . Comprobar únicamente el ganador omite esa diferencia. Al entrenar necesitamos una m</description>
</item>
<item>
  <title>LoRA</title>
  <link>https://paweldubiel.com/es/notes/42ds%E2%81%9D%20LoRA</link>
  <guid>https://paweldubiel.com/es/notes/42ds%E2%81%9D%20LoRA</guid>
  <pubDate>Tue, 15 Sep 2026 00:00:00 GMT</pubDate>
  <description>Tienes un modelo grande y quieres adaptarlo al estilo de tus documentos. Entrenar todos sus pesos —los números que controlan los cálculos— exige mucha memoria. ¿Se puede aprender solo una corrección pequeña de lo que el </description>
</item>
<item>
  <title>Modelado del lenguaje enmascarado</title>
  <link>https://paweldubiel.com/es/notes/42dq%E2%81%9D%20Masked%20Language%20Modeling</link>
  <guid>https://paweldubiel.com/es/notes/42dq%E2%81%9D%20Masked%20Language%20Modeling</guid>
  <pubDate>Tue, 15 Sep 2026 00:00:00 GMT</pubDate>
  <description>Quieres enseñar al modelo a usar toda la frase. Ocultas un fragmento de «Ana tiene MASK » o de «Ana MASK un gato» y le pides que reconstruya el original. La información a ambos lados del hueco puede ser necesaria para re</description>
</item>
<item>
  <title>Perplejidad</title>
  <link>https://paweldubiel.com/es/notes/42dp%E2%81%9D%20Perplexity</link>
  <guid>https://paweldubiel.com/es/notes/42dp%E2%81%9D%20Perplexity</guid>
  <pubDate>Tue, 15 Sep 2026 00:00:00 GMT</pubDate>
  <description>Comparas dos modelos sobre el mismo texto. Quieres saber cuál predice mejor sus fragmentos sucesivos, no solo cuál acertó más ganadores individuales. Necesitas una cifra que resuma las probabilidades asignadas a la secue</description>
</item>
<item>
  <title>Temperatura</title>
  <link>https://paweldubiel.com/es/notes/42dr%E2%81%9D%20Temperature</link>
  <guid>https://paweldubiel.com/es/notes/42dr%E2%81%9D%20Temperature</guid>
  <pubDate>Tue, 15 Sep 2026 00:00:00 GMT</pubDate>
  <description>El modelo suele elegir continuaciones parecidas y quieres regular la diversidad del muestreo. No cambias sus conocimientos ni sus pesos. Solo cambias cuánto influye la ventaja de los candidatos mejor puntuados en sus pro</description>
</item>
<item>
  <title>Ajuste fino</title>
  <link>https://paweldubiel.com/es/notes/42dn%E2%81%9D%20Fine-tuning</link>
  <guid>https://paweldubiel.com/es/notes/42dn%E2%81%9D%20Fine-tuning</guid>
  <pubDate>Mon, 14 Sep 2026 00:00:00 GMT</pubDate>
  <description>El modelo entrenado sabe procesar el lenguaje, pero quieres que clasifique los mensajes de la empresa como «devolución», «entrega» o «pago». La habilidad general todavía no proporciona la forma de trabajar que esperas. P</description>
</item>
<item>
  <title>Codificación por pares de bytes</title>
  <link>https://paweldubiel.com/es/notes/42dl%E2%81%9D%20Byte%20Pair%20Encoding</link>
  <guid>https://paweldubiel.com/es/notes/42dl%E2%81%9D%20Byte%20Pair%20Encoding</guid>
  <pubDate>Mon, 14 Sep 2026 00:00:00 GMT</pubDate>
  <description>Un vocabulario que contuviera todas las palabras posibles sería enorme y seguiría careciendo de nombres nuevos. Un vocabulario de caracteres es pequeño, pero convierte el texto en una secuencia muy larga. Necesitas un co</description>
</item>
<item>
  <title>Modelado autorregresivo del lenguaje</title>
  <link>https://paweldubiel.com/es/notes/42dj%E2%81%9D%20Autoregressive%20Language%20Modeling</link>
  <guid>https://paweldubiel.com/es/notes/42dj%E2%81%9D%20Autoregressive%20Language%20Modeling</guid>
  <pubDate>Mon, 14 Sep 2026 00:00:00 GMT</pubDate>
  <description>Empiezas la frase «Hoy bebo…». Después de añadir «té», las posibles continuaciones son distintas que después de «agua». El modelo tiene que considerar el texto ya elegido en cada paso siguiente, en lugar de adivinar todo</description>
</item>
<item>
  <title>Preentrenamiento</title>
  <link>https://paweldubiel.com/es/notes/42dm%E2%81%9D%20Pre-training</link>
  <guid>https://paweldubiel.com/es/notes/42dm%E2%81%9D%20Pre-training</guid>
  <pubDate>Mon, 14 Sep 2026 00:00:00 GMT</pubDate>
  <description>Quieres que el modelo reconozca relaciones en el lenguaje antes de adaptarlo a un trabajo concreto, como clasificar mensajes de clientes. Preparar manualmente respuestas para todo el texto sería inviable. Sin embargo, el</description>
</item>
<item>
  <title>Softmax</title>
  <link>https://paweldubiel.com/es/notes/42dk%E2%81%9D%20Softmax</link>
  <guid>https://paweldubiel.com/es/notes/42dk%E2%81%9D%20Softmax</guid>
  <pubDate>Mon, 14 Sep 2026 00:00:00 GMT</pubDate>
  <description>El modelo ha puntuado tres posibles continuaciones de una frase con los números 2 , 1 y 0 . Quieres sortear una respuesta según sus probabilidades. Las puntuaciones brutas no son probabilidades: pueden ser negativas y no</description>
</item>
<item>
  <title>Atención cruzada</title>
  <link>https://paweldubiel.com/es/notes/42dd%E2%81%9D%20Cross-attention</link>
  <guid>https://paweldubiel.com/es/notes/42dd%E2%81%9D%20Cross-attention</guid>
  <pubDate>Mon, 14 Sep 2026 00:00:00 GMT</pubDate>
  <description>Al traducir, el modelo tiene dos textos distintos: el original y la respuesta que está creando. Cuando añade la siguiente palabra de la traducción, necesita información del original. Mezclar solo la respuesta ya escrita </description>
</item>
<item>
  <title>Embedding de tokens</title>
  <link>https://paweldubiel.com/es/notes/42db%E2%81%9D%20Token%20Embedding</link>
  <guid>https://paweldubiel.com/es/notes/42db%E2%81%9D%20Token%20Embedding</guid>
  <pubDate>Mon, 14 Sep 2026 00:00:00 GMT</pubDate>
  <description>El ordenador recibe un número que representa un fragmento de texto. El número 17 por sí solo no le dice qué es ese fragmento ni cómo se relaciona con otros. Necesita una descripción numérica útil que pueda transformar du</description>
</item>
<item>
  <title>Enmascaramiento causal</title>
  <link>https://paweldubiel.com/es/notes/42dc%E2%81%9D%20Causal%20Masking</link>
  <guid>https://paweldubiel.com/es/notes/42dc%E2%81%9D%20Causal%20Masking</guid>
  <pubDate>Mon, 14 Sep 2026 00:00:00 GMT</pubDate>
  <description>Enseñas al modelo a añadir «gato» después de «Ana tiene un». En el ejemplo preparado, la palabra «gato» ya existe. Si el modelo pudiera verla mientras predice, la tarea parecería fácil, pero no se parecería a crear una r</description>
</item>
<item>
  <title>Normalización por capa</title>
  <link>https://paweldubiel.com/es/notes/42df%E2%81%9D%20Layer%20Normalization</link>
  <guid>https://paweldubiel.com/es/notes/42df%E2%81%9D%20Layer%20Normalization</guid>
  <pubDate>Mon, 14 Sep 2026 00:00:00 GMT</pubDate>
  <description>A la siguiente capa llega la descripción de un fragmento con los números 2, 4 y la de otro con 20, 40 . La magnitud de la señal puede variar mucho. Quieres facilitar los cálculos convirtiendo los números de cada descripc</description>
</item>
<item>
  <title>Red feed-forward por posición</title>
  <link>https://paweldubiel.com/es/notes/42de%E2%81%9D%20Position-wise%20Feed-Forward%20Network</link>
  <guid>https://paweldubiel.com/es/notes/42de%E2%81%9D%20Position-wise%20Feed-Forward%20Network</guid>
  <pubDate>Mon, 14 Sep 2026 00:00:00 GMT</pubDate>
  <description>El modelo ha recogido para un fragmento información del resto de la frase. Ahora hay que procesar esa descripción: combinar las características y calcular una representación nueva. Volver a leer otras posiciones no es la</description>
</item>
<item>
  <title>Los errores de cuantización se compensan parcialmente entre las capas del modelo</title>
  <link>https://paweldubiel.com/es/notes/42da%E2%81%9D%20B%C5%82%C4%99dy%20kwantyzacji%20cz%C4%99%C5%9Bciowo%20znosz%C4%85%20si%C4%99%20mi%C4%99dzy%20warstwami%20modelu</link>
  <guid>https://paweldubiel.com/es/notes/42da%E2%81%9D%20B%C5%82%C4%99dy%20kwantyzacji%20cz%C4%99%C5%9Bciowo%20znosz%C4%85%20si%C4%99%20mi%C4%99dzy%20warstwami%20modelu</guid>
  <pubDate>Sun, 13 Sep 2026 00:00:00 GMT</pubDate>
  <description>Quieres ejecutar un modelo de lenguaje en tu propia tarjeta gráfica, pero sus pesos ocupan demasiada memoria. Una solución es la cuantización posterior al entrenamiento: sustituyes los números guardados en el modelo ya e</description>
</item>
<item>
  <title>Cuantización posterior al entrenamiento</title>
  <link>https://paweldubiel.com/es/notes/42da1%E2%81%9D%20Post-training%20quantization</link>
  <guid>https://paweldubiel.com/es/notes/42da1%E2%81%9D%20Post-training%20quantization</guid>
  <pubDate>Sun, 13 Sep 2026 00:00:00 GMT</pubDate>
  <description>Ya tienes un modelo entrenado, pero ocupa demasiada memoria para ejecutarlo en el ordenador elegido. Gran parte del espacio corresponde a los números que controlan los cálculos. ¿Se pueden guardar con menos precisión y a</description>
</item>
<item>
  <title>Conexión residual</title>
  <link>https://paweldubiel.com/es/notes/42da2%E2%81%9D%20Residual%20connection</link>
  <guid>https://paweldubiel.com/es/notes/42da2%E2%81%9D%20Residual%20connection</guid>
  <pubDate>Sun, 13 Sep 2026 00:00:00 GMT</pubDate>
  <description>El modelo procesa la descripción del texto a través de muchas capas. Si cada capa tuviera que reconstruir toda la información desde cero, sería fácil dificultar su transmisión. Resulta útil conservar la entrada y añadirl</description>
</item>
<item>
  <title>Cabeza del modelo de lenguaje</title>
  <link>https://paweldubiel.com/es/notes/42da3%E2%81%9D%20LM%20head</link>
  <guid>https://paweldubiel.com/es/notes/42da3%E2%81%9D%20LM%20head</guid>
  <pubDate>Sun, 13 Sep 2026 00:00:00 GMT</pubDate>
  <description>El modelo ha procesado «Hoy bebo» y tiene una descripción interna de ese contenido en forma de una lista de números. Sin embargo, el usuario espera texto. Necesitamos pasar de la descripción oculta del modelo a puntuacio</description>
</item>
<item>
  <title>Atención de múltiples cabezas</title>
  <link>https://paweldubiel.com/es/notes/42cy%E2%81%9D%20Multi-Head%20Attention</link>
  <guid>https://paweldubiel.com/es/notes/42cy%E2%81%9D%20Multi-Head%20Attention</guid>
  <pubDate>Sun, 13 Sep 2026 00:00:00 GMT</pubDate>
  <description>Una sola combinación de información puede mezclar demasiado las distintas relaciones de una frase. Al traducir, pueden ser útiles al mismo tiempo las relaciones entre personas, tiempo y forma gramatical. Queremos permiti</description>
</item>
<item>
  <title>Atención por producto escalar escalado</title>
  <link>https://paweldubiel.com/es/notes/42cx%E2%81%9D%20Scaled%20Dot-Product%20Attention</link>
  <guid>https://paweldubiel.com/es/notes/42cx%E2%81%9D%20Scaled%20Dot-Product%20Attention</guid>
  <pubDate>Sun, 13 Sep 2026 00:00:00 GMT</pubDate>
  <description>El modelo tiene que combinar información de varios fragmentos de una frase. Uno es más útil y otro menos. Hace falta un método concreto para calcular sus contribuciones y después reunir la información en un único resulta</description>
</item>
<item>
  <title>Autoatención</title>
  <link>https://paweldubiel.com/es/notes/42cw%E2%81%9D%20Self-attention</link>
  <guid>https://paweldubiel.com/es/notes/42cw%E2%81%9D%20Self-attention</guid>
  <pubDate>Sun, 13 Sep 2026 00:00:00 GMT</pubDate>
  <description>En la frase «Ana dejó el libro porque era pesado», la palabra «era» por sí sola explica poco. Hay que relacionarla con los fragmentos anteriores. Un modelo que procesa texto necesita una forma de que la descripción de un</description>
</item>
<item>
  <title>Codificación posicional</title>
  <link>https://paweldubiel.com/es/notes/42cz%E2%81%9D%20Positional%20Encoding</link>
  <guid>https://paweldubiel.com/es/notes/42cz%E2%81%9D%20Positional%20Encoding</guid>
  <pubDate>Sun, 13 Sep 2026 00:00:00 GMT</pubDate>
  <description>Lees las frases «BMW adelantó a Volvo» y «Volvo adelantó a BMW». Contienen exactamente las mismas palabras, pero cambiar el orden invierte los papeles de los coches. Si el mecanismo del modelo solo ve las descripciones d</description>
</item>
<item>
  <title>Transformer</title>
  <link>https://paweldubiel.com/es/notes/42cv%E2%81%9D%20Transformer</link>
  <guid>https://paweldubiel.com/es/notes/42cv%E2%81%9D%20Transformer</guid>
  <pubDate>Sun, 13 Sep 2026 00:00:00 GMT</pubDate>
  <description>Quieres traducir la frase «El tren llegará mañana». Traducir cada palabra por separado no basta: la forma correcta depende de las demás palabras y de su orden. El modelo necesita una forma de combinar información del tex</description>
</item>
<item>
  <title>El mismo ranking produce decisiones distintas al cambiar el orden</title>
  <link>https://paweldubiel.com/es/notes/42be%E2%81%9D%20Ten%20sam%20ranking%20daje%20inne%20decyzje%20po%20zmianie%20kolejno%C5%9Bci</link>
  <guid>https://paweldubiel.com/es/notes/42be%E2%81%9D%20Ten%20sam%20ranking%20daje%20inne%20decyzje%20po%20zmianie%20kolejno%C5%9Bci</guid>
  <pubDate>Sun, 30 Aug 2026 00:00:00 GMT</pubDate>
  <description>Un sistema que responde preguntas a partir de documentos suele funcionar en cuatro pasos. El buscador encuentra candidatos, el modelo de puntuación asigna a cada uno un número que indica su utilidad, un umbral descarta l</description>
</item>
<item>
  <title>Puntuación pointwise por lotes</title>
  <link>https://paweldubiel.com/es/notes/42be1%E2%81%9D%20Batched%20pointwise%20scoring</link>
  <guid>https://paweldubiel.com/es/notes/42be1%E2%81%9D%20Batched%20pointwise%20scoring</guid>
  <pubDate>Sun, 30 Aug 2026 00:00:00 GMT</pubDate>
  <description>Tienes una pregunta y tres documentos encontrados. Quieres dar a cada uno una puntuación de utilidad, pero tres llamadas separadas al modelo repiten la misma instrucción y pregunta. Se pueden mostrar los tres juntos y pe</description>
</item>
<item>
  <title>nDCG@10</title>
  <link>https://paweldubiel.com/es/notes/42be2%E2%81%9D%20nDCG%20at%2010</link>
  <guid>https://paweldubiel.com/es/notes/42be2%E2%81%9D%20nDCG%20at%2010</guid>
  <pubDate>Sun, 30 Aug 2026 00:00:00 GMT</pubDate>
  <description>El buscador devuelve diez resultados. Los buenos documentos pueden estar en la lista, pero si el más útil ocupa el décimo lugar, quizá el lector no llegue a él. Necesitas una evaluación que considere tanto la relevancia </description>
</item>
</channel>
</rss>