Tipos de tokens en los LLM
Los tokens son las unidades básicas de procesamiento de texto en los modelos de lenguaje. Se pueden clasificar según su papel, visibilidad y función.
1. Clasificación según el flujo de procesamiento
| Tipo | Descripción | ¿Cuenta para el coste? | Ejemplo |
|---|---|---|---|
| Input | Tokens de la consulta o del prompt | Sí | «Procesa este texto:» |
| Output | Tokens generados por el modelo | Sí | «Aquí está la respuesta.» |
| Context | Suma de la entrada, el historial de conversación y la salida en la ventana de contexto | Sí | Toda la conversación |
| Cached | Tokens de entrada que el sistema reconoce como ya procesados y puede reutilizar | Sí, pero suelen ser más baratos | El mismo prompt de sistema o una parte sin cambios de un contexto largo |
2. Tokens especiales y de sistema
- De sistema: definen el papel del modelo, por ejemplo: «Eres un experto».
- Especiales: marcadores técnicos como
<|endoftext|>,<|im_start|>,<|im_end|>, que describen la estructura de los datos. - Thinking / Reasoning: tokens ocultos que utiliza el modelo durante el proceso de razonamiento.
- Planning / Critical: tokens que apoyan la planificación o las etapas clave de la lógica de la respuesta.
3. Clasificación según la tokenización
| Método | Granularidad | Ventajas | Inconvenientes |
|---|---|---|---|
| Palabras | Palabras enteras | Enfoque sencillo | Peor rendimiento con palabras nuevas o poco frecuentes |
| Subpalabras (BPE) | Partes de palabras | Flexibles, habituales en los LLM | Más complejas |
| Caracteres | Letras individuales | Universales | Generan muchos más tokens |
Regla económica
Input + Cached + Output ≤ ventana de contexto del modelo
por ejemplo, 128K tokens.
¿Qué significan los tokens en caché en la práctica?
Los tokens en caché son fragmentos de la entrada que no han cambiado entre llamadas sucesivas al modelo.
Lo más habitual es que sean:
- el mismo prompt de sistema
- el mismo historial de conversación
- las mismas instrucciones o documentos adjuntos a muchas consultas
Gracias a esto, el sistema no siempre tiene que recalcularlo todo desde cero, y ese fragmento puede facturarse a un precio menor. No todos los modelos lo admiten.
Regla práctica
Cuanto más contexto fijo y sin cambios haya entre consultas, mayor será la posibilidad de utilizar tokens en caché y reducir el coste.