Token
Token
Pegas una frase en el chat y el contador muestra más de diez unidades. ¿Por qué no tantas como palabras hay? El ordenador necesita una forma establecida de dividir el texto que también maneje nombres poco frecuentes, signos de puntuación y fragmentos de código.
Esa unidad es el token: un fragmento de texto del vocabulario que usa un modelo determinado. Puede abarcar una palabra entera, parte de ella, un carácter o un espacio junto con las letras siguientes. Un programa llamado tokenizador divide el texto y convierte los fragmentos en números; solo esos números llegan al modelo.
Por ejemplo, «Disfruto leyendo libros.» puede dividirse de forma ilustrativa en Dis, fruto, leyendo, lib, ros, .. Son seis tokens, aunque la frase tiene tres palabras. La división real depende del tokenizador: este ejemplo no es el resultado de un modelo concreto. Un modelo que crea una respuesta predice esos fragmentos sucesivos y el programa vuelve a unirlos en texto.
Los tokens ayudan a comprender los límites de longitud de la conversación y cómo se calculan las tarifas en muchos servicios. El número de palabras no basta para estimarlos. Un token es una unidad de representación, no de significado: un fragmento de palabra no tiene por qué tener sentido propio. Byte Pair Encoding describe cómo se obtiene esa división. La documentación de Hugging Face explica la tokenización y sus variantes.