Tokens: la unidad en la que un modelo cuenta, cobra y piensa
Un modelo no lee letras ni palabras: lee tokens, trozos de texto de tamaño variable. Entenderlos explica los límites de contexto, los precios y algunos errores raros.
- #tokens
- #fundamentos
- #tokenizacion
Qué es un token
Antes de que un modelo procese texto, un tokenizador lo parte en piezas. Esas piezas no son letras ni palabras exactas: son fragmentos frecuentes aprendidos del corpus. "gato" suele ser un token; "gatísimo" pueden ser dos ("gat" + "ísimo"); un emoji puede ser tres o cuatro.
El modelo nunca ve el texto original. Ve una secuencia de números, uno por token, y produce otra secuencia de números que se vuelve a convertir en texto al final.
Por qué no se usan palabras
- Vocabulario infinito. Cada idioma tiene cientos de miles de palabras y se inventan nuevas a diario. Un vocabulario de tokens de 50 000–200 000 piezas cubre todo, incluidas palabras nunca vistas, combinando trozos.
- Errores tipográficos. "atencion" sin tilde no es una palabra desconocida: son trozos conocidos ensamblados de otra forma.
- Idiomas sin espacios. El chino o el japonés no separan palabras; los tokens sí funcionan.
El algoritmo más común se llama BPE (Byte Pair Encoding): empieza con caracteres y va fusionando los pares que más aparecen juntos hasta alcanzar el tamaño de vocabulario deseado. Por eso las secuencias frecuentes ("ción", "ing", "http") acaban siendo un solo token.
Lo que los tokens explican
| Fenómeno | Explicación en tokens |
|---|---|
| "Ventana de contexto de 128k" | 128 000 tokens, no palabras ni caracteres. En español, unas 90 000 palabras. |
| El precio por millón de tokens | Se cobra por lo que el modelo procesa: tokens de entrada y de salida. |
| El español "cuesta" más que el inglés | Los tokenizadores se entrenan con más inglés; una palabra española se parte en más trozos. |
| El modelo no sabe contar letras | "¿Cuántas r tiene ferrocarril?" es difícil porque nunca vio letras, vio tokens. |
| Los números se comportan raro | "1234" puede ser un token y "1235" dos. La aritmética sufre. |
Verlo con un ejemplo
Texto: "La atención es todo lo que necesitas"
Tokens: ["La", " atención", " es", " todo", " lo", " que", " necesitas"]
Ids: [ 2874, 41225, 748, 4119, 1064, 1218, 62233 ]
Los espacios suelen ir pegados al inicio del token siguiente. Es un detalle que importa cuando cuentas o cortas texto: el mismo texto con un espacio inicial puede tokenizarse de forma distinta.
Tokens y atención
Cuando un Transformer calcula la atención, lo hace entre tokens, no entre palabras. Si una palabra se partió en tres, son tres posiciones que se atienden entre sí y con el resto. Y al generar texto, el modelo elige un token a la vez: la respuesta aparece trozo a trozo porque literalmente se produce trozo a trozo.
Para llevarte
Piensa en tokens cuando estimes costes, cuando algo no quepa en el contexto y cuando el modelo falle en tareas de letras o cifras. No es un fallo de inteligencia: es que nunca vio lo que tú ves.