# Atención: cómo decide un Transformer qué mirar

> El mecanismo de atención compara cada token con todos los demás y reparte un presupuesto de 100 %. Aquí no lo lees: lo mueves.

- Fuente canónica: https://www.ricardovelit.com/blog/p/atencion-en-transformers
- Nivel: intermedio · Lectura: 3 min · Publicado: 2026-09-04
- Etiquetas: transformers, atencion, fundamentos
- Conviene leer antes: [que-son-los-embeddings](https://www.ricardovelit.com/blog/p/que-son-los-embeddings.md)
- Relacionados: [temperatura-y-muestreo](https://www.ricardovelit.com/blog/p/temperatura-y-muestreo.md)
- Contiene componentes interactivos que solo funcionan en la versión web.

---
## El problema que resuelve

Una frase no se entiende palabra a palabra. En *"el gato duerme porque **el gato** está
cansado"*, el segundo `gato` es el mismo que el primero, y `cansado` habla de él, no de
`duerme`. Un modelo necesita una forma de **conectar tokens distantes** sin recorrer la
frase en orden.

La atención hace exactamente eso: para cada token, calcula cuánto debería "mirar" a
cada uno de los otros, y con esas proporciones mezcla su información.

## Mueve las variables

Antes de la teoría, tócalo. Elige un token, cambia la frase, arrastra los deslizadores.

> **[Componente interactivo: AttentionExplorer]** — visualizador de atención: mueve temperatura, posición y máscara causal sobre una frase. Solo en la versión web: https://www.ricardovelit.com/blog/p/atencion-en-transformers

Fíjate en tres cosas:

1. Con la frase por defecto y el segundo `gato` enfocado, la atención se va al primer
   `gato`. Se parecen, así que se atienden.
2. Baja la **temperatura** hacia 0,1: casi todo el 100 % cae en un solo token. Súbela
   a 3: se reparte casi uniforme.
3. Activa la **máscara causal**: las celdas a la derecha de la diagonal se apagan. Cada
   token solo puede mirar hacia atrás.

## Qué está pasando dentro

Cada token empieza como un vector (su [embedding](/p/que-son-los-embeddings)) al que se
le suma información de **posición**, porque sin ella el modelo no distinguiría "perro
muerde hombre" de "hombre muerde perro".

Después, para cada par de tokens *(i, j)* se calcula un **puntaje** con el producto
escalar de sus vectores. Ese puntaje se escala y pasa por un **softmax** fila a fila:

```text
atencion(i, j) = exp(s_ij / T) / SUM_k exp(s_ik / T)
```

El softmax convierte puntajes arbitrarios en proporciones que suman 1. La **temperatura**
*T* controla la nitidez: dividir por un número pequeño exagera las diferencias; por uno
grande, las aplana. Es la misma temperatura que verás en
[el muestreo de texto](/p/temperatura-y-muestreo).

Por último, la salida de cada token es la **media ponderada** de los vectores de todos
los tokens usando esas proporciones. Un token que atiende 80 % a otro sale pareciéndose
un 80 % a él.

## Queries, keys y values

En un Transformer real, el mismo vector se proyecta con tres matrices aprendidas:

| Nombre | Pregunta que responde |
| --- | --- |
| **Query** (Q) | ¿Qué estoy buscando? |
| **Key** (K) | ¿Qué ofrezco para que me encuentren? |
| **Value** (V) | ¿Qué información aporto si me eligen? |

El puntaje es *Q·K*, y la mezcla final se hace sobre *V*. Separar los tres permite que
un token busque una cosa y ofrezca otra. Y hay varias **cabezas** en paralelo, cada
una con sus propias matrices, para capturar relaciones distintas a la vez (sintaxis en
una, correferencia en otra).

## Qué tiene de juguete el visualizador

Para que puedas predecir el resultado y comprobarlo, el explorador simplifica dos cosas:

- **La similitud es ortográfica.** Dos tokens se parecen si comparten trigramas de
  letras (`gato` ~ `gatos`). Un modelo real aprende similitud semántica: `gato` ~ `felino`.
- **No hay proyecciones ni cabezas.** Q = K = V = el propio vector. Una cabeza.

Todo lo demás (softmax, temperatura, posición, máscara causal) es literalmente lo que
hace un Transformer. Si te queda claro aquí, te queda claro allí.

## Para llevarte

La atención es un **presupuesto de 100 % que cada token reparte entre los demás**,
calculado comparando vectores. La temperatura decide si ese reparto es tacaño o
generoso. La máscara causal decide si puede mirar al futuro. Todo lo demás son detalles
de ingeniería sobre esa idea.
