El laboratorio

Aprender haciendo

Cuatro experimentos breves y lecturas para entender qué conclusiones permiten realmente los resultados.

El modelo en movimiento

¿Cómo predice un LLM el siguiente token?

Sigue una frase: tokens, vectores, atención, capas del Transformer y elección del siguiente token.

48 segundos · sin audio · 1080p

Ilustración educativa: división simplificada en palabras, vectores y pesos ficticios. Las probabilidades se calculan sobre cuatro candidatos, no sobre todo el vocabulario de un modelo. El vídeo elige el máximo; un modelo también puede muestrear.

Leer la descripción del vídeo

Del texto a los números

La frase «La capital de Francia es» se divide en cinco palabras, tratadas aquí como tokens. Cada token se convierte en un vector; se ilustran doce dimensiones en un espacio esquemático.

De las relaciones al contexto

Las conexiones entre posiciones se convierten en una matriz de pesos de atención. Cada fila consulta las posiciones anteriores y su propia posición. Las posiciones futuras se ocultan.

A través de las capas

La representación atraviesa las capas del Transformer. La atención, el MLP y el flujo residual contribuyen a su transformación. El recorrido por las capas es esquemático.

Del valor al siguiente token

La última posición produce logits para cuatro candidatos: París 8,7; Lyon 3,1; Marsella 1,8; Londres 0,9. Softmax, con temperatura 1, los convierte en probabilidades que suman el 100 %. París recibe aproximadamente el 99,49 % en este ejemplo reducido. El token más probable se añade a la frase. El proceso puede repetirse.

Descargar el MP4

Construir un asistente en el que se pueda confiar

Imagina un asistente que ayuda a un equipo a atender solicitudes de clientes. Debe entender el problema, extraer información útil y consultar las reglas adecuadas. En cada etapa, una respuesta plausible puede ocultar un error. Este recorrido enseña a reconocer esos errores y a construir los controles que faltan.

  1. Comprender la solicitud

    Distinguir el éxito en un conjunto de datos de la capacidad de reconocer el problema relevante.

  2. Extraer la información correcta

    Comprender por qué un formato utilizable y una información correcta son exigencias distintas.

  3. Encontrar la regla aplicable

    Distinguir un documento aparentemente pertinente de una prueba suficiente para un caso concreto.

  4. Comprender la variación de respuestas

    Distinguir la probabilidad de elegir un token de la probabilidad de que una respuesta sea verdadera.

  5. Evaluar el servicio prestado

    Interpretar la precisión desde las alertas recibidas y la exhaustividad desde los incidentes reales.