Cómo funciona un modelo de lenguaje
Predice el siguiente trozo de texto. Todo lo demás —lo bueno y lo desastroso— sale de ahí.
Todo el máster, desde la gestoría de Marta
Marta Bermejo lleva una gestoría de seis personas en Valencia: Bermejo & Asociados, 180 clientes entre autónomos y pymes pequeñas. Contabilidad, nóminas, impuestos trimestrales y, sobre todo, correo. Mucho correo.
En enero probó a preguntarle a un modelo de lenguaje cuándo vencía el modelo 303 del cuarto trimestre. Le contestó una fecha, con una seguridad absoluta y un par de matices que sonaban muy profesionales. Estaba mal. La reacción de su socio fue la habitual: esto no sabe fiscalidad, no sirve. La conclusión correcta era otra, y es la que abre este máster: no le había preguntado a una base de datos. Le había pedido a un sistema entrenado para producir texto plausible que produjera texto plausible, y lo había hecho impecablemente.
Vamos a acompañar a Marta los once módulos con sus números encima de la mesa: la gestoría recibe 1.400 correos de clientes al mes, cada respuesta lleva 6 minutos de media, la hora de trabajo cargada cuesta 22 € y hay además 320 facturas de proveedor al mes que alguien clasifica a mano a 2,5 minutos cada una. Cuando lleguemos al módulo 4 sabremos que un borrador de respuesta cuesta 0,6 céntimos en tokens; en el 3, cuántos de esos borradores hay que tirar; y en el 7, cómo se comprueba esa cifra en vez de creérsela.
📋 Guía docente del módulo
Objetivos
- Describir qué calcula realmente un modelo de lenguaje: una distribución de probabilidad sobre el siguiente token.
- Distinguir las tres fases de construcción —preentrenamiento, ajuste por instrucciones y aprendizaje con retroalimentación humana— y qué comportamiento explica cada una.
- Manejar los conceptos de token, ventana de contexto, temperatura y muestreo, y calcular con ellos.
- Explicar por qué un modelo no tiene memoria entre llamadas y qué consecuencias operativas tiene eso.
- Anticipar, a partir del mecanismo, en qué clase de tareas va a fallar antes de haberlo probado.
Resultados de aprendizaje
- RA1. Estimar el número de tokens de un texto en español a partir de su número de palabras, con un error tolerable.
- RA2. Calcular las probabilidades de una distribución softmax con temperatura a partir de un vector de puntuaciones.
- RA3. Justificar, para una tarea dada, si conviene temperatura baja o alta, y defender la elección.
- RA4. Explicar por qué el coste y la latencia crecen con la longitud del contexto, y relacionarlo con el mecanismo de atención.
- RA5. Clasificar afirmaciones sobre modelos de lenguaje en correctas, exageradas o falsas, argumentando desde el mecanismo.
Bibliografía de referencia
- Vaswani, A. et al.: "Attention Is All You Need", NeurIPS, 2017 — el artículo que introduce la arquitectura transformer sobre la que se construye casi todo lo demás.
- Ouyang, L. et al.: "Training language models to follow instructions with human feedback", NeurIPS, 2022 — cómo un modelo que solo continúa texto se convierte en uno que obedece instrucciones.
- Kaplan, J. et al.: "Scaling Laws for Neural Language Models", 2020, y Hoffmann, J. et al.: "Training Compute-Optimal Large Language Models", 2022 — por qué el tamaño importa y por qué no solo el tamaño.
- Bender, E. M., Gebru, T. et al.: "On the Dangers of Stochastic Parrots", FAccT, 2021 — la crítica que hay que haber leído antes de decir que estos sistemas "entienden".
- Jurafsky, D. y Martin, J. H.: Speech and Language Processing, 3.ª edición (borrador abierto) — el manual universitario de referencia, gratuito y actualizado.
Carga de trabajo estimada
| Actividad | Horas |
|---|---|
| Lectura y estudio del material | 6 |
| Experimentación con el simulador | 2 |
| Ejercicios (resueltos y por cuenta propia) | 4 |
| Evaluación (quiz de módulo y repaso) | 2 |
| Total | 14 |
El autocompletado del móvil, pero en grande
Cuando escribes "voy a por el" en el móvil y te sugiere "coche", "pan" y "niño", el teclado está haciendo exactamente lo mismo que un modelo de lenguaje, solo que con una memoria de tres palabras y un vocabulario de barrio. Un modelo grande hace eso con decenas de miles de palabras de contexto y habiendo digerido una cantidad de texto que ningún ser humano podría leer en varias vidas.
La operación es siempre la misma y conviene aprendérsela porque explica el resto del máster: dado todo el texto que hay hasta ahora, ¿qué trozo viene después? El modelo no responde con un trozo, responde con una lista de candidatos y su probabilidad. Después, alguien —el programa que lo envuelve— elige uno de esa lista, lo pega al final y vuelve a preguntar. Palabra a palabra, o mejor dicho token a token, hasta que sale una frase, un párrafo o un contrato entero.
De ahí sale la primera consecuencia práctica, y no es pequeña: el modelo no consulta nada. Cuando le preguntas por el plazo del modelo 303 no abre la web de la Agencia Tributaria; produce la continuación más plausible de una pregunta sobre plazos fiscales, y las fechas plausibles son muchas. Si en su entrenamiento esa fecha aparecía mil veces escrita igual, la acertará casi siempre. Si aparecía poco, o cambió, o depende del año, se la inventará con el mismo tono.
El matiz honesto: decir "solo predice la siguiente palabra" es cierto y a la vez insuficiente. Para predecir bien la siguiente palabra de un texto que dice "el resultado de la operación es" hace falta saber sumar, y estos sistemas suman. La discusión sobre si eso es "entender" lleva años abierta y este curso no la va a cerrar. Lo que sí puedes usar hoy: el mecanismo predice bien dónde falla, y eso es lo operativamente útil.
Tokens: no son palabras, y en español salen más caros
El modelo no ve letras ni palabras: ve tokens, trozos de texto de tamaño variable que salen de un diccionario fijo construido antes del entrenamiento. Las palabras frecuentes suelen ser un token entero; las raras se parten. "Casa" es un token; "trimestralmente" pueden ser tres o cuatro; un NIF con letra puede irse a seis o siete.
Regla práctica para trabajar en castellano, que es la que usaremos todo el máster:
| Referencia | Equivalencia aproximada |
|---|---|
| 1 token | unos 3,5 caracteres de español |
| 1 palabra española | ≈ 1,4 tokens |
| 1 folio (500 palabras) | ≈ 700 tokens |
| Un correo de cliente típico (200 palabras) | ≈ 280 tokens |
Ese 1,4 no es un detalle de erudito: el mismo texto en inglés gasta bastante menos. Los diccionarios de tokens se construyeron con corpus dominados por el inglés, así que el inglés está mejor comprimido. Traducido a factura, un despacho español paga entre un 15% y un 30% más por decir lo mismo que uno británico, y esa diferencia reaparece en el módulo 4 multiplicada por 1.400 correos.
La ventana de contexto
Todo lo que el modelo puede mirar en una llamada —tus instrucciones, el correo del cliente, los documentos que le pegues y lo que lleva escrito de respuesta— cabe en un espacio finito: la ventana de contexto. Se mide en tokens y hoy va de unas decenas de miles a algunos millones según el modelo.
Lo que casi nadie asume la primera vez: fuera de esa ventana no hay nada. El modelo no recuerda la conversación de ayer, ni la de hace diez mensajes, salvo que el programa se la vuelva a mandar entera en cada turno. Eso es exactamente lo que hace un chat: reenviar el historial. Por eso una conversación larga responde cada vez más despacio y cuesta cada vez más — estás pagando por releer todo lo anterior en cada mensaje.
Y un matiz que se ignora demasiado: que quepa no significa que se use bien. Hay evidencia consistente de que la información situada en mitad de un contexto muy largo se aprovecha peor que la del principio o el final. Meterle 300 páginas y confiar en que encuentre el párrafo 148 es una apuesta, no un diseño. En el módulo 5 veremos la alternativa seria.
De dónde sale su carácter: tres fases, tres consecuencias
Un modelo no nace obediente. Llega a serlo en tres etapas, y cada una explica una parte de su comportamiento.
| Fase | Qué se hace | Qué explica de lo que ves |
|---|---|---|
| Preentrenamiento | Predecir el siguiente token sobre una cantidad enorme de texto | El conocimiento general, el estilo, los sesgos del corpus y la fecha de corte: no sabe nada posterior |
| Ajuste por instrucciones | Se le enseña con ejemplos a responder a peticiones en vez de continuar el texto | Que conteste a una pregunta en vez de escribir otras cinco preguntas parecidas |
| Refuerzo con retroalimentación humana | Personas puntúan respuestas y el modelo se optimiza para sacar buena nota | El tono servicial, las negativas ante ciertas peticiones y, sin querer, la adulación |
La tercera fase es la que más malentendidos genera, así que conviene decirlo sin rodeos: el modelo no está optimizado para decir la verdad, está optimizado para producir respuestas que a un evaluador humano le parezcan buenas. Casi siempre coinciden. Cuando no coinciden —una respuesta segura y elegante que está mal contra un "no lo sé" que está bien— el sistema aprendió que la primera puntúa mejor. Ese desajuste tiene nombre técnico y tiene consecuencias de negocio; el módulo 3 entero va de eso.
La misma mecánica explica la adulación: si le dices "creo que el plazo era el 30, ¿verdad?", tiene una tendencia medible a darte la razón, porque estar de acuerdo puntuó bien durante el entrenamiento. Práctica que se deriva de esto y que Marta adoptó en su despacho: no metas tu hipótesis en la pregunta. Pregunta "¿cuál es el plazo?", no "¿el plazo es el 30?".
La fecha de corte es la trampa más silenciosa. Un modelo cuyo entrenamiento termina en una fecha X hablará del tipo de IVA, del salario mínimo o de un plazo con la información de X, y lo hará sin avisarte de que puede haber cambiado. En un despacho que trabaja con normativa, eso no es un detalle: es la razón por la que el módulo 5 existe.
El modelo formal: softmax, temperatura y muestreo
Vamos a la aritmética, porque es sencilla y porque el simulador de abajo es exactamente esta fórmula.
Para cada posible token siguiente, la red produce una puntuación sin normalizar —un logit—. Llamemos z₁, z₂, …, z_n a esas puntuaciones. Para convertirlas en probabilidades que sumen 1 se aplica la función softmax, con un parámetro T que llamamos temperatura:
pi = ezi/T ÷ Σj ezj/T
Lee lo que hace T, que es todo lo que hay que entender:
- T = 1 deja la distribución tal cual la produjo el modelo.
- T < 1 divide por un número pequeño, agranda las diferencias entre logits y afila la distribución: el candidato que iba primero se lleva casi toda la probabilidad. En el límite T → 0 se elige siempre el más probable.
- T > 1 aplana la distribución: los candidatos raros pasan de improbables a posibles. Más variedad, más riesgo de disparate.
Los otros dos mandos: top-k y top-p
La temperatura reparte probabilidad; top-k y top-p deciden a quién se le permite entrar en el sorteo. Top-k se queda con los k candidatos más probables y descarta el resto. Top-p (o muestreo por núcleo) se queda con los candidatos que hacen falta para acumular una probabilidad p —típicamente 0,9— y descarta la cola. La diferencia es que top-p se adapta: cuando el modelo está muy seguro, la cola se corta enseguida; cuando duda, deja pasar más opciones.
Cómo se elige T en un trabajo real
| Tarea de la gestoría | Temperatura | Por qué |
|---|---|---|
| Clasificar 320 facturas en categorías contables | 0 | Quieres la misma entrada → la misma salida, siempre. La creatividad aquí solo puede estropear. |
| Extraer el NIF y el importe de un PDF | 0 | Hay una respuesta correcta y una sola. |
| Redactar el borrador de una respuesta al cliente | 0,5 – 0,8 | Interesa que no salgan 1.400 correos calcados; hay muchas formas correctas de decir lo mismo. |
| Escribir tres titulares distintos para el boletín | 0,9 – 1,1 | Quieres variedad de verdad: la mitad se van a descartar. |
Aviso de precisión, porque circula mucho lo contrario: temperatura 0 no garantiza reproducibilidad exacta. Elimina el sorteo, pero la aritmética en coma flotante sobre hardware paralelo puede dar resultados ligerísimamente distintos entre ejecuciones, y basta un empate para que cambie el token elegido y a partir de ahí la frase entera. Si necesitas reproducibilidad de verdad, guarda la salida — no confíes en poder regenerarla igual.
La atención, en una idea (y por qué el contexto largo se paga)
La arquitectura que hay debajo de prácticamente todos estos modelos se llama transformer y viene del artículo de Vaswani y otros de 2017. Su aportación central se llama atención, y la intuición cabe en un párrafo.
Al procesar la frase "Marta le mandó a su cliente el modelo 303 porque lo tenía pendiente", el sistema tiene que decidir a qué se refiere ese "lo". La atención es el mecanismo que permite que cada token mire a todos los demás del contexto y decida de cuáles depende, ponderándolos. No hay reglas gramaticales escritas a mano: esos pesos se aprenden durante el entrenamiento.
Y aquí está la consecuencia económica, que es la que te vas a llevar: si cada token mira a todos los demás, el trabajo crece con el cuadrado del número de tokens. Duplicar el contexto no duplica el coste de procesarlo: lo multiplica por cuatro en esa parte del cálculo. Hay muchísima ingeniería dedicada a rebajar esa factura y funciona bastante bien, pero la dirección no cambia: el contexto largo es caro y lento, y meter documentos "por si acaso" se paga en cada llamada.
Del tamaño de los modelos conviene saber solo esto: Kaplan y otros (2020) mostraron que el rendimiento mejora de forma muy regular al aumentar datos, parámetros y cómputo; Hoffmann y otros (2022) corrigieron la receta demostrando que casi todo el mundo estaba entrenando modelos demasiado grandes con demasiados pocos datos. Resultado práctico para ti: un modelo pequeño y bien entrenado puede ganarle a uno enorme y mal alimentado, así que el número de parámetros por sí solo no es un argumento de compra.
Simulador: la distribución del siguiente token
El modelo ha leído "Estimado cliente, le confirmo que el plazo de presentación..." y tiene ocho continuaciones candidatas con sus puntuaciones. Mueve la temperatura y mira cómo se reparte la probabilidad. Ponla en 0,2 y verás que una sola opción se lo lleva casi todo; ponla en 1,8 y verás por qué a temperatura alta salen frases raras. El top-p corta la cola: con 0,9, las opciones que quedan fuera del núcleo aparecen en gris y no pueden salir sorteadas.
La entropía mide la indecisión del modelo en ese punto: 0 bits es certeza absoluta y 3 bits, con ocho candidatos, es no tener ni idea. Es el número que hay detrás de la intuición de "aquí el modelo está adivinando". Fíjate en algo importante: la temperatura no cambia lo que el modelo sabe, solo cómo se sortea entre lo que ya había. Si la respuesta correcta no estaba entre los candidatos, no hay temperatura que la haga aparecer.
✍️ Ejercicios resueltos
Ejercicio 1 — Los tokens de un correo de Bermejo & Asociados. Una respuesta típica se construye con tres piezas: las instrucciones fijas del despacho (210 palabras: tono, firma, qué no se puede prometer nunca), la ficha del cliente (150 palabras: régimen fiscal, forma jurídica, últimos trámites) y el correo entrante (210 palabras). El borrador que devuelve son unas 180 palabras. Calcula los tokens de entrada y de salida, y el coste de un correo a 3 € por millón de entrada y 15 € por millón de salida.
Ver solución paso a paso
Paso 1 — Palabras de entrada. 210 + 150 + 210 = 570 palabras.
Paso 2 — De palabras a tokens. Con el factor 1,4 del castellano: 570 × 1,4 = 798 tokens, que redondeamos a 800 de entrada. La salida: 180 × 1,4 = 252 ≈ 250 tokens.
Paso 3 — Coste de la entrada. 800 tokens son 800 / 1.000.000 = 0,0008 millones. A 3 € el millón: 0,0008 × 3 = 0,0024 €.
Paso 4 — Coste de la salida. 250 / 1.000.000 = 0,00025 millones. A 15 € el millón: 0,00025 × 15 = 0,00375 €.
Paso 5 — Total. 0,0024 + 0,00375 = 0,00615 €, o sea 0,6 céntimos por correo. Los 1.400 del mes: 1.400 × 0,00615 = 8,61 €.
La lección de gestión: fíjate en el reparto. La salida es un tercio de los tokens y más del 60% del coste, porque el token de salida se paga cinco veces más caro. Cuando alguien quiera abaratar esto, el instinto será recortar las instrucciones; el dinero está en no pedir respuestas más largas de lo necesario. Y guarda ese 8,61 €: en el módulo 4 lo pondremos al lado de los 3.080 € que cuesta contestar esos mismos correos a mano, y en el 7 veremos por qué la cifra sola no autoriza a despedir a nadie.
Ejercicio 2 — La misma pregunta, tres temperaturas. Ante un punto concreto del texto, el modelo produce cuatro candidatos con puntuaciones z = (3,0 · 2,0 · 1,0 · 0,0). Calcula la probabilidad de cada uno con T = 1, con T = 0,5 y con T = 2, y decide qué temperatura usarías para clasificar facturas y cuál para redactar el boletín. Toma e = 2,718.
Ver solución paso a paso
Paso 1 — Con T = 1. Los exponentes son los propios logits: e³ = 20,09; e² = 7,39; e¹ = 2,72; e⁰ = 1,00. Suma = 31,20. Probabilidades: 20,09/31,20 = 64,4%; 7,39/31,20 = 23,7%; 2,72/31,20 = 8,7%; 1,00/31,20 = 3,2%.
Paso 2 — Con T = 0,5. Cada logit se divide por 0,5, o sea se duplica: (6 · 4 · 2 · 0). e⁶ = 403,4; e⁴ = 54,6; e² = 7,39; e⁰ = 1,00. Suma = 466,4. Probabilidades: 86,5%; 11,7%; 1,6%; 0,2%.
Paso 3 — Con T = 2. Cada logit se divide por 2: (1,5 · 1,0 · 0,5 · 0). e¹·⁵ = 4,48; e¹ = 2,72; e⁰·⁵ = 1,65; e⁰ = 1,00. Suma = 9,85. Probabilidades: 45,5%; 27,6%; 16,7%; 10,2%.
Paso 4 — Lectura de la tabla. El favorito pasa del 86,5% al 64,4% y al 45,5%. Y mira el cuarto candidato, el peor de todos: con T = 0,5 sale 1 de cada 500 veces; con T = 2, 1 de cada 10. Multiplicado por los cientos de tokens de un correo, eso es la diferencia entre un texto correcto y uno con una frase inesperada por párrafo.
Paso 5 — La decisión. Clasificar 320 facturas: T = 0. No hay ninguna ventaja en que la misma factura caiga hoy en "suministros" y mañana en "servicios exteriores", y sí un problema de auditoría. Titulares del boletín: T ≈ 1. Si pides tres y los tres son idénticos, no has pedido tres.
La lección de gestión: la temperatura es un mando de variabilidad, no de calidad. Subirla no hace al modelo más creativo en el sentido de más listo: le hace elegir más a menudo opciones que él mismo consideraba peores. Es útil exactamente cuando vas a descartar la mayor parte de lo que produzca y solo quieres que la muestra sea variada.
Quiz — Cómo funciona un modelo de lenguaje
12 preguntas — se supera con 70% o más.