Prompting
No es un conjuro. Es un encargo, y los encargos buenos se parecen mucho entre sí.
El mismo cliente, dos encargos
En la gestoría hicieron una prueba tonta que aclaró el módulo entero. Un cliente escribe preguntando si puede deducirse el portátil que se ha comprado. Álvaro, el más joven del despacho, le pide al modelo: "hazme un correo contestando a esto". Sale un correo educadísimo, larguísimo y que no dice nada: "la deducibilidad depende de diversos factores, le recomendamos consultar con su asesor". Es la respuesta de alguien que no quiere mojarse — que es exactamente lo que le han pedido sin querer.
Marta escribe otra cosa: quién es el despacho y cómo escribe, la ficha del cliente (autónomo en estimación directa, alta en 2021, actividad de diseño gráfico), la instrucción de no afirmar nada que dependa de un dato que no aparezca y de marcarlo con FALTA DATO en su lugar, el formato (máximo 200 palabras, sin saludos de tres líneas, cerrando con la pregunta concreta que necesitan) y dos correos anteriores del propio despacho como muestra. Sale un borrador que se envía con dos retoques.
La pregunta que responde este módulo no es "cuál de los dos es mejor" —eso ya lo sabes— sino cuál de esas cinco piezas hizo el trabajo, cuánto cuesta cada una en tokens y cuáles de las cosas que circulan por ahí como trucos infalibles no hacen absolutamente nada.
📋 Guía docente del módulo
Objetivos
- Descomponer una instrucción eficaz en sus cinco componentes: papel y objetivo, contexto, restricciones, formato de salida y ejemplos.
- Aplicar el aprendizaje con pocos ejemplos (few-shot) y valorar su coste en tokens frente a su beneficio.
- Comprender la cadena de pensamiento, para qué tareas ayuda y qué no demuestra.
- Separar las técnicas con efecto medible de las supersticiones que circulan como buenas prácticas.
- Diseñar instrucciones reutilizables y versionadas, tratándolas como un activo del negocio y no como texto desechable.
Resultados de aprendizaje
- RA1. Reescribir una instrucción vaga en una completa, señalando qué componente aporta cada añadido.
- RA2. Calcular el sobrecoste en tokens de añadir N ejemplos y decidir con números si compensan.
- RA3. Elegir entre una sola llamada compleja y una cadena de llamadas simples, justificando con fiabilidad y coste.
- RA4. Especificar el comportamiento ante datos ausentes o casos límite dentro de la propia instrucción.
- RA5. Criticar una supuesta "técnica avanzada de prompting" argumentando desde el mecanismo del módulo 1.
Bibliografía de referencia
- Brown, T. et al.: "Language Models are Few-Shot Learners", NeurIPS, 2020 — el artículo que establece que unos pocos ejemplos dentro del contexto sustituyen a reentrenar.
- Wei, J. et al.: "Chain-of-Thought Prompting Elicits Reasoning in Large Language Models", NeurIPS, 2022 — el efecto de pedir el razonamiento paso a paso.
- Turpin, M. et al.: "Language Models Don't Always Say What They Think", NeurIPS, 2023 — por qué el razonamiento que escribe no es necesariamente el que hizo.
- Kojima, T. et al.: "Large Language Models are Zero-Shot Reasoners", NeurIPS, 2022 — el hallazgo de que una sola frase puede activar el razonamiento por pasos.
- Schulhoff, S. et al.: "The Prompt Report: A Systematic Survey of Prompting Techniques", 2024 — revisión sistemática que ordena decenas de técnicas y separa las contrastadas de las anecdóticas.
Carga de trabajo estimada
| Actividad | Horas |
|---|---|
| Lectura y estudio del material | 5 |
| Experimentación con el simulador | 2 |
| Ejercicios (resueltos y por cuenta propia) | 5 |
| Evaluación (quiz de módulo y repaso) | 2 |
| Total | 14 |
La prueba del becario del primer día
Si tuvieras que dejarle esa tarea por escrito a alguien competente pero recién llegado, que no conoce tu despacho ni a tus clientes y que no puede preguntarte nada, ¿qué le escribirías? Eso es un prompt. Ni más místico ni más complicado.
Y como el becario no puede preguntar, todo lo que no le digas lo va a rellenar por su cuenta con lo más habitual del mundo. Ahí está el mecanismo del módulo 1 otra vez: si no especificas la longitud, escribirá la longitud media de los correos que ha visto; si no dices el tono, usará el tono medio de un correo comercial; si no dices qué hacer cuando falta un dato, hará lo que hace la mayoría de los textos de su entrenamiento, que es seguir escribiendo como si el dato existiera. El vacío no se queda vacío: se rellena con el promedio.
De ahí sale la regla que ordena todo lo demás: especifica lo que te importa; lo que no especifiques, saldrá promedio. No hace falta especificar todo — hace falta especificar aquello en lo que tu resultado tiene que diferenciarse del promedio.
Las cinco piezas de un encargo completo
| Pieza | Qué responde | En el prompt de Marta |
|---|---|---|
| 1. Papel y objetivo | Quién escribe y para qué | "Eres el redactor de borradores de una gestoría; el objetivo es que un asesor humano pueda enviar esto con retoques mínimos" |
| 2. Contexto y datos | Con qué información se trabaja | Ficha del cliente, correo entrante, últimos tres trámites presentados |
| 3. Restricciones | Qué no se puede hacer nunca | No afirmar plazos ni porcentajes concretos; no prometer resultados; si falta un dato, escribir FALTA DATO y no deducirlo |
| 4. Formato de salida | Cómo tiene que venir | Máximo 200 palabras, sin fórmulas de cortesía largas, terminando con la pregunta pendiente si la hay |
| 5. Ejemplos | Cómo es "bien hecho" aquí | Dos correos reales del despacho, anonimizados, con su pregunta y su respuesta |
La tercera es la que casi nadie pone y la que más ahorra
Las restricciones son la diferencia entre una herramienta y un riesgo. La instrucción operativamente más valiosa del prompt de Marta no es ninguna de las que suenan bien, es esta: si el correo no contiene el dato necesario, escribe FALTA DATO: [qué falta] y no continúes esa frase. Sin ella, el modelo rellena el hueco con lo más plausible —el régimen fiscal más común, el tipo de IVA más frecuente— y el error entra en el borrador con la misma redacción impecable que el resto. Con ella, el error se convierte en una marca visible que el revisor localiza en dos segundos.
Esto tiene un nombre general que merece la pena recordar: convertir un fallo silencioso en un fallo ruidoso. No hace al modelo más listo; hace que sus límites sean visibles, que es lo único que permite construir un proceso encima. Volveremos a esta idea en los módulos 3, 6 y 7.
La quinta gana a los adjetivos
"Escribe en un tono profesional y cercano" es una instrucción que suena a algo y no significa nada operativo: el modelo tiene millones de textos etiquetables como profesionales y cercanos, y va a elegir el promedio. Dos correos tuyos definen tu tono infinitamente mejor que diez adjetivos, porque son una muestra de la distribución exacta que quieres, no una descripción de ella. Es el hallazgo del artículo de Brown y otros (2020): con unos pocos ejemplos dentro del contexto, el modelo se ajusta a una tarea sin reentrenar nada.
Cuidado con el envenenamiento de los ejemplos: si los dos que pones tienen la misma estructura, el modelo copiará esa estructura aunque no encaje. Si los dos son de clientes en módulos, aplicará el criterio de módulos a un cliente en estimación directa. Los ejemplos enseñan mucho más de lo que crees, incluidas cosas que no querías enseñar. Elígelos representativos, no cómodos.
Cadena de pensamiento: qué es, cuándo ayuda y qué no demuestra
Wei y otros (2022) mostraron algo llamativo: en tareas que necesitan varios pasos —aritmética, deducción, problemas con condiciones— pedirle al modelo que escriba el razonamiento antes de la respuesta mejora la tasa de acierto de forma sustancial. Kojima y otros añadieron que a veces basta con una frase ("razonemos paso a paso") para desencadenarlo.
La explicación encaja perfectamente con el módulo 1. El modelo produce un token cada vez, y cada token dispone de una cantidad fija de cálculo. Si le exiges la respuesta final de golpe, tiene que hacer todo el trabajo en ese hueco. Si le dejas escribir los pasos intermedios, los pasos intermedios se convierten en contexto sobre el que apoyar el siguiente, y el problema se reparte en varios huecos. Escribir es pensar, también aquí, y por una razón bastante literal.
Los tres matices honestos
- No ayuda en todo. En tareas de un solo paso —clasificar una factura, extraer un NIF— pedir razonamiento añade tokens, latencia y coste sin mejorar nada, y ocasionalmente empeora: el modelo se convence a sí mismo por el camino.
- Los modelos que ya razonan por dentro lo necesitan menos. Buena parte de los modelos recientes hacen ese trabajo por su cuenta antes de responder. Pedírselo otra vez es, en el mejor caso, redundante.
- Y el gordo: el razonamiento que escribe no es necesariamente el que hizo. Turpin y otros (2023) lo demostraron con un experimento elegante — sesgaron la respuesta del modelo con una pista y este siguió la pista, mientras escribía una justificación coherente que no mencionaba la pista en ningún momento. Es una explicación plausible, no una traza de auditoría.
Consecuencia directa para un despacho: no puedes usar el razonamiento escrito por el modelo como justificación ante un cliente ni ante una inspección. Sirve para que el modelo acierte más y para que un humano detecte antes por dónde se ha ido; no sirve como prueba de nada.
Lo que mueve la aguja y lo que es superstición
Circula mucha técnica con pinta de secreto profesional. Esta es la separación honesta, sabiendo que el terreno se mueve y que lo único que zanja una duda es el módulo 7: medirlo con tu propio conjunto de casos.
| Práctica | Veredicto | Por qué |
|---|---|---|
| Dar ejemplos del resultado que quieres | Sí, mucho | Define la tarea con una muestra en vez de con una descripción. Es el efecto más robusto de todos. |
| Decir qué hacer cuando falta un dato | Sí, mucho | Elimina la categoría de error más cara: la que no se ve. |
| Fijar el formato de salida (longitud, estructura, campos) | Sí | Reduce la variabilidad y hace el resultado procesable por otro programa. |
| Pedir razonamiento paso a paso | Depende | Sí en tareas de varios pasos; coste sin beneficio en las de uno. |
| Partir una tarea grande en varias llamadas | Sí | Cada llamada tiene un objetivo comprobable. Se verá con números en el módulo 6. |
| "Eres el mejor experto fiscal del mundo" | Marginal | Fijar un papel ayuda algo a situar el registro. El superlativo no aporta: no hay un dial de competencia que subir. |
| Ofrecer una propina o amenazar con consecuencias | No | Efectos anecdóticos, inconsistentes y que desaparecen al medirlos en serio. Ocupa tokens. |
| Escribir en MAYÚSCULAS o repetir "IMPORTANTE" cinco veces | Casi no | Una marca de énfasis puede ayudar; cinco se anulan entre sí. Si todo es importante, nada lo es — también para un modelo. |
| Copiar un prompt de 900 palabras que viste en una red social | No | Está ajustado a la tarea de otro y lo pagas en cada llamada. Los prompts no se heredan: se escriben para el caso. |
Regla para no perder el tiempo: cualquier técnica que no puedas comprobar con veinte casos tuyos y una tabla de resultados es, por ahora, folklore. No es que sea falsa; es que no lo sabes, y eso es lo mismo a efectos de decidir.
El modelo formal: el prompt como activo, y su aritmética
En un despacho de seis personas, el prompt de los correos no es un mensaje: es un procedimiento escrito que se ejecuta 1.400 veces al mes. Eso cambia cómo se trata.
- Vive en un fichero, no en la cabeza de nadie. Con su número de versión y la fecha del cambio.
- Se separa lo fijo de lo variable. Las instrucciones del despacho van en el mensaje de sistema —estable, reutilizable, y en muchos proveedores con descuento por caché si no cambia—; la ficha del cliente y el correo entrante van en el mensaje de usuario.
- Cada cambio se mide antes de entrar en producción. Módulo 7. Un prompt "mejorado" a ojo es un cambio no verificado sobre 1.400 correos.
- Se anota por qué está cada frase. Las instrucciones acumulan parches por incidentes concretos. Sin la nota, nadie se atreve a quitar nada y el prompt engorda para siempre.
Lo que cuestan los ejemplos
Aquí está la aritmética que nadie hace y que decide de verdad. Un ejemplo completo —correo entrante más respuesta modelo— son unas 380 palabras, es decir 532 tokens. Y se paga en cada llamada, porque va dentro del contexto: no es una inversión que se amortiza, es un coste variable.
| Configuración | Tokens de entrada | Coste por correo | Coste de 1.400 correos |
|---|---|---|---|
| Sin ejemplos | 800 | 0,0062 € | 8,61 € |
| 2 ejemplos | 1.864 | 0,0094 € | 13,08 € |
| 4 ejemplos | 2.928 | 0,0125 € | 17,55 € |
| 8 ejemplos | 5.056 | 0,0189 € | 26,49 € |
Mirado así asusta: ocho ejemplos triplican la factura. Mirado con la otra columna encima de la mesa, deja de asustar: la factura pasa de 8,61 € a 26,49 €, o sea 18 € al mes, y estamos hablando de un proceso que a mano cuesta 3.080 €. El ejercicio 2 hace la cuenta completa.
Dónde sí duele: en volumen alto y margen bajo. Si en vez de 1.400 correos fueran 1.400.000 peticiones al mes, esos mismos ocho ejemplos cuestan 17.875 € en vez de 26 €, y entonces sí toca preguntarse si dos ejemplos bien elegidos hacen el mismo trabajo que ocho. La regla no es "los ejemplos son baratos": es los ejemplos se multiplican por tu volumen, así que su precio depende de a qué escala trabajas.
Simulador: qué le cuesta a Marta cada configuración de prompt
Los mandos empiezan en el prompt real de la gestoría: 210 palabras de instrucciones, ningún ejemplo, sin razonamiento explícito, 1.400 correos al mes. Añade ejemplos y mira dos cosas a la vez: cómo sube la barra de coste y cómo la curva de acierto se aplana enseguida. El salto grande está entre 0 y 2; de 6 a 8 casi no se mueve y lo pagas igual.
Modelo juguete, y conviene decir en qué. La columna de coste es aritmética exacta: tokens por precio, sin trampa. La curva de acierto está inventada — es una función de rendimientos decrecientes con la forma que suele tener este fenómeno, pero tu tarea tendrá la suya y puede ser bastante distinta. Sirve para entender la forma del problema (los primeros ejemplos valen mucho, los últimos casi nada); no para prometer que con cuatro ejemplos vas a acertar el 86%. Eso solo lo dice tu conjunto de prueba, y de eso va el módulo 7.
✍️ Ejercicios resueltos
Ejercicio 1 — Rescatar el prompt de Álvaro. El encargo original era: "Hazme un correo profesional contestando a este cliente que pregunta si puede deducirse un portátil. Sé claro." Reescríbelo con las cinco piezas y calcula cuántos tokens de entrada añade cada una, sabiendo que la ficha del cliente son 150 palabras y el correo entrante 210.
Ver solución paso a paso
Paso 1 — Qué falla en el original. Tiene papel a medias ("profesional") y nada más. No hay contexto (el modelo no sabe si el cliente es autónomo, sociedad o particular), no hay restricciones (así que afirmará porcentajes), no hay formato (saldrán 400 palabras de cortesía) y no hay ejemplos (saldrá el tono medio de internet). Cuatro de las cinco piezas ausentes.
Paso 2 — Papel y objetivo (35 palabras ≈ 49 tokens). "Eres el redactor de borradores de Bermejo & Asociados, gestoría en Valencia. Escribes el borrador que un asesor humano revisará y enviará. Tu éxito es que necesite dos retoques como máximo, no que suene impresionante."
Paso 3 — Contexto (360 palabras ≈ 504 tokens). Ficha del cliente (150) más correo entrante (210). Es la pieza más cara y la más imprescindible: sin ella el modelo no puede acertar ni por casualidad, porque la respuesta correcta depende del régimen fiscal.
Paso 4 — Restricciones (85 palabras ≈ 119 tokens). "No afirmes porcentajes, plazos ni importes que no aparezcan explícitamente en el contexto. Si la respuesta depende de un dato que no tienes, escribe FALTA DATO: [dato] en su lugar y no completes la frase. No prometas resultados ante la Agencia Tributaria. No cites artículos concretos de una ley."
Paso 5 — Formato (45 palabras ≈ 63 tokens). "Máximo 200 palabras. Saludo de una línea. Un párrafo con la respuesta, uno con la condición que la matiza. Cierra con la pregunta concreta que necesitas del cliente, si la hay. Firma: el equipo de Bermejo & Asociados."
Paso 6 — Ejemplos (2 × 380 palabras ≈ 1.064 tokens). Dos correos reales del despacho, anonimizados, uno de un autónomo y otro de una sociedad, para no enseñarle un solo patrón.
Paso 7 — Suma. 49 + 504 + 119 + 63 + 1.064 = 1.799 tokens de entrada, frente a los 40 tokens escasos del encargo de Álvaro. Coste: 1.799 / 1.000.000 × 3 = 0,0054 € más 0,00375 € de salida = 0,0091 € por correo. Un céntimo escaso.
La lección de gestión: mira el reparto. El 59% de los tokens se lo llevan los dos ejemplos y el 28% el contexto del cliente. Las tres piezas que un principiante consideraría "el prompt" —papel, restricciones y formato— son el 13% del coste y hacen la mayor parte del trabajo de encauzar. Si algún día tienes que recortar, ya sabes por dónde no.
Ejercicio 2 — ¿Compensan los cuatro ejemplos? Sin ejemplos, el 78% de los borradores se envían con un retoque de 1,5 minutos y el 22% hay que rehacerlos, lo que lleva 6,5 minutos. Con cuatro ejemplos, la proporción pasa a 86% / 14%. La entrada sube de 800 a 2.928 tokens. Con 1.400 correos al mes y la hora a 22 €, ¿compensa?
Ver solución paso a paso
Paso 1 — Tiempo medio por correo, sin ejemplos. 0,78 × 1,5 + 0,22 × 6,5 = 1,17 + 1,43 = 2,60 minutos.
Paso 2 — Tiempo medio con cuatro ejemplos. 0,86 × 1,5 + 0,14 × 6,5 = 1,29 + 0,91 = 2,20 minutos.
Paso 3 — Horas del mes. Sin ejemplos: 1.400 × 2,60 = 3.640 minutos = 60,7 h. Con ejemplos: 1.400 × 2,20 = 3.080 minutos = 51,3 h. Diferencia: 9,4 horas al mes.
Paso 4 — Ese tiempo en dinero. 9,4 × 22 = 206,80 € al mes de trabajo liberado.
Paso 5 — Lo que cuestan los ejemplos. La entrada sube 2.128 tokens por correo. 2.128 / 1.000.000 × 3 = 0,0064 € por correo, × 1.400 = 8,94 € al mes.
Paso 6 — El veredicto. 206,80 € de beneficio contra 8,94 € de coste: 23 € de retorno por cada euro gastado. No es una decisión, es una obviedad.
La lección de gestión: y ahora dale la vuelta, que es donde está lo que hay que aprender. Ese 23 a 1 no sale de que los ejemplos sean mágicos: sale de que en este negocio el minuto humano es carísimo comparado con el token. La hora está a 22 € y el correo a medio céntimo. En un servicio de consumo masivo, con el mismo prompt y sin ningún humano revisando, los 8,94 € se convierten en miles y el ahorro de tiempo no existe porque nadie estaba revisando: la misma decisión se voltea entera. Antes de copiar una buena práctica, comprueba si tu ratio entre coste de token y coste de minuto humano se parece al de quien te la recomienda.
Quiz — Prompting
12 preguntas — se supera con 70% o más.