Un modelo de lenguaje grande (LLM, por large language model) es un programa entrenado para predecir el siguiente fragmento de texto, llamado token, a partir de los anteriores. Todo lo que hace (responder, traducir, escribir código) se reduce a repetir esa predicción muchas veces. Tres conceptos explican la mayor parte de su comportamiento práctico: los tokens (la unidad con la que lee y escribe), la ventana de contexto (cuánto texto puede tener en cuenta a la vez) y la temperatura (cuánto azar introduce al elegir cada token).
Este artículo explica los tres sin matemáticas, con lo que necesitas saber como desarrollador para usar estas herramientas con criterio.
Qué es un token
Los modelos no trabajan con letras ni con palabras, sino con tokens: fragmentos de texto de un vocabulario fijo (normalmente entre 30 000 y 200 000 entradas) construido durante el entrenamiento con algoritmos como BPE (byte-pair encoding). Una palabra frecuente en inglés suele ser un token; una palabra menos común, un nombre propio o una palabra en otro idioma se parten en varios. Los espacios, signos de puntuación y saltos de línea también cuentan.
Consecuencias prácticas:
- El coste y los límites se miden en tokens, no en palabras. Como regla aproximada, en inglés un token equivale a unos cuatro caracteres; en español la proporción es algo peor porque el vocabulario suele estar más optimizado para inglés, así que el mismo texto consume más tokens.
- El modelo no “ve” las letras. Por eso tareas como contar las letras de una palabra o invertirla le resultan sorprendentemente difíciles: la palabra le llega como uno o dos tokens opacos.
- Los números y el código se tokenizan de forma irregular, lo que explica parte de los errores aritméticos.
La documentación de Hugging Face sobre tokenizadores describe los algoritmos habituales si quieres profundizar.
Qué es la ventana de contexto
La ventana de contexto es el número máximo de tokens que el modelo puede tener en cuenta en una sola llamada: incluye tus instrucciones, el historial de la conversación, los documentos que adjuntes y la propia respuesta que está generando. Es toda la “memoria de trabajo” del modelo: lo que no está en la ventana no existe para él.
Esto tiene implicaciones directas:
- Un modelo no recuerda conversaciones anteriores por sí mismo. Si una aplicación parece recordar, es porque reenvía el historial (o un resumen) en cada llamada.
- Cuando una conversación larga supera la ventana, la aplicación tiene que recortar o resumir, y el modelo pierde detalles del principio.
- Que un modelo acepte un contexto muy grande no garantiza que use bien toda la información: la calidad suele degradarse con documentos muy largos, especialmente para datos situados en el medio del texto. Conviene poner lo importante al principio o al final y pedir referencias concretas.
El tamaño de la ventana varía mucho entre modelos y versiones, y cambia con frecuencia; consulta siempre la documentación del proveedor para la cifra actual en lugar de fiarte de un número memorizado.
Qué hace la temperatura
En cada paso, el modelo calcula una probabilidad para cada token posible del vocabulario. La temperatura controla cómo se elige entre ellos:
- Temperatura 0 (o cercana): se elige casi siempre el token más probable. Respuestas más deterministas y repetibles. Adecuada para extracción de datos, clasificación, código y cualquier tarea con una respuesta “correcta”.
- Temperatura alta (por ejemplo, 0,8 a 1): se da más opción a tokens menos probables. Más variedad y creatividad, pero también más riesgo de incoherencias. Adecuada para lluvia de ideas o redacción con tono variado.
Dos matices: incluso con temperatura 0 la salida puede variar ligeramente entre ejecuciones por detalles de implementación, y existen otros parámetros de muestreo (como top-p) que limitan el conjunto de tokens candidatos. En la mayoría de casos basta con ajustar la temperatura.
Por qué se equivocan con tanta seguridad
El modelo optimiza que el texto sea plausible, no que sea verdadero. Cuando no tiene información suficiente, genera igualmente la continuación más probable, que puede ser una cita inventada, una función de una librería que no existe o una fecha errónea, redactada con el mismo tono seguro que una respuesta correcta. A esto se le llama habitualmente “alucinación”.
Como desarrollador, las defensas son conocidas:
- Dale la información en el contexto (documentación, datos, el archivo relevante) en lugar de confiar en lo que “sabe”. Esta es la idea detrás de las técnicas de recuperación de información (RAG).
- Pide que cite de dónde saca cada afirmación y comprueba las citas.
- Verifica la salida con medios independientes: ejecuta el código, valida el JSON, contrasta el dato.
- Baja la temperatura para tareas factuales.
Qué hay debajo: la arquitectura, en un párrafo
Casi todos los LLM actuales se basan en el transformer, una arquitectura presentada en 2017 en el artículo Attention Is All You Need. Su mecanismo central, la atención, permite que cada token tenga en cuenta todos los demás tokens del contexto al calcular su representación. El modelo se entrena primero con enormes cantidades de texto para predecir el siguiente token y, después, se ajusta con ejemplos de instrucciones y respuestas (y con retroalimentación humana) para que se comporte como un asistente. El curso de Hugging Face lo explica paso a paso.
Resumen práctico
| Concepto | Qué es | Qué hacer al respecto |
|---|---|---|
| Token | Unidad de texto con la que lee y escribe el modelo | Medir coste y límites en tokens; no esperar precisión a nivel de letra |
| Ventana de contexto | Máximo de tokens por llamada, incluida la respuesta | Incluir solo lo relevante; resumir conversaciones largas; lo importante, al principio o al final |
| Temperatura | Grado de azar al elegir cada token | Baja para tareas factuales y código; más alta para generar variedad |
| Alucinación | Texto plausible pero falso | Aportar contexto, pedir citas y verificar siempre |
Conclusión
Un LLM predice tokens dentro de una ventana de contexto limitada, con un grado de azar que tú controlas con la temperatura. Entender esos tres conceptos explica casi todo lo que verás en la práctica: por qué cuenta mal las letras, por qué “olvida” en conversaciones largas, por qué a veces inventa y cómo reducir cada uno de esos problemas. No es magia ni un buscador: es un generador de texto muy capaz que rinde mejor cuanto mejor contexto le das y cuanto más verificas su salida.