Cómo funcionan los modelos de lenguaje grandes: entrenamiento e inferencia

Cómo funcionan los modelos de lenguaje grandes en un lienzo interactivo: preentrenamiento, ajuste fino (fine-tuning) y el bucle token a token que produce cada respuesta.

Un modelo de lenguaje grande es un predictor de la siguiente palabra a escala: aprende patrones estadísticos de cantidades enormes de texto y luego genera las respuestas token a token, prediciendo lo que viene después.

Cómo funcionan los modelos de lenguaje grandes: entrenamiento e inferencia

El lienzo interactivo de FlowJam de esta explicación: cada carril, cada fila y cada flecha de arriba forma parte de un diagrama real de QueryChart que puedes abrir y editar.

Cómo leer este diagrama

  • Lee primero la columna «Entrenamiento» —explica de dónde salió la habilidad del modelo— y después la columna «Inferencia», para ver cómo se usa esa habilidad.
  • El bucle de realimentación es el movimiento clave: la rama «Sí» de «¿Seguir generando?» apunta de vuelta a las capas de atención, y la rama «Parar» baja hasta el texto decodificado.
  • Las tres filas de la inferencia son el pipeline: la entrada se vuelve tokens, los tokens se vuelven predicciones y las predicciones se vuelven salida.

Entrenamiento: de dónde sale el modelo

«Preentrenamiento con cantidades enormes de texto» es el cimiento: el modelo se expone a un corpus inmenso y se entrena con una sola tarea, predecir una palabra que falta. De ese único objetivo aprende gramática, hechos y patrones de razonamiento. «El modelo aprende patrones estadísticos entre palabras» hace explícita la naturaleza de ese aprendizaje, y «El ajuste fino adapta el modelo a una tarea concreta» es la corrección de rumbo: un conjunto de datos más pequeño y curado que cambia el comportamiento hacia un estilo o un dominio deseados.

Inferencia: convertir la entrada en salida

«El prompt se divide en tokens» y «Los tokens se convierten en embeddings numéricos» son la mitad de entrada: el texto se parte en unidades pequeñas y se convierte en los vectores numéricos —los embeddings— con los que el modelo puede calcular. «Las capas de atención ponderan qué palabras importan juntas» es el mecanismo que le da su fuerza al contexto: la palabra «banco» se lee de forma distinta junto a «río» que junto a «dinero», porque la atención deja que cada token tenga en cuenta a todos los demás.

El bucle de generación

«El modelo predice el siguiente token más probable» es el acto atómico de la generación. «¿Seguir generando?» hace explícito el bucle: cada predicción se realimenta como nueva entrada, y por eso las respuestas se construyen token a token en vez de componerse enteras. «Los tokens se decodifican de vuelta a texto legible» y «La respuesta se devuelve al usuario» completan el pipeline: lo que ve el usuario es la cola decodificada de ese bucle.

Relaciones clave y conclusiones

  • Un LLM es un predictor del siguiente token, no un sistema de recuperación de respuestas: toda respuesta es una cadena de predicciones de un solo token.
  • El preentrenamiento aporta la capacidad; el ajuste fino y el prompt la dirigen hacia una tarea.
  • Las unidades en las que piensa el modelo son tokens, no caracteres ni palabras enteras.
  • La atención deja que el contexto remodele el significado, y eso es lo que hace que las mismas palabras signifiquen cosas distintas en frases distintas.
  • La generación es recursiva: cada token de salida se convierte en nueva entrada, y por eso las respuestas pueden ser largas, coherentes y erróneas con la misma seguridad.

Cuándo usar este diagrama

  • Explicar a un público no técnico qué hace realmente un LLM y por qué puede equivocarse con total seguridad.
  • Enseñar a un equipo de producto la diferencia entre entrenamiento, ajuste fino y prompt para que pueda razonar sobre el comportamiento del modelo.
  • Aterrizar una discusión sobre límites de tokens, coste y latencia en la mecánica del token a token.

Cómo funciona

  1. Anota la etapa de entrenamiento de la que dependes

    En la caja del preentrenamiento, apunta la familia de modelos que usas y si sus pesos son abiertos o cerrados; en la del ajuste fino, apunta si de verdad haces ajuste fino o si en su lugar escribes prompts.

  2. Añade el prompt de sistema

    Inserta un paso antes de tokenizar el prompt en el que se inyectan las instrucciones de sistema, porque para la mayoría de los usuarios ahí es donde se moldea de verdad el comportamiento.

  3. Muestra la capa de seguridad y salvaguardas

    Añade el paso de moderación entre el bucle de predicción y la salida, terminando en un bloqueo o una reescritura explícitos, para reflejar cómo controlan la generación los sistemas en producción.

  4. Sigue la pista de los tokens

    Anota el paso del tokenizador con el presupuesto de tokens real de tu modelo, y el paso de decodificación con el streaming que muestra la salida a medida que se genera.

Preguntas frecuentes

¿Qué es un modelo de lenguaje grande?

Un modelo de lenguaje grande (LLM) es una red neuronal entrenada para predecir la siguiente palabra de una secuencia, a una escala enorme. De ese único objetivo aprende gramática, hechos, razonamiento y estilo lo bastante bien como para generar texto fluido. El nombre describe el mecanismo: es grande (miles de millones de parámetros), está entrenado sobre lenguaje y es, en el fondo, un predictor del siguiente token.

¿Por qué un LLM genera el texto token a token?

Porque su única operación es predecir el siguiente token más probable dado todo lo anterior. Después de cada predicción, ese token se añade a la entrada y el proceso se repite: es el bucle «¿Seguir generando?» del diagrama. Ese diseño recursivo es lo que permite al modelo producir texto arbitrariamente largo, y también la razón de que la salida se pueda desviar o repetir: cada paso solo ve los tokens que ya ha generado.

¿Qué diferencia hay entre el preentrenamiento y el ajuste fino?

El preentrenamiento es la fase inicial masiva: el modelo aprende patrones generales del lenguaje a partir de terabytes de texto, y de ahí sale su capacidad bruta. El ajuste fino es una fase posterior más pequeña, sobre datos curados para una tarea o un estilo concretos, que cambia cómo se comporta el modelo preentrenado. La mayoría de quienes usan LLM nunca hacen ajuste fino: escriben prompts, que dirigen el mismo modelo en tiempo de inferencia.

¿Por qué a veces los LLM dan respuestas equivocadas con tanta seguridad?

Porque el modelo optimiza el texto probable, no la verdad. No tiene ninguna base de datos interna ni comprobador de corrección; produce la continuación que encaja con sus patrones de entrenamiento. Cuando el patrón es una afirmación que suena plausible, la enuncia con seguridad. Por eso el diagrama describe el modelo como un predictor y no como un recuperador: la advertencia es una propiedad del mecanismo, no un fallo que se vaya a parchear solo con más escala.

Edita este diagrama en QueryChart (FlowJam)

Abre ese mismo lienzo del LLM como tu propio diagrama, renombra las etapas según tu pipeline y anota el modelo que usas.

Edita este diagrama en QueryChart (FlowJam)

Más en Explicaciones visuales