Comment fonctionnent les grands modèles linguistiques : formation et inférence

Comment fonctionnent les grands modèles de langage, affichés sur un canevas interactif : pré-entraînement, réglage fin et boucle jeton par jeton qui produit chaque réponse.

Un grand modèle de langage est un prédicteur du mot suivant à grande échelle : il apprend des modèles statistiques à partir d'énormes quantités de texte, puis génère des réponses un jeton à la fois en prédisant ce qui va suivre.

Comment fonctionnent les grands modèles linguistiques : formation et inférence

Le canevas FlowJam interactif de cette explication : chaque couloir, ligne et flèche ci-dessus appartient à un véritable diagramme QueryChart que vous pouvez ouvrir et modifier.

Comment lire ce visuel

  • Lisez d'abord la colonne « Formation » (elle explique comment le modèle a obtenu sa capacité), puis la colonne « Inférence » pour savoir comment cette capacité est utilisée.
  • La boucle de rétroaction est l'élément clé : la branche "Oui" de "Continuer à générer ?" pointe vers les couches d'attention et la branche "Stop" descend vers le texte décodé.
  • Les trois lignes d'inférence constituent le pipeline : l'entrée devient des jetons, les jetons deviennent des prédictions, les prédictions deviennent une sortie.

Formation : d’où vient le modèle

La « pré-formation sur d'énormes quantités de texte » est la base : le modèle est exposé à un énorme corpus et formé sur une seule tâche : prédire un mot manquant. À partir de ce seul objectif, il apprend la grammaire, les faits et les schémas de raisonnement. "Le modèle apprend des modèles statistiques entre les mots" rend explicite la nature de cet apprentissage, et "Le réglage fin adapte le modèle à une tâche spécifique" est la direction : un ensemble de données plus petit qui modifie le comportement vers un style ou un domaine souhaité.

Inférence : transformer l’entrée en sortie

"L'invite est divisée en jetons" et "Les jetons deviennent des incorporations numériques" sont la moitié d'entrée : le texte est divisé en petites unités et converti en vecteurs avec lesquels le modèle peut calculer. "Les couches d'attention déterminent quels mots comptent ensemble" est le mécanisme qui donne au contexte son pouvoir : le mot "banque" est lu différemment à côté de "rivière" qu'à côté de "argent", car l'attention permet à chaque jeton de considérer tous les autres jetons.

La boucle de génération

"Le modèle prédit le prochain jeton le plus probable" est l'acte atomique de génération. « Continuer à générer ? rend la boucle explicite : chaque prédiction est renvoyée en tant que nouvelle entrée, c'est pourquoi les réponses sont construites un jeton à la fois plutôt que composées dans leur ensemble. "Les jetons sont décodés en texte lisible" et "La réponse est renvoyée à l'utilisateur" complètent le pipeline : la sortie que l'utilisateur voit est la queue décodée de cette boucle.

Relations et enseignements clés

  • Un LLM est un prédicteur du prochain jeton, pas un système de récupération de réponses : chaque réponse est une chaîne de prédictions à un seul jeton.
  • La pré-formation fournit la capacité ; l'affiner et l'inciter à l'orienter vers une tâche.
  • Les jetons, et non les caractères ou les mots entiers, sont les unités dans lesquelles le modèle réfléchit.
  • L'attention permet au contexte de remodeler le sens, ce qui fait que les mêmes mots signifient des choses différentes dans des phrases différentes.
  • La génération est récursive : chaque jeton de sortie devient une nouvelle entrée, c'est pourquoi les réponses peuvent être longues, cohérentes et fausses avec la même confiance.

Quand utiliser ce visuel

  • Expliquer à un public non technique ce que fait réellement un LLM et pourquoi il peut être faux en toute confiance.
  • Enseigner à une équipe produit la différence entre la formation, le réglage fin et l'incitation afin qu'elle puisse raisonner sur le comportement du modèle.
  • Ancrer une discussion sur les limites, le coût et la latence des jetons dans la mécanique jeton par jeton.

Comment cela fonctionne

  1. Annotez l’étape de formation sur laquelle vous comptez

    Sur la boîte de pré-formation, notez la famille de modèles que vous utilisez et s'il s'agit d'un poids ouvert ou fermé ; lors du réglage fin, notez si vous effectuez réellement un réglage fin ou si vous invitez à la place.

  2. Ajouter l'invite système

    Insérez une étape avant que l'invite ne soit symbolisée, là où les instructions système sont injectées, car pour la plupart des utilisateurs, c'est là que le comportement est réellement façonné.

  3. Afficher la couche de sécurité et de garde-corps

    Ajoutez l'étape de modération entre la boucle de prédiction et la sortie, se terminant par un bloc ou une réécriture explicite, pour refléter la manière dont les systèmes de production déclenchent la génération.

  4. Suivez les jetons

    Annotez l'étape de tokenisation avec le budget de jetons réel de votre modèle et l'étape de décodage avec le streaming qui affiche la sortie au fur et à mesure de sa génération.

Questions fréquentes

Qu’est-ce qu’un grand modèle de langage ?

Un grand modèle linguistique (LLM) est un réseau neuronal entraîné pour prédire le mot suivant dans une séquence, à grande échelle. À partir de ce seul objectif, il apprend suffisamment bien la grammaire, les faits, le raisonnement et le style pour générer un texte fluide. Le nom décrit le mécanisme : il est volumineux (des milliards de paramètres), formé au langage et fondamentalement un prédicteur du prochain jeton.

Pourquoi un LLM génère-t-il du texte un jeton à la fois ?

Parce que sa seule opération consiste à prédire le prochain jeton le plus probable compte tenu de tout ce qui s'est passé jusqu'à présent. Après chaque prédiction, ce jeton est ajouté à l'entrée et le processus se répète : le message « Continuer à générer ? » boucle dans le visuel. Cette conception récursive est ce qui permet au modèle de produire un texte arbitrairement long, et aussi la raison pour laquelle la sortie peut dériver ou se répéter : chaque étape ne voit que les jetons qu'elle a déjà générés.

Quelle est la différence entre la pré-formation et la mise au point ?

La pré-formation est la phase initiale massive : le modèle apprend les modèles de langage généraux à partir de téraoctets de texte, ce qui lui donne sa capacité brute. Le réglage fin est une phase ultérieure plus petite sur les données organisées pour une tâche ou un style spécifique, qui modifie le comportement du modèle pré-entraîné. La plupart des utilisateurs de LLM n'effectuent jamais de réglages précis : ils proposent des invites qui orientent le même modèle au moment de l'inférence.

Pourquoi les LLM donnent-ils parfois de mauvaises réponses avec assurance ?

Parce que le modèle optimise le texte probable, pas la vérité. Il n'a pas de base de données interne ni de vérificateur d'exactitude ; il produit la continuation qui correspond à ses modèles de formation. Lorsque le modèle semble plausible, il l’énonce avec assurance. C'est pourquoi le visuel décrit le modèle comme un prédicteur plutôt que comme un récupérateur : la mise en garde en matière d'honnêteté est une propriété du mécanisme, et non un bug qui sera corrigé par la seule mise à l'échelle.

Modifier ce visuel dans QueryChart (FlowJam)

Ouvrez ce canevas LLM exact en tant que votre propre graphique, renommez les étapes de votre pipeline et annotez le modèle que vous utilisez.

Modifier ce visuel dans QueryChart (FlowJam)

Plus dans Explications visuelles