Sådan fungerer store sprogmodeller — træning og inferens

Sådan fungerer store sprogmodeller, vist på et interaktivt lærred: fortræning, finjustering og den sløjfe token for token, der producerer hvert eneste svar.

En stor sprogmodel er en forudsiger af det næste ord i stor skala: den lærer statistiske mønstre fra enorme mængder tekst og genererer derefter svar ét token ad gangen ved at forudsige, hvad der kommer nu.

Sådan fungerer store sprogmodeller — træning og inferens

The interactive FlowJam canvas for this explanation — every lane, row and arrow above is a real QueryChart diagram you can open and edit.

How to read this visual

  • Læs kolonnen »Træning« først — den forklarer, hvordan modellen fik sin evne — og derefter kolonnen »Inferens« for, hvordan den evne bliver brugt.
  • Tilbagekoblingssløjfen er det afgørende træk: »Ja«-grenen fra »Skal der genereres videre?« peger tilbage ind i attention-lagene, og »Stop«-grenen løber ned til den afkodede tekst.
  • De tre inferensrækker er pipelinen: input bliver til tokens, tokens bliver til forudsigelser, forudsigelser bliver til output.

Træning: hvor modellen kommer fra

»Fortræning på enorme mængder tekst« er fundamentet — modellen bliver udsat for et enormt korpus og trænet på én opgave: at forudsige et manglende ord. Ud af det ene mål lærer den grammatik, fakta og ræsonnementsmønstre. »Modellen lærer statistiske mønstre mellem ord« gør karakteren af den læring eksplicit, og »Finjustering tilpasser modellen til en bestemt opgave« er styringen — et mindre, kurateret datasæt, der flytter adfærden mod en ønsket stil eller et bestemt fagområde.

Inferens: fra input til output

»Prompten deles op i tokens« og »Tokens bliver til numeriske embeddings« er inputhalvdelen: tekst brydes op i små enheder og omsættes til vektorer, som modellen kan regne på. »Attention-lag vejer, hvilke ord der betyder noget sammen« er den mekanisme, der giver konteksten dens kraft — det engelske ord »bank« læses anderledes ved siden af »river« end ved siden af »money«, fordi attention lader hvert token tage alle de andre tokens i betragtning.

Genereringssløjfen

»Modellen forudsiger det mest sandsynlige næste token« er genereringens atomare handling. »Skal der genereres videre?« gør sløjfen eksplicit: hver forudsigelse føres tilbage som nyt input, og det er derfor, svar bliver bygget ét token ad gangen frem for komponeret som en helhed. »Tokens afkodes tilbage til læsbar tekst« og »Svaret returneres til brugeren« fuldender pipelinen — det output, brugeren ser, er den afkodede hale af den sløjfe.

Key relationships and takeaways

  • En LLM er en forudsiger af det næste token, ikke et system, der henter svar frem — hvert svar er en kæde af enkelttoken-forudsigelser.
  • Fortræningen leverer evnen; finjustering og prompting styrer den mod en opgave.
  • Tokens, ikke tegn eller hele ord, er de enheder, modellen tænker i.
  • Attention lader konteksten omforme betydningen, og det er dét, der gør, at de samme ord betyder forskellige ting i forskellige sætninger.
  • Genereringen er rekursiv: hvert output-token bliver til nyt input, og det er derfor, svar kan være lange, sammenhængende og forkerte med lige stor overbevisning.

When to use this visual

  • At forklare et ikke-teknisk publikum, hvad en LLM faktisk gør, og hvorfor den kan tage overbevisende fejl.
  • At lære et produktteam forskellen på træning, finjustering og prompting, så de kan ræsonnere om modellens adfærd.
  • At forankre en diskussion om tokengrænser, omkostninger og svartid i mekanikken token for token.

Sådan fungerer det

  1. Notér den træningsfase, I bygger på

    Skriv på fortræningsboksen, hvilken modelfamilie I bruger, og om dens vægte er åbne eller lukkede; skriv på finjusteringen, om I faktisk finjusterer, eller om I prompter i stedet.

  2. Tilføj systemprompten

    Indsæt et trin, før prompten tokeniseres, hvor systeminstruktionerne skydes ind, for hos de fleste brugere er det dér, adfærden i praksis formes.

  3. Vis laget med sikkerhed og guardrails

    Tilføj moderationstrinnet mellem forudsigelsessløjfen og outputtet, med en eksplicit blokering eller omskrivning som udfald, så diagrammet afspejler, hvordan systemer i produktion sætter en port foran genereringen.

  4. Hold styr på tokens

    Notér jeres models faktiske tokenbudget på tokeniseringstrinnet, og notér på afkodningstrinnet den streaming, der viser outputtet, mens det bliver genereret.

Ofte stillede spørgsmål

Hvad er en stor sprogmodel?

En stor sprogmodel (LLM) er et neuralt netværk, der er trænet til at forudsige det næste ord i en sekvens, i enorm skala. Ud af det ene mål lærer den grammatik, fakta, ræsonnement og stil godt nok til at generere flydende tekst. Navnet beskriver mekanismen: den er stor (milliarder af parametre), trænet på sprog og grundlæggende en forudsiger af det næste token.

Hvorfor genererer en LLM tekst ét token ad gangen?

Fordi dens eneste operation er at forudsige det mest sandsynlige næste token ud fra alt det, der er kommet indtil nu. Efter hver forudsigelse lægges det token til inputtet, og processen gentager sig — sløjfen »Skal der genereres videre?« i diagrammet. Det rekursive design er det, der lader modellen producere vilkårligt lang tekst, og også grunden til, at output kan drive af eller gentage sig: hvert skridt ser kun de tokens, det allerede har genereret.

Hvad er forskellen på fortræning og finjustering?

Fortræningen er den massive indledende fase: modellen lærer generelle sprogmønstre fra terabytes af tekst, og det er dér, dens rå evne kommer fra. Finjustering er en mindre, senere fase på kurateret data til en bestemt opgave eller stil, og den ændrer, hvordan den fortrænede model opfører sig. De fleste brugere af LLM'er finjusterer aldrig — de prompter, og det styrer den samme model på inferenstidspunktet.

Hvorfor giver LLM'er nogle gange forkerte svar med stor overbevisning?

Fordi modellen optimerer efter sandsynlig tekst og ikke efter sandhed. Den har ingen intern database og ingen korrekthedskontrol; den producerer den fortsættelse, der passer til dens træningsmønstre. Når mønsteret er et plausibelt lydende udsagn, fremsætter den det med overbevisning. Det er derfor, diagrammet beskriver modellen som en forudsiger og ikke som en, der henter frem — forbeholdet om ærlighed er en egenskab ved mekanismen og ikke en fejl, som skalering alene vil lappe.

Redigér dette diagram i QueryChart (FlowJam)

Åbn præcis det LLM-lærred, du ser her, som dit eget diagram, omdøb faserne til jeres egen pipeline, og notér den model, I bruger.

Redigér dette diagram i QueryChart (FlowJam)

Mere i Visuelle forklaringer