Künstliche Intelligenz

Wie ein Sprachmodell funktioniert: Tokens, Kontextfenster und Temperatur

Was ein Token ist, was das Kontextfenster begrenzt, was die Temperatur bewirkt und warum Sprachmodelle so selbstsicher falschliegen. Erklärt ohne Mathematik.

Ein großes Sprachmodell (LLM) ist ein Programm, das darauf trainiert ist, aus den vorangehenden Textfragmenten das nächste vorherzusagen, ein sogenanntes Token. Alles, was es tut (antworten, übersetzen, Code schreiben), läuft darauf hinaus, diese Vorhersage viele Male zu wiederholen. Drei Konzepte erklären den Großteil seines praktischen Verhaltens: Tokens (die Einheit, mit der es liest und schreibt), das Kontextfenster (wie viel Text es gleichzeitig berücksichtigen kann) und die Temperatur (wie viel Zufall es bei der Wahl jedes Tokens hinzufügt).

Dieser Artikel erklärt die drei ohne Mathematik, mit dem, was du als Entwickler wissen musst, um diese Werkzeuge mit Urteilsvermögen einzusetzen.

Was ein Token ist

Modelle arbeiten nicht mit Buchstaben oder Wörtern, sondern mit Tokens: Textfragmenten aus einem festen Vokabular (meist zwischen 30.000 und 200.000 Einträgen), das beim Training mit Algorithmen wie BPE (byte-pair encoding) aufgebaut wird. Ein häufiges englisches Wort ist in der Regel ein Token; ein selteneres Wort, ein Eigenname oder ein Wort in einer anderen Sprache wird in mehrere zerlegt. Leerzeichen, Satzzeichen und Zeilenumbrüche zählen ebenfalls.

Praktische Folgen:

  • Kosten und Limits werden in Tokens gemessen, nicht in Wörtern. Als Faustregel entspricht ein Token im Englischen etwa vier Zeichen; in anderen Sprachen ist das Verhältnis etwas schlechter, weil Vokabulare meist für Englisch optimiert sind, sodass derselbe Text mehr Tokens braucht. Deutsch mit seinen langen Komposita ist davon besonders betroffen.
  • Das Modell „sieht“ keine Buchstaben. Deshalb sind Aufgaben wie das Zählen der Buchstaben eines Wortes oder dessen Umkehrung überraschend schwer: Das Wort erreicht es als ein oder zwei undurchsichtige Tokens.
  • Zahlen und Code werden unregelmäßig tokenisiert, was einen Teil der Rechenfehler erklärt.

Die Hugging-Face-Dokumentation zu Tokenizern beschreibt die üblichen Algorithmen, wenn du tiefer einsteigen willst.

Was das Kontextfenster ist

Das Kontextfenster ist die maximale Anzahl Tokens, die das Modell in einem einzigen Aufruf berücksichtigen kann: Es umfasst deine Anweisungen, den Gesprächsverlauf, angehängte Dokumente und die Antwort, die es gerade erzeugt. Es ist das gesamte „Arbeitsgedächtnis“ des Modells: Was nicht im Fenster ist, existiert für das Modell nicht.

Das hat direkte Auswirkungen:

  • Ein Modell erinnert sich nicht von selbst an frühere Gespräche. Wenn eine Anwendung sich zu erinnern scheint, liegt das daran, dass sie bei jedem Aufruf den Verlauf (oder eine Zusammenfassung) erneut sendet.
  • Wenn ein langes Gespräch das Fenster überschreitet, muss die Anwendung kürzen oder zusammenfassen, und das Modell verliert Details vom Anfang.
  • Dass ein Modell einen sehr großen Kontext akzeptiert, garantiert nicht, dass es alle Informationen gut nutzt: Die Qualität sinkt tendenziell bei sehr langen Dokumenten, besonders für Daten in der Mitte des Textes. Setze das Wichtige an den Anfang oder ans Ende und frage nach konkreten Belegstellen.

Die Fenstergröße variiert stark zwischen Modellen und Versionen und ändert sich oft; prüfe immer die Dokumentation des Anbieters für die aktuelle Zahl, statt dich auf eine gemerkte zu verlassen.

Was die Temperatur bewirkt

In jedem Schritt berechnet das Modell eine Wahrscheinlichkeit für jedes mögliche Token im Vokabular. Die Temperatur steuert, wie es unter ihnen wählt:

  • Temperatur 0 (oder nahe daran): Es wählt fast immer das wahrscheinlichste Token. Deterministischere, wiederholbare Antworten. Geeignet für Datenextraktion, Klassifizierung, Code und jede Aufgabe mit einer „richtigen“ Antwort.
  • Hohe Temperatur (zum Beispiel 0,8 bis 1): Weniger wahrscheinliche Tokens bekommen mehr Chancen. Mehr Vielfalt und Kreativität, aber auch mehr Risiko für Inkonsistenzen. Geeignet für Brainstorming oder Texte mit variierendem Ton.

Zwei Einschränkungen: Selbst bei Temperatur 0 kann die Ausgabe zwischen Durchläufen wegen Implementierungsdetails leicht variieren, und es gibt weitere Sampling-Parameter (wie top-p), die die Menge der Kandidaten-Tokens begrenzen. In den meisten Fällen reicht es, die Temperatur anzupassen.

Warum sie so selbstsicher falschliegen

Das Modell optimiert auf plausiblen Text, nicht auf wahren. Fehlen ihm ausreichende Informationen, erzeugt es trotzdem die wahrscheinlichste Fortsetzung, die ein erfundenes Zitat, eine nicht existierende Bibliotheksfunktion oder ein falsches Datum sein kann, geschrieben im selben sicheren Ton wie eine korrekte Antwort. Das nennt man gemeinhin „Halluzination“.

Als Entwickler sind die Gegenmaßnahmen bekannt:

  • Gib ihm die Informationen im Kontext (Dokumentation, Daten, die relevante Datei), statt dich darauf zu verlassen, was es „weiß“. Das ist die Idee hinter Retrieval-Techniken (RAG).
  • Lass es zitieren, woher jede Aussage stammt, und prüfe die Zitate.
  • Überprüfe die Ausgabe auf unabhängigem Weg: Führe den Code aus, validiere das JSON, prüfe den Fakt gegen.
  • Senke die Temperatur für faktische Aufgaben.

Was darunterliegt: die Architektur in einem Absatz

Fast jedes aktuelle LLM basiert auf dem Transformer, einer Architektur, die 2017 im Paper Attention Is All You Need vorgestellt wurde. Ihr zentraler Mechanismus, die Attention, erlaubt jedem Token, bei der Berechnung seiner Repräsentation jedes andere Token im Kontext zu berücksichtigen. Das Modell wird zunächst auf riesigen Textmengen trainiert, das nächste Token vorherzusagen, und dann mit Beispielen von Anweisungen und Antworten (und mit menschlichem Feedback) feinjustiert, damit es sich wie ein Assistent verhält. Der Hugging-Face-Kurs erklärt es Schritt für Schritt.

Praktische Zusammenfassung

Konzept Was es ist Was du damit tust
Token Texteinheit, mit der das Modell liest und schreibt Kosten und Limits in Tokens messen; keine Präzision auf Buchstabenebene erwarten
Kontextfenster Maximale Tokens pro Aufruf, Antwort eingeschlossen Nur das Relevante einbeziehen; lange Gespräche zusammenfassen; Wichtiges zuerst oder zuletzt
Temperatur Grad des Zufalls bei der Wahl jedes Tokens Niedrig für faktische Aufgaben und Code; höher, um Vielfalt zu erzeugen
Halluzination Plausibler, aber falscher Text Kontext liefern, Zitate verlangen und immer überprüfen

Fazit

Ein LLM sagt Tokens innerhalb eines begrenzten Kontextfensters vorher, mit einem Grad an Zufall, den du über die Temperatur steuerst. Diese drei Konzepte zu verstehen erklärt fast alles, was du in der Praxis siehst: warum es Buchstaben falsch zählt, warum es in langen Gesprächen „vergisst“, warum es manchmal erfindet, und wie du jedes dieser Probleme verringerst. Es ist weder Magie noch eine Suchmaschine: Es ist ein sehr fähiger Textgenerator, der umso besser arbeitet, je besser der Kontext ist, den du ihm gibst, und je gründlicher du seine Ausgabe prüfst.

Quellen und Referenzen

  1. Attention Is All You Need (Vaswani et al., 2017) arxiv.org
  2. Hugging Face: Summary of the tokenizers huggingface.co
  3. Hugging Face LLM Course: How do Transformers work? huggingface.co
  4. Language Models are Few-Shot Learners (Brown et al., 2020) arxiv.org