Teil II · Das Zeitalter der großen Modelle

Die großen Sprachmodelle (LLM)

Kapitel 417 Min. LesezeitAktualisiert: September 2026

4.1Was ist ein LLM im Kern?

Eine eindrückliche Formulierung dafür: Ein LLM ist eine Funktion, die eine Textmenge gelesen hat, die kein Mensch in tausend Leben bewältigen könnte, und die in ihren Parametern einen gewaltigen Teil der Regelmäßigkeiten der Sprache und, durch sie hindurch, der Welt komprimiert hat.

4.2Token: die „Währung“ der KI

Warum ist das so entscheidend? Aus zwei ganz konkreten Gründen:

  • Das Kontextfenster (context window) ist die maximale Anzahl von Token, die das Modell gleichzeitig „im Kopf behalten“ kann. Die Größen unterscheiden sich je nach Modell stark: Viele liegen 2026 zwischen 128.000 und 256.000 Token (das entspricht einem dicken Buch), und zahlreiche Frontier-Modelle erreichen inzwischen eine Million Token oder sogar mehr. Jenseits seines Fensters „sieht“ das Modell den Anfang des Gesprächs oder des Dokuments nicht mehr; in der Praxis lässt seine Fähigkeit, einen sehr langen Kontext zu nutzen, oft schon deutlich vor dieser Grenze nach.
  • Der Preis wird in Token gerechnet. Die Nutzung eines Modells über eine Programmierschnittstelle (API) wird pro Million verbrauchter Token abgerechnet, im Input (was man ihm schickt) und im Output (was es erzeugt). Der Chiphersteller NVIDIA geht so weit, Token als „die Sprache und die Währung der KI“ zu beschreiben: Die Kosten pro Token zu optimieren, ist zu einer industriellen Schlüsselfrage geworden (Kapitel 8 und 9).

4.3Anatomie eines Trainings

4.4Emergente Fähigkeiten und Halluzinationen

Doch diese Modelle leiden an einem notorischen Mangel: den Halluzinationen. Das Modell behauptet falsche Informationen mit derselben ruhigen Selbstsicherheit wie eine Wahrheit: ein erfundenes Zitat, eine nicht existierende Rechtsquelle, eine falsche Tatsache. Der Grund ist struktureller Natur: Ein LLM ist darauf optimiert, plausiblen Text zu erzeugen, nicht wahren Text. Es verfügt konstruktionsbedingt über keinen inneren Begriff von „ich weiß es nicht“; stößt es auf eine Lücke, füllt es sie mit dem, was einer glaubhaften Antwort am ähnlichsten sieht.

Die Folgen können gravierend sein (medizinische Fehler, erfundene Gerichtsentscheidungen, die vor Gericht zitiert werden). Es gibt mehrere Gegenmittel, die sich stetig verbessern:

  • Die Retrieval-Augmented Generation (RAG, siehe Kapitel 2): Man stellt dem Modell verlässliche, bei Bedarf abgerufene Dokumente bereit, auf die es sich stützen muss.
  • Die Nutzung von Werkzeugen: das Rechnen an einen Taschenrechner delegieren, aktuelle Fakten an eine Suchmaschine (Kapitel 6).
  • Überprüfbare Quellenangaben und die kontinuierliche Verbesserung des Trainings.
  • Das explizite Schlussfolgern (nächster Abschnitt), das bestimmte Fehler verringert.

4.5Das Schlussfolgern: Gedankenkette und „Thinking“-Modelle

Die Labore haben daraufhin Reasoning-Modelle (oder „Thinking“-Modelle) trainiert: Modelle, die eine lange interne Überlegung anstellen, bevor sie ihre Antwort liefern, und dabei mehr Rechenleistung zum Zeitpunkt der Antwort aufwenden (man spricht von test-time compute, der Rechenleistung bei der Inferenz). Statt wie aus der Pistole geschossen zu antworten, „nimmt sich“ das Modell „Zeit zum Denken“, erkundet Lösungswege, korrigiert sich.

Abbildung4.1. Direkte Antwort gegenüber explizitem Schlussfolgern. Das Reasoning-Modell ist langsamer und teurer, bei komplexen Problemen aber deutlich zuverlässiger.

Dieser Wandel hat die Leistungsgrenze verschoben: Man gewinnt nicht mehr nur, indem man das Vortraining vergrößert, sondern auch, indem man das Modell länger denken lässt. Die ersten Modelle dieser Generation waren die Linie o1 und dann o3 von OpenAI (Ende 2024 und 2025) sowie das offene Modell DeepSeek-R1 (Anfang 2025), das Aufsehen erregte, weil es ein hervorragendes Reasoning-Niveau zu sehr geringen Kosten erreichte. Im Jahr 2026 bieten die großen Familien (Claude, Gemini, GPT, Grok) allesamt einen Reasoning-Modus an.

4.6Ein Modell bewerten: die Benchmarks

Stand Ende September 2026. Die Spitze ist hart umkämpft, und die Rangfolge ändert sich fast jeden Monat; das Folgende ist eine Momentaufnahme. Auf amerikanischer Seite liefern sich die Familie Claude von Anthropic, die Linie GPT von OpenAI (im September 2026 zur Generation GPT-6 übergegangen), Gemini 3 von Google DeepMind und Grok von SpaceXAI (ehemals xAI, Tochtergesellschaft von SpaceX, Kapitel 7) einen engen Wettbewerb. Auf chinesischer Seite erreichen Modelle, die häufig mit offenen Gewichten und zu sehr niedrigen Kosten angeboten werden, wie DeepSeek und Qwen (Alibaba), ein Niveau nahe der Spitze. Auf europäischer Seite trägt das französische Unternehmen Mistral die Fahne der Souveränität. Einige klare Tendenzen zeichneten sich Mitte 2026 ab, dem Zeitpunkt der letzten hier berücksichtigten Ranglistenerhebung: In den Arenen menschlicher Präferenz hatten die Claude-Varianten einen guten Teil des Jahres die ersten Plätze belegt; beim Code (SWE-bench) stritten Claude, Grok und GPT um die Führung; Gemini glänzte bei mehreren Reasoning-Prüfungen und im Multimodalen; und die Modelle mit offenen Gewichten boten bereits eine nahezu gleichwertige Qualität für einen Bruchteil des Preises, was die gesamte Ökonomie der Branche durcheinanderwirbelt.

Die große Lehre des Jahres 2026, auf die wir in Kapitel 7 zurückkommen, lässt sich in einem Satz fassen: Es gibt nicht mehr das „beste Modell“ schlechthin, sondern ein bestes Modell für jede Aufgabe. Die fortschrittlichsten Organisationen praktizieren „Routing“ (routing): Jede Anfrage wird dem Modell anvertraut, das nach Qualität, Geschwindigkeit und Kosten am besten passt. Und jede Rangliste ist als Fotografie zu lesen, gültig für einen bestimmten Augenblick.


Das Wichtigste (Kapitel 4)

  • Ein LLM ist ein Transformer, der in großem Maßstab darauf trainiert wurde, das nächste Token vorherzusagen; aus diesem Ziel erwachsen Konversation, Übersetzung, Code und Schlussfolgern.
  • Die Modelle arbeiten mit Token (Wortfragmenten), was das Kontextfenster und den Preis (abgerechnet pro Million Token) bestimmt.
  • Das Training (einmalige, massive Investition) unterscheidet sich von der Inferenz (wiederkehrende Kosten bei jeder Anfrage); die Destillation liefert leichte und günstige Versionen.
  • Der Rohstoff, hochwertiger menschlicher Text, könnte etwa zwischen 2026 und 2032 erschöpft sein (die „Datenmauer“), daher der Rückgriff auf Lizenzen, das Multimodale und synthetische Daten.
  • Halluzinationen sind strukturell bedingt (das Modell zielt auf das Plausible, nicht auf das Wahre); man mildert sie durch RAG, die Nutzung von Werkzeugen und das Schlussfolgern, ohne sie zu beseitigen.
  • Die Reasoning-Modelle „denken“ zum Zeitpunkt der Antwort länger und verschieben damit die Leistungsgrenze hin zur Rechenleistung bei der Inferenz.
  • Die Benchmarks messen den Fortschritt, leiden aber unter Sättigung, Kontamination und dem Goodhart-Effekt. Im Jahr 2026 ist die Spitze zwischen amerikanischen, chinesischen und europäischen Akteuren umkämpft, ohne einen alleinigen Sieger.

Wir haben nun ein vollständiges Bild davon, „wie es funktioniert“. Teil II weitet im Folgenden den Blick: über den Text hinaus auf die Weltmodelle und das Multimodale (Kapitel 5), dann auf den Übergang zum Handeln mit den Agenten (Kapitel 6), bevor die Landkarte der Akteure gezeichnet wird (Kapitel 7).