Teil I · Grundlagen: Die KI vor den LLMs verstehen
Die Transformer-Revolution: „Attention ist alles, was man braucht“
3.1Die Mauer der sequenziellen Architekturen
Um diese Mauer zu überwinden, brauchte es eine Architektur, die zwei Kunststücke gleichzeitig beherrscht: die gesamte Sequenz auf einmal zu verarbeiten (um schnell zu sein) und jedes beliebige Wort direkt mit jedem anderen zu verknüpfen, so weit sie auch auseinanderliegen mögen (um nichts zu vergessen). Genau das leistet der Aufmerksamkeitsmechanismus.
3.2Die Intuition hinter der Attention
Ein anderes Bild: Stellen Sie sich eine Besprechung vor, in der Sie, um eine Bemerkung zu verstehen, ganz automatisch alles gewichten, was die einzelnen Teilnehmer zuvor gesagt haben, je nachdem, wie relevant es ist. Attention ist dieses Gewichtungssystem, in großem Maßstab angewandt und automatisch erlernt.
3.3Die Transformer-Architektur (2017)
Zwei Zutaten sollte man sich merken:
- Die Multi-Head-Attention (multi-head attention). Statt eines einzigen Gewichtungssystems lässt der Transformer mehrere parallel laufen, gleichsam als verschiedene „Blicke“ auf den Satz. Ein Kopf kann der Grammatik folgen (Kongruenz von Subjekt und Verb), ein anderer der Bedeutung, ein weiterer den Bezügen („er“ verweist auf „Hund“). Indem das Modell diese Blicke kombiniert, erfasst es sehr reichhaltige Beziehungen.
- Die Positionskodierung (positional encoding). Für sich genommen ist die Attention blind für die Wortreihenfolge: Für sie wären „Hund beißt Mann“ und „Mann beißt Hund“ identisch. Deshalb fügt man der Repräsentation jedes Wortes eine Information über seine Position im Satz hinzu, damit die Reihenfolge erhalten bleibt.
3.4Die Skalierungsgesetze (scaling laws)
Der Forscher Richard Sutton hat die philosophische Lehre daraus unter dem Namen „bittere Lektion“ (bitter lesson) zusammengefasst: Auf lange Sicht setzen sich allgemeine Methoden, die von wachsender Rechenleistung profitieren, stets gegen die raffinierten Methoden durch, die Experten mühsam von Hand zurechtgebastelt haben. Frustrierend für den menschlichen Erfindungsgeist, aber bemerkenswert wirksam.
3.5Vortraining, Fine-Tuning und RLHF
- Das Vortraining (pre-training). Man lässt das Modell einen gewaltigen Teil des verfügbaren Textes aufnehmen (Webseiten, Bücher, Code, Artikel). Dabei lernt es Grammatik, Fakten, Schlussfolgern und Stil, einfach indem es versucht, die Fortsetzung vorherzusagen. Das ist der teuerste Schritt: Wochen an Rechenzeit auf Tausenden von Prozessoren, für Dutzende, ja Hunderte Millionen Dollar.
- Das überwachte Fine-Tuning (supervised fine-tuning, SFT), auch Instruction-Tuning genannt. Man zeigt dem Modell Tausende von Beispielen der Form „Frage eines Nutzers, ideale Antwort eines Assistenten“. So lernt es, sich wie ein Assistent zu verhalten: zu antworten, Anweisungen zu befolgen, den richtigen Ton zu treffen.
- Das RLHF (Reinforcement Learning from Human Feedback, bestärkendes Lernen anhand menschlicher Rückmeldungen). Menschen vergleichen mehrere Antworten des Modells und geben an, welche sie bevorzugen. Ein zweites Modell, das sogenannte „Belohnungsmodell“, lernt diese Präferenzen und dient anschließend dazu, das Hauptmodell darauf zu trainieren, Antworten zu liefern, die als besser beurteilt werden: nützlicher, ehrlicher, weniger toxisch. Dieser Schritt macht den Assistenten angenehm und vergleichsweise sicher.
Das Wichtigste (Kapitel 3)
- Der Transformer (2017, Artikel „Attention Is All You Need“) ersetzt das sequenzielle Lesen durch den Attention-Mechanismus, der alle Wörter direkt miteinander verknüpft und sich auf GPUs parallelisieren lässt.
- Die Attention lernt für jedes Wort, welche anderen Wörter zählen und wie stark. Die Multi-Head-Attention vervielfacht diese „Blicke“; die Positionskodierung bewahrt die Wortreihenfolge.
- Die Linie der reinen Decoder (GPT-Familie) hat sich bei der Textgenerierung durchgesetzt.
- Die Skalierungsgesetze zeigen, dass die Leistung mit Größe, Daten und Rechenleistung vorhersagbar wächst, daher der Wettlauf um Ressourcen. Ihre Erträge könnten jedoch an eine Obergrenze stoßen.
- Ein Assistent entsteht in drei Schritten: Vortraining, überwachtes Fine-Tuning, dann RLHF. Dieser letzte Schritt ist zugleich die Wiege des Alignment-Problems.
Im nächsten Kapitel öffnen wir die Haube weit und betrachten den Star dieser neuen Ära: das große Sprachmodell selbst.