Teil I · Grundlagen: Die KI vor den LLMs verstehen
Aus Daten lernen: maschinelles Lernen & Deep Learning
2.1Der Paradigmenwechsel: programmieren oder lernen
Das maschinelle Lernen (englisch machine learning) kehrt die Logik um. Man liefert nicht mehr die Regeln, sondern Beispiele (Tausende bereits als „Spam“ oder „kein Spam“ gekennzeichnete E-Mails), und die Maschine entdeckt selbst die Regeln, mit denen sie sich unterscheiden lassen. Man programmiert nicht mehr, was zu tun ist, sondern wie gelernt wird.
2.2Drei Arten zu lernen
Das maschinelle Lernen gliedert sich in drei große Familien, die man klar auseinanderhalten sollte, denn sie tauchen im Folgenden überall wieder auf.
2.3Das künstliche Neuron und die Netze
2.4Wie eine Maschine lernt: Kosten und Backpropagation
Durch ständiges Wiederholen sinkt der Fehler, und das Netz wird kompetent. Das anschaulichste Bild ist eine Wanderung im Nebel, bei der man in ein Tal absteigen will: Man sieht den Talgrund nicht, spürt aber das Gefälle unter den Füßen und macht einen Schritt bergab. Wiederholt man das, erreicht man schließlich einen Tiefpunkt. Dieses „Gefälle“ heißt in der Mathematik Gradient, und das Verfahren heißt Gradientenabstieg.
2.52012: der Urknall des Deep Learning
Warum 2012 und nicht früher? Weil die drei fehlenden Treibstoffe (Kapitel 1) endlich zusammenkommen:
- Die Daten: ImageNet liefert den gigantischen Datensatz gekennzeichneter Bilder, der bis dahin fehlte.
- Die Rechenleistung: AlexNet wird auf GPUs des Unternehmens NVIDIA trainiert. Diese Chips, entwickelt, um die Pixel von Videospielen parallel zu berechnen, erweisen sich als ideal für die massenhaften Multiplikationen neuronaler Netze. Dieses technische Detail wird gewaltige geopolitische Folgen haben: Es macht NVIDIA zu einem der wertvollsten Unternehmen der Welt (Kapitel 8).
- Die Algorithmen: Verfeinerungen (die Aktivierungsfunktion ReLU, die Regularisierungstechnik Dropout) erlauben es, tiefere Netze zu trainieren, ohne dass sie aus dem Ruder laufen.
2.6Sehen und lesen: CNN und RNN
2.7Bedeutung darstellen: Embeddings (Einbettungen)
Der geniale Kniff: Man lernt diese Zahlen so, dass Wörter mit ähnlicher Bedeutung nahe beieinanderliegende Positionen im Raum einnehmen. „Katze“ und „Hund“ werden zu Nachbarn; „König“ und „Banane“ liegen weit auseinander. Bedeutung wird zu Geometrie.
Mehr noch: Die Richtungen des Raums erfassen Beziehungen. Das berühmt gewordene Beispiel (aus dem Modell word2vec, 2013) wirkt beinahe magisch:
König − Mann + Frau ≈ Königin
Anders gesagt: Der Vektor, der „Mann“ mit „König“ verbindet, ist ungefähr derselbe wie der, der „Frau“ mit „Königin“ verbindet. Die Maschine hat ganz allein und ohne dass man es ihr gesagt hätte das abstrakte Konzept des Königtums und das des Geschlechts entdeckt, einfach indem sie beobachtet hat, wie Wörter in Milliarden von Sätzen verwendet werden.
Das ist die moderne Form der symbolischen Wissensrepräsentation (Kapitel 1), und sie strukturiert hinter den Kulissen zahlreiche Suchmaschinen (deren Antwortkästen). Ihre Stärke sind Präzision und Nachvollziehbarkeit (man weiß, woher jede Tatsache stammt); ihre Schwäche ist, dass man den Graphen von Hand aufbauen und pflegen muss. Daher das wachsende Interesse an neurosymbolischen Ansätzen, die die Flexibilität neuronaler Netze mit der Strenge von Graphen verbinden: Ein LLM kann einen Wissensgraphen abfragen, um seine Antworten in geprüften Fakten zu verankern (eine strukturierte Variante der Retrieval-Augmented Generation, Kapitel 6) und so seine Halluzinationen zu verringern.
2.8Die drei Zutaten der modernen KI
Diese Triade wirft Licht auf den gesamten weiteren Kurs:
- Die Jagd nach Daten wirft Fragen des geistigen Eigentums und der Privatsphäre auf (Kapitel 21 und 25).
- Die Jagd nach Rechenleistung erklärt die Bewertung von NVIDIA, den Chipkrieg und die Energierechnung (Kapitel 8 und 10).
- Die Jagd nach Algorithmen ist Gegenstand des erbitterten Wettbewerbs zwischen den Laboren (Kapitel 7), und ihr nächster großer Sprung, der Transformer, ist das Thema des folgenden Kapitels.
2.9Gehirn und Maschine: eine fruchtbare und trügerische Analogie
Das Wichtigste (Kapitel 2)
- Das maschinelle Lernen kehrt die klassische Programmierung um: Man liefert nicht mehr die Regeln, sondern Beispiele, und die Maschine lernt die Regeln. Das Ergebnis heißt Modell.
- Drei Familien: überwachtes Lernen (mit Musterlösung), unüberwachtes Lernen (ohne Musterlösung), bestärkendes Lernen (Versuch und Irrtum).
- Ein neuronales Netz stapelt künstliche Neuronen in Schichten; „tief“ bedeutet „mit vielen Schichten“ (Deep Learning).
- Gelernt wird durch Gradientenabstieg und Backpropagation: Man misst den Fehler und korrigiert dann jedes Gewicht um einen kleinen Schritt, um ihn zu verringern.
- 2012 (AlexNet/ImageNet) markiert den Urknall des Deep Learning, ermöglicht durch das Zusammentreffen von Daten + GPUs + Algorithmen.
- Embeddings (Einbettungen) verwandeln Bedeutung in Geometrie: Das ist die konzeptionelle Brücke zu den großen Sprachmodellen.
- Jede moderne KI beruht auf einer Triade: Daten, Rechenleistung, Algorithmen.
Damit sind wir bereit, die Schwelle zu überschreiten. In Kapitel 3 erzählen wir von der Innovation des Jahres 2017, die die Blockaden der Sprache gesprengt und das Zeitalter der großen Modelle eingeläutet hat: dem Transformer.