Teil II · Das Zeitalter der großen Modelle
Weltmodelle (World Models) und Multimodalität
5.1Text vorherzusagen genügt nicht: die Welt verstehen
Daraus erwächst eine Idee, die die Forschung seit 2025 umtreibt: Um eine allgemeinere Intelligenz zu erreichen, bräuchte es Systeme mit einem echten Weltmodell, also mit einer inneren Repräsentation davon, wie die Wirklichkeit funktioniert und sich entwickelt. Der Text ist aus dieser Sicht nur ein verarmter und unvollständiger Schatten der Realität. Der Forscher Yann LeCun hat dies zu seinem großen Thema gemacht: Seiner Ansicht nach gelangt man nicht zur Intelligenz, indem man immer mehr Text verschlingt, sondern indem man aus reichhaltigeren Signalen lernt, etwa aus Video und aus der Interaktion mit der Welt.
5.2Multimodalität: Text, Bild, Ton, Video
5.3Weltmodelle: Definition und Bedeutung
Vorsicht vor der Verwechslung mit einem bloßen Videogenerator. Der Unterschied ist fein, aber entscheidend:
5.4Die konkurrierenden Ansätze (Überblick Mitte 2026)
Tabelle 5.1. Die vier Lager der „Weltmodelle“ im Jahr 2026.
Einige konkrete Wegmarken aus den Jahren 2025 und 2026:
- Videogenerierung „als Simulation der Welt“. OpenAI vertrat bereits 2024 mit Sora die These, dass ein Modell, das auf genügend Videos trainiert wurde, die Physik am Ende implizit erlernt und dass die Skalierung den Rest erledigt. Inzwischen hat OpenAI das Produkt vom Markt genommen: Die im März 2026 angekündigte Einstellung erfolgt in zwei Schritten, mit der Schließung der App im April 2026 und einer für September 2026 vorgesehenen Abschaltung der API. Google (Veo), die chinesischen Unternehmen Kuaishou (Kling) und ByteDance (Seedance, 2025 an der Spitze mehrerer Ranglisten für Videogenerierung) sowie Runway verfolgen einen ähnlichen Weg. Die Debatte bleibt offen: Sora modellierte manche Interaktionen schlecht (ein zerbrechendes Glas, angebissenes Essen), und mehrere Studien kamen zu dem Schluss, dass es „die Anfänge eines Weltmodells“ zeige, ohne ganz eines zu sein.
- Räumliche Intelligenz. World Labs, gegründet von Fei-Fei Li (der „Patin“ der KI, auf die ImageNet zurückgeht), brachte Ende 2025 das Produkt Marble auf den Markt, das aus einem Text oder einem Bild persistente, veränderbare und exportierbare 3D-Welten erzeugen kann. Am 1. September 2026 stellte World Labs Atlas vor, ein multimodales Weltmodell, das 3D-Szenen erzeugt, rekonstruiert und simuliert (bis zu einer Minute Video aus einem einzigen Bild, mit Ausgaben als Punktwolken und als „Gaussian Splats“) und das insbesondere auf den Übergang von der Realität in die Simulation für die Robotik zielt. Ende September 2026 wird Atlas Partnern im Vorabzugang angeboten, ohne allgemeine Verfügbarkeit. Für Li ist „die räumliche Intelligenz die nächste Grenze der KI“.
- Generativ-interaktive Modelle. Google DeepMind stellte Genie 3 vor (August 2025), ein Modell, das in Echtzeit erkundbare 3D-Welten mit 24 Bildern pro Sekunde erzeugen kann und seit 2026 über „Project Genie“ bestimmten Abonnenten offensteht. NVIDIA liefert mit seiner Plattform Cosmos (Anfang 2026 mehr als zwei Millionen Downloads) „physikbewusste“ Welten, um Roboter und autonome Fahrzeuge in der Simulation zu trainieren.
- Der latente Ansatz (JEPA). Das ist die Wette von Yann LeCun: statt die Pixel vorherzusagen, in einem abstrakten Raum vorherzusagen, was geschehen wird, was weitaus effizienter und näher an der Kognition wäre. Überzeugt davon, dass die LLMs „an ihre Grenzen stoßen“, verließ LeCun Ende 2025 Meta, um in Paris AMI Labs (Advanced Machine Intelligence) zu gründen, und sammelte für diese Idee mehr als eine Milliarde Dollar ein. AMI Labs fasst seine Überzeugung so zusammen: Wahre Intelligenz beginnt nicht in der Sprache, sondern in der Welt. Seine Weltmodelle lernen abstrakte Repräsentationen aus Sensordaten und treffen ihre Vorhersagen in diesem Raum; durch die Aktion konditioniert, lassen sie einen Agenten die Folgen seiner Handlungen vorwegnehmen und innerhalb von Leitplanken planen. Das erklärte Ziel: Systeme mit einem persistenten Gedächtnis, die schlussfolgern können, steuerbar und sicher sind, für Bereiche, in denen Zuverlässigkeit an erster Stelle steht (industrielle Steuerung, Robotik, vernetzte Geräte, Gesundheit). Es handelt sich um ein Frontier-Labor, das von Anfang an auf Paris, New York, Montreal und Singapur verteilt ist. Meta führt seinerseits seine V-JEPA-Modelle weiter.
Der Nutzen deckt sich mit dem des folgenden Abschnitts, nur auf Software übertragen: Eine reale Umgebung ist langsam, knapp, teuer und riskant, und man kann dort nicht nach Belieben die Grenzfälle einspeisen, mit denen ein Agent gleichwohl umgehen können muss. Ein originalgetreuer, steuerbarer und wiederholbarer Simulator erlaubt es dagegen, unbegrenzte Mengen an Trainingstrajektorien zu erzeugen (eine Form synthetischer Daten, Kapitel 4), Reinforcement Learning kostengünstig und gefahrlos anzuwenden und einen Agenten zu testen, bevor man ihn auf echte Systeme loslässt. Qwen berichtet sogar, dass auf diese Weise in der Simulation trainierte Agenten jene übertreffen können, die unter realen Bedingungen trainiert wurden, und dass sich dieses Wissen über die Umgebungen ohne spezifisches Nachtraining auf Agentenaufgaben übertragen lässt.
Zwei Vorbehalte sind allerdings angebracht. Der Benchmark, der diese Ergebnisse misst (AgentWorldBench), wurde vom Team selbst entworfen und veröffentlicht: Die dort ausgewiesenen Vorsprünge sind mit Vorsicht zu genießen. Und es ist dieselbe Klippe wie die weiter unten behandelte Kluft zwischen Simulation und Realität: Ein Agent, der im Simulator glänzt, kann an der Unordnung der realen Welt scheitern, denn ein Weltmodell ist nie besser als die Daten, mit denen es gefüttert wurde.
5.5Warum dies eine der großen Wetten des Jahres 2026 ist
Einordnung: vom Virtuellen zum Realen (sim-to-real). Die wichtigste konkrete Anwendung der Weltmodelle gibt es bereits: Agenten und Roboter in der Simulation zu trainieren. Der Nutzen liegt auf der Hand: In einer virtuellen Welt kann ein Roboter im Zeitraffer Millionen von Versuchen unternehmen, ohne Risiko, ohne Verschleiß und ohne Gefahr, während das Lernen in der realen Welt langsam und teuer wäre. Bleibt die zentrale Herausforderung, die Kluft zwischen Simulation und Realität (reality gap): Ein Verhalten, das in einem allzu perfekten Simulator erlernt wurde, scheitert oft an der Unordnung der realen Welt (Reibung, wechselndes Licht, unvollkommene Sensoren). Das wichtigste Gegenmittel heißt Domain Randomization: Man variiert absichtlich tausend Parameter der Simulation (Texturen, Beleuchtung, Massen, Reibungswerte), um die erlernte Strategie zur Robustheit zu zwingen, sodass die reale Welt für sie nur eine weitere Variante unter den bereits angetroffenen ist. Hinzu kommt die Erzeugung synthetischer Daten (Beispiele, die generiert statt gesammelt werden), die immer häufiger zum Training von Modellen eingesetzt wird, wenn reale Daten fehlen. Das ist die greifbarste Brücke zwischen diesem Kapitel und der Robotik (Kapitel 13).
Das Wichtigste (Kapitel 5)
- Die Spitzenmodelle sind multimodal: Text, Bild, Ton und Video werden in einem gemeinsamen Repräsentationsraum verarbeitet (alles wird zu Tokens).
- Ein Weltmodell ist ein innerer Simulator, der aus einer Aktion den nächsten Zustand vorhersagt; es ist interaktiv, im Unterschied zu einem Videogenerator, der einen festen Clip erzeugt.
- Vier Lager stehen sich 2026 gegenüber: Videogenerierung (Veo, Kling, Seedance), räumlich/3D (World Labs, Marble), generativ-interaktiv (Genie 3, Cosmos) und latent/JEPA (V-JEPA, LeCuns AMI Labs).
- Eine 2026 aufgekommene Variante, das sprachliche Weltmodell (z. B. Qwen-AgentWorld), simuliert nicht mehr die physische Welt, sondern die digitalen Umgebungen der Agenten (Terminal, Web, Betriebssystem...), um sie gefahrlos zu trainieren und zu testen (Kapitel 6).
- Viele sehen darin die Brücke zur verkörperten KI (Robotik) und eine mögliche Etappe auf dem Weg zur allgemeinen Intelligenz.
- Die Grundsatzdebatte: Wird die bloße Skalierung ausreichen, oder braucht es neue Architekturen, die in der Physik verankert sind?
Im nächsten Kapitel gehen wir von der Wahrnehmung und der Simulation zum Handeln über: zu den KI-Agenten, jenen Systemen, die sich nicht mehr damit begnügen zu antworten, sondern handeln.