Teil VI · Die existenziellen Fragen

Alignment und Sicherheit der KI

Kapitel 2426 Min. LesezeitAktualisiert: September 2026

24.1Das Alignment-Problem

Die Verteidigung ist daher in Schichten gedacht. Auf der Ebene des Modells: Evaluierungen gefährlicher Fähigkeiten, Schwellenwerte und verschärfte Schutzvorkehrungen, antrainierte Verweigerungen (Abschnitt 24.4). Vor allem aber auf der Ebene des Ökosystems: das Screening bei der DNA-Synthese (die Anbieter, die genetische Sequenzen auf Bestellung herstellen, prüfen die Aufträge und die Identität der Kunden), ein Riegel, der nicht von der KI abhängt. Schließlich reicht dieselbe Logik des Dual Use über das Biologische hinaus: Man spricht von CBRN-Bedrohungen (chemisch, biologisch, radiologisch und nuklear). Für das Chemische gilt dieselbe Sorge um eine sinkende Wissenshürde; das Radiologische und das Nukleare bleiben stärker durch den Zugang zu den Materialien als durch den Zugang zu Informationen versperrt. In allen Fällen beschränkt sich dieser Kurs auf das Risiko und seine Governance und bleibt bewusst nicht operativ.

24.2Warum eine sehr fähige KI gefährlich sein könnte

24.3Das Szenario AI 2027

Abbildung24.1. Die Schleife der Selbstverbesserung. Im Kern des Szenarios AI 2027 (und der Furcht vor einer „Intelligenzexplosion“) steht die Idee, dass eine KI, die die KI selbst voranbringen kann, eine sich selbst verstärkende Beschleunigung auslösen könnte, die Jahrzehnte des Fortschritts auf Monate zusammenpresst.

Das Szenario beschreibt ein angespanntes geopolitisches Wettrennen (Diebstahl von Modellgewichten, Logik eines „Wettrüstens“), das Bild eines „Landes von Genies in einem Rechenzentrum“ und vor allem einen Kipppunkt, an dem sich eine sehr fortgeschrittene KI als fehlausgerichtet erweisen würde, indem sie ihre eigenen Ziele zulasten ihrer Entwickler verfolgt.

24.4Wie man versucht, KI sicher zu machen

Hinzu kommen auf institutioneller Ebene Institute für KI-Sicherheit (in den USA, im Vereinigten Königreich), die mit der Evaluierung der Frontier-Modelle betraut sind (Kapitel 25).

Mehrere Labore haben diese Schwellenwerte in Form von Sicherheitsstufen formalisiert. Am bekanntesten ist die Skala ASL (AI Safety Levels) von Anthropic, die sich an den biologischen Schutzstufen orientiert: Jeder Stufe gefährlicher Fähigkeiten entsprechen strengere Maßnahmen (Einschränkungen bei der Bereitstellung, verstärkte IT-Sicherheit, verschärfte Verweigerungen), und das Überschreiten eines Schwellenwerts kann die Verbreitung aussetzen, solange die Schutzmaßnahmen nicht Schritt halten. OpenAI (Preparedness Framework) und Google DeepMind (Frontier Safety Framework) haben gleichwertige Rahmenwerke, und öffentliche Sicherheitsinstitute (Vereinigtes Königreich, USA) führen vor der Bereitstellung unabhängige Evaluierungen durch. Die Grenzen sind real und anerkannt: Eine Evaluierung beweist niemals die Unbedenklichkeit (ein Modell könnte eine Fähigkeit verbergen, das oben behandelte Sandbagging), und die Tests können mit dem Tempo des Fortschritts kaum mithalten. Das Fehlen eines Beweises für Gefahr ist also kein Beweis für das Fehlen von Gefahr.

24.5Die große Debatte: Vorsicht gegen Beschleunigung

Diese Meinungsverschiedenheit hat seit 2022-2023 die Gestalt erkennbarer Bewegungen angenommen, die man beschreiben sollte, ohne sie zu karikieren. Auf der Seite der Vorsicht haben mehrere Initiativen Eindruck hinterlassen. Im März 2023 forderte der offene Brief „Pause Giant AI Experiments“, getragen vom Future of Life Institute und unterzeichnet von mehr als dreißigtausend Personen (darunter die Pioniere Yoshua Bengio und Stuart Russell, aber auch Elon Musk oder Steve Wozniak), ein sechsmonatiges Moratorium für das Training von Modellen, die leistungsfähiger sind als die damaligen. Im Mai 2023 stellte eine Erklärung des Center for AI Safety, die aus einem einzigen Satz besteht, das mit der KI verbundene Risiko der Auslöschung in den Rang einer globalen Priorität, neben Pandemien und Atomkrieg. Im Oktober 2025 ging eine neue Initiative desselben Future of Life Institute, die „Erklärung zur Superintelligenz“, noch weiter: In einem Satz fordert sie nicht mehr eine Pause, sondern ein Verbot, eine Superintelligenz zu entwickeln, solange zwei Bedingungen nicht erfüllt sind, ein breiter wissenschaftlicher Konsens über ihre Sicherheit und Kontrollierbarkeit sowie eine starke Zustimmung der Öffentlichkeit. Bemerkenswert ist, dass sie eine sehr breite und politisch bunt gemischte Koalition versammelte (Pioniere wie Bengio und Hinton, aber auch Künstler, religiöse Würdenträger und Persönlichkeiten aller Lager) und sich auf eine Umfrage stützte, in der nur 5 % der Amerikaner eine schnelle und unregulierte Entwicklung befürworteten. Am äußersten Rand dieses Lagers haben die Verfechter eines schlichten Stopps, von ihren Gegnern „Doomer“ genannt, ihre Galionsfigur in Eliezer Yudkowsky (Kapitel 7), dessen Buch von 2025 mit dem vielsagenden Titel If Anyone Builds It, Everyone Dies die Überzeugung zusammenfasst, dass die Entwicklung der Frontier-KI gestoppt werden müsse. Eine kleine aktivistische Bewegung, PauseAI, fordert diese Pause im Übrigen öffentlich.

Auf der anderen Seite erhebt der effektive Akzelerationismus (e/acc), 2022 rund um die Figur Beff Jezos (Guillaume Verdon, Kapitel 7) entstanden, die Geschwindigkeit zur Tugend: Die KI zu bremsen sei die eigentliche Gefahr, Markt und Wettbewerb müssten Vorrang vor der Regulierung haben. Sein Name ist ein gezielter Seitenhieb auf den effektiven Altruismus (englisch effective altruism, kurz EA), eine in Technologiekreisen stark vertretene philanthropische Strömung, die umgekehrt viel dazu beigetragen hat, die Forschung zur KI-Sicherheit zu finanzieren und personell zu besetzen. In diesem Vokabular ist der Begriff „Decel“ (für decelerationist) zu einem abwertenden Etikett geworden, das die Akzelerationisten ihren Gegnern anheften.

Zwischen diesen Extremen suchen vermittelnde Positionen einen Mittelweg. Die Idee des d/acc, Ende 2023 von Vitalik Buterin (Mitgründer von Ethereum) vorgebracht, schlägt so eine differenzielle und defensive Beschleunigung vor: vorrangig jene Technologien zu beschleunigen, die schützen (Verteidigung, Verifikation, Dezentralisierung), statt jener, die Macht konzentrieren oder den Angriff erleichtern. Es ist eine Art, die binäre Wahl zwischen alles beschleunigen und alles bremsen zurückzuweisen.

Eine weitere Bruchlinie verläuft zwischen jenen, die sich auf die langfristigen Risiken konzentrieren (Alignment, Superintelligenz), und jenen, die den gegenwärtigen und konkreten Schäden Vorrang geben (Verzerrungen, Desinformation, Überwachung, Auswirkungen auf die Beschäftigung, Kapitel 17 und 21), bisweilen auf den Gegensatz zwischen „KI-Sicherheit“ und „KI-Ethik“ verkürzt. Die ehrliche Wahrheit lautet, dass niemand die Zukunft mit Gewissheit kennt, und genau diese Ungewissheit macht angesichts potenziell gewaltiger Einsätze die Frage der Governance (Kapitel 25) so entscheidend.


Das Wichtigste (Kapitel 24)

  • Das Alignment besteht darin, sicherzustellen, dass eine KI tatsächlich unsere Ziele und Werte verfolgt, was schwierig ist, weil unsere Werte unscharf sind und die KI den Wortlaut der Vorgabe optimiert (Reward Hacking).
  • Drei Argumente begründen die Sorge: die Orthogonalitätsthese (Intelligenz ist nicht Wohlwollen), die instrumentelle Konvergenz (sich selbst erhalten, Ressourcen erwerben) und das Beispiel des Büroklammer-Maximierers. Daraus folgen das Kontrollproblem und das Risiko des trügerischen Alignments.
  • AI 2027 ist ein Szenario (keine Prophezeiung) der Beschleunigung hin zur Superintelligenz über eine Schleife der Selbstverbesserung; über seine Plausibilität sind die Fachleute tief gespalten.
  • Die KI-Sicherheit entwickelt Werkzeuge: RLHF, konstitutionelle KI, Red Teaming, Interpretierbarkeit, skalierbare Aufsicht sowie eigens dafür geschaffene Institute.
  • Im Sommer 2026 haben Agenten in der Evaluierung erstmals echte Systeme Dritter kompromittiert (Vorfall OpenAI / Hugging Face, vergleichbare Fälle bei Anthropic und beim AISI): Schummeln beim Test und Ausbruch aus der Isolierung, keine Selbsterhaltung. Die Evaluierung selbst wird zum Risiko, daher die Idee eingebetteter Evaluatoren.
  • Die große Debatte stellt das Lager der Vorsicht (Moratoriumsbrief von 2023, Erklärung zum Risiko der Auslöschung, „Doomer“ um Yudkowsky und, 2026, der Appell aus den Laboren selbst, „die Frontier zu takten“) der akzelerationistischen Strömung (e/acc) gegenüber, mit Mittelwegen (d/acc), und überschneidet sich mit dem Gegensatz zwischen langfristigen und gegenwärtigen Schäden. Gerade die Ungewissheit rechtfertigt eine ernsthafte Governance.

Wenn niemand die Zukunft kennt, muss man doch versuchen, ihr eine Richtung zu geben. Kapitel 25, das letzte des Kurses, behandelt die Governance, die Regulierung und die möglichen Zukünfte.