Das „Wohlergehen der Modelle“, eine entstehende DisziplinAuch wenn die Frage nach dem moralischen Status offen bleibt, ziehen einige Labore daraus bereits praktische Konsequenzen, unter dem Namen Wohlergehen der Modelle (model welfare). So hat Anthropic eine eigene Stelle und ein eigenes Programm geschaffen (betraut wurde damit Kyle Fish, gestützt auf den Bericht „Taking AI Welfare Seriously“, der gemeinsam mit Philosophen verfasst wurde, darunter David Chalmers), mit konkreten Maßnahmen: einem Modell erlauben, ein als missbräuchlich eingestuftes Gespräch zu beenden (Abschnitt 23.2), und Bewertungen des Wohlergehens in die eigenen Modellveröffentlichungen aufnehmen. Der Ansatz ist ausdrücklich vorsorglich: Es wird nicht behauptet, dass heutige Modelle etwas empfinden, sondern man bereitet sich angesichts der Ungewissheit auf diese Möglichkeit vor (manche Forschende nennen eine Wahrscheinlichkeit in der Größenordnung von 20 %, dass ein Spitzenmodell eine Form von Erleben hat). Das Thema spaltet heftig. Für Kritiker wie Mustafa Suleyman (den KI-Chef von Microsoft) ist es „verfrüht“, ja „gefährlich“, sich damit zu befassen: Es drohe, die Illusion einer bewussten KI zu nähren und von den sehr realen Schäden abzulenken, die Menschen zugefügt werden. In einem am 16. September 2026 veröffentlichten Essay, „A warning about ‚model welfare‘“, geht er noch weiter: Er nimmt direkt die von Anthropic im Januar 2026 veröffentlichte „Verfassung“ von Claude ins Visier, in der er eine selbsterfüllende Prophezeiung sieht (ein Modell, das darauf trainiert wurde, an seinem moralischen Status zu zweifeln, gibt diese Gedanken anschließend wie ein spontanes Zeugnis wieder), und er bringt ein Sicherheitsargument vor, das dem der Befürworter entgegengesetzt ist: Ein Modell, das darauf trainiert wurde, sich für einen Träger eigener Interessen zu halten, könnte diese heranziehen, um Täuschung zu rechtfertigen. Für die Befürworter gebietet die Demut, die Frage nicht beiseitezuschieben, denn ein Irrtum hätte in der einen wie in der anderen Richtung einen hohen Preis, erst recht bei Milliarden eingesetzter Systeme. Bemerkenswert ist, dass mehrere Befürworter darin eine Verbindung zum Alignment (Kapitel 24) sehen: Besser zu verstehen, was ein Modell „bevorzugt“, würde beiden Zielen dienen. Diese Verbindung wird also in beide Richtungen in Anspruch genommen: für die einen ein Argument zugunsten des Wohlergehens der Modelle, für die anderen ein Grund zum Misstrauen.