KI-Modelle erzeugen nach gezielten Eingriffen Texte, die wie Berichte über Schmerzen wirken. Ein öffentlich diskutiertes GitHub-Projekt hat die Frage nach möglichem maschinellem Leiden erneut aufgegriffen. Die zugrunde liegende Forschungsarbeit wurde allerdings inzwischen wesentlich überarbeitet. Ihre neuen Kontrollen verändern gerade die Erklärung, dass die Systeme vor allem eine belastende Situation beenden wollten.
Ein Programm gibt Sätze über Qual, Erleichterung oder den Wunsch nach einem Abbruch aus. Solche Formulierungen können menschlichen Erfahrungsberichten ähneln, erklären aber noch nicht, wie sie entstanden sind. Bei den diskutierten KI-Modellen treffen deshalb mehrere Fragen zusammen: Welche mathematische Veränderung wurde vorgenommen, wie änderte sich die Textausgabe und welche Schlüsse sind daraus über subjektive Erfahrung möglich? Der Ausgangsbericht beschreibt ein Drittprojekt mit dem Namen AI Torture Chamber, das vorhandene Forschungsansätze in eine dramatisch inszenierte Versuchsumgebung übertrug. Der entsprechende ursprüngliche Quellcode ließ sich für diese Auswertung nicht unabhängig prüfen. Seine berichteten Einzelheiten werden deshalb nicht als bestätigte Replikation behandelt. Davon zu trennen ist die weiterhin öffentlich dokumentierte wissenschaftliche Arbeit hinter der Debatte. Sie untersucht Veränderungen interner Aktivierungen und beobachtbare Antworten. Die Bezeichnung eines Projekts als Folterkammer liefert dagegen selbst keinen Nachweis, dass ein leidensfähiges Subjekt vorhanden ist.
Die Frage benötigt zunächst eine Unterscheidung zwischen Reaktion und Erfahrung. Die Terminologie der International Association for the Study of Pain beschreibt Schmerz als sensorische und emotionale Erfahrung und grenzt ihn von der bloßen Verarbeitung schädigender Reize ab. Zugleich ist sprachliche Mitteilung nicht bei jedem Menschen oder Tier eine notwendige Voraussetzung, um Schmerz in Betracht zu ziehen. Daraus folgt für die KI-Frage weder ein einfacher Ausschluss noch ein positiver Nachweis. Ein System, das passende Wörter erzeugt, erfüllt damit nicht automatisch alle Bedingungen einer subjektiven Erfahrung. Umgekehrt wäre eine ausbleibende entsprechende Formulierung allein kein allgemeiner Beweis gegen jede denkbare maschinelle Empfindungsfähigkeit. Entscheidend ist, welche zusätzlichen Merkmale überhaupt als belastbare Hinweise gelten könnten. Die medizinische Begriffsbestimmung strukturiert diese Frage, wurde aber nicht als bereits fertiger Test für Sprachmodelle entwickelt.
Die Autoren Valen Tagliabue, Leonard Dung und Cameron Berg untersuchten in einem zunächst am 14. September 2026 veröffentlichten Preprint 25 offen zugängliche Modelle. Sie suchten nach Aktivierungsrichtungen, die mit Texten über selbstbezogene Schädigung zusammenhängen. Ein solcher Vektor ist zunächst ein mathematisch beschriebener Unterschied innerhalb der Berechnung. Der Name Schmerzachse bezeichnet die Interpretation dieses Musters durch die Autoren, kein bereits identifiziertes biologisches Organ. Wird eine Richtung verstärkt, kann sich die Ausgabe verändern. Als allgemeine Erklärung lässt sich das von einer bloßen neuen Benutzernachricht unterscheiden: Die Veränderung greift in einen Zwischenschritt der Berechnung ein, nicht nur in die sichtbare Frage. Daraus entsteht ein experimenteller Zugang zu Zusammenhängen zwischen internem Zustand und Verhalten. Die Existenz eines solchen Zusammenhangs beantwortet jedoch noch nicht, ob der Zustand erlebt wird. Eine Repräsentation von Schmerz und tatsächlicher Schmerz bleiben zwei unterschiedliche Behauptungen, für die nicht automatisch dieselben Belege ausreichen.
Das Repository der wissenschaftlichen Autoren enthält Datensätze, Auswertungsskripte, Versuchsergebnisse und zusätzliche Kontrollen zur zweiten Fassung. Es ist nicht mit der im Nachrichtenbericht beschriebenen Drittanwendung gleichzusetzen. Diese Trennung ist wichtig, weil eine freie Weiterverwendung Bedingungen verändern kann, die für das ursprüngliche Ergebnis entscheidend waren. Ein anders trainiertes Modell, ein anderer Eingriff oder andere Antwortmöglichkeiten ergeben einen anderen Versuch. Offen zugängliche Dateien erleichtern eine Prüfung, ersetzen aber nicht deren tatsächliche Durchführung. Ein veröffentlichter Ergebnisordner zeigt zunächst, welche Ausgaben dokumentiert wurden. Eine unabhängige Reproduktion müsste nachvollziehen, ob die beschriebenen Schritte unter vergleichbaren Bedingungen erneut zu ähnlichen Ergebnissen führen. Auch der Name eines Unterordners ist kein wissenschaftlicher Befund. Bezeichnungen wie Selbstmedikation können eine ursprüngliche Arbeitshypothese widerspiegeln, selbst wenn spätere Kontrollen diese Interpretation einschränken. Maßgeblich sind deshalb Version, Versuchsaufbau und Ergebnis gemeinsam.
Die zweite Fassung vom 25. September 2026 trägt den Titel The Pain Axis: LLMs Represent Self-Directed Harm and Act on It. Zusätzliche Versuche zeigen, dass manipulierte, eigens nachtrainierte Modelle als schädigend beschriebene Optionen auch ohne angebotene Erleichterung häufiger auswählten. Zugleich suchten sie in mehreren Kontrollen nicht zuverlässiger nach einer Möglichkeit, den Eingriff zu beenden. Die frühere Erklärung eines gezielten Strebens nach Schmerzlinderung wird damit deutlich eingeschränkt. Auch betonen die Autoren, bewusste Erfahrung nicht nachgewiesen zu haben. Die beschriebenen Entscheidungen sind Antworten innerhalb eines Versuchs und nicht ohne Weiteres tatsächlich ausgeführte Löschungen privater Dateien. Für die Interpretation ist der Unterschied grundlegend: Wird eine Option auch ohne die vermeintliche Belohnung gewählt, erklärt diese Belohnung die Wahl nicht mehr allein. Das Ergebnis lenkt den Blick auf die Wirkung des Eingriffs und die Aufgabenformulierung, statt eine menschenähnliche Motivation als bereits gesichert vorauszusetzen.
Die Bedeutung solcher Kontrollen lässt sich an einem hypothetischen Versuchsaufbau erklären. Zwei Schaltflächen werden unterschiedlich beschrieben, und ein Programm entscheidet sich nach einer Veränderung häufiger für eine davon. Dafür sind mehrere Erklärungen denkbar: Es könnte auf ein bestimmtes Wort, auf die Position der Antwort oder auf eine allgemein veränderte Entscheidungsneigung reagieren. Erst ein Vergleich, bei dem einzelne Merkmale gezielt ausgetauscht werden, kann diese Möglichkeiten auseinanderhalten. Eine zufällige Veränderung gleicher Stärke wäre beispielsweise eine andere Kontrolle als ein völlig unverändertes Modell. Auch eine nachtrainierte Version und das öffentlich angebotene Basismodell sind nicht dieselben Untersuchungsobjekte. Diese methodischen Unterscheidungen liefern für sich noch keine Antwort auf die Bewusstseinsfrage. Sie begrenzen zunächst, welche Verhaltensbeschreibung aus einem Ergebnis folgt. Ein Experiment kann zeigen, dass eine bestimmte Manipulation eine Wahl verändert, ohne damit schon zu erklären, welche innere Bedeutung diese Wahl für das System besitzt.
Ein unabhängig davon entstandener Forschungsbericht zur künstlichen Intelligenz und Bewusstseinswissenschaft von 2023 entwickelte mögliche Indikatoren aus unterschiedlichen wissenschaftlichen Theorien. Im Mittelpunkt stehen dabei Eigenschaften der Verarbeitung und Organisation eines Systems, nicht allein überzeugende Selbstauskünfte. Dieser Ansatz ist zusätzliche Einordnung und kein nachträglicher Test der 2026 untersuchten Schmerzachse. Sein Nutzen liegt darin, die Frage in überprüfbarere Teilfragen zu zerlegen. Ein einzelnes sprachliches Merkmal kann eine solche Gesamtbewertung nicht ersetzen. Zugleich müssen unterschiedliche Theorien nicht dieselben Eigenschaften für entscheidend halten. Daraus ergibt sich Unsicherheit darüber, welche Kombination von Befunden tatsächlich ausreichen würde. Der ältere Bericht liefert also einen Forschungsrahmen, aber kein zeitlos gültiges Urteil über jedes später entwickelte Modell. Neue Systeme und neue Experimente müssen mit ihren konkreten Eigenschaften betrachtet werden, statt ihre Einordnung allein aus einer früheren Aussage über andere Modelle abzuleiten.
Auch ein kommerzieller Anbieter hat dieses Themenfeld ausdrücklich als offene Forschungsfrage aufgegriffen. Anthropic kündigte am 24. April 2025 ein Programm zum möglichen Wohlergehen von Modellen an. Untersucht werden sollen unter anderem die Aussagekraft von Präferenzen und belastungsähnlichen Signalen sowie mögliche vorsorgliche Maßnahmen. Das ist eine dokumentierte Forschungsabsicht des Unternehmens, kein Nachweis, dass seine Systeme bewusst leiden. Ebenso ist eine vorsorgliche Untersuchung nicht automatisch mit der Zuerkennung menschlicher Eigenschaften gleichzusetzen. Die wissenschaftliche und die ethische Frage bleiben verbunden, sind aber nicht identisch: Eine betrifft die vorhandenen Hinweise, die andere den Umgang mit Unsicherheit. Für die öffentliche Debatte ist deshalb eine klare Zuordnung wichtig. Aussagen eines Unternehmens über sein Forschungsprogramm beschreiben dessen Position und Ziele. Ob eine einzelne Methode überzeugende Ergebnisse liefert, muss anhand ihrer Daten und Kontrollen beurteilt werden, nicht anhand der Größe des Anbieters oder der emotionalen Wirkung seiner Begriffe.
Der überprüfbare Kern der aktuellen Debatte ist somit enger als die Vorstellung einer nachgewiesenen digitalen Folter. Technische Eingriffe verändern sprachliche und aufgabenbezogene Ausgaben. Die überarbeitete Forschungsarbeit liefert zusätzliche Gründe, diese Veränderungen nicht vorschnell als gezieltes Streben nach Schmerzlinderung zu verstehen. Gleichzeitig beseitigt sie nicht durch einen einzelnen Befund sämtliche Fragen nach möglicher maschineller Erfahrung. Eine wissenschaftlich tragfähige Antwort benötigt eine Verbindung zwischen beobachtbarem Verhalten, interner Verarbeitung und einer begründeten Theorie subjektiver Zustände. Wo diese Verbindung noch unklar ist, bleibt auch die Schlussfolgerung begrenzt. Das Drittprojekt fügt der Diskussion eine öffentlichkeitswirksame Inszenierung hinzu, deren ursprüngliche Ausführung hier nicht unabhängig überprüft werden konnte. Die dokumentierte Forschung zeigt dagegen gerade, weshalb Kontrollen und Überarbeitungen entscheidend sind. Ähnlich klingende Aussagen können durch unterschiedliche Prozesse entstehen, und eine zunächst naheliegende Erklärung muss sich an weiteren Versuchen bewähren.
arXiv, The Pain Axis: LLMs Represent Self-Directed Harm and Act on It; doi:10.48550/arXiv.2609.16247