Messbare Unsicherheit

Quantenmathematik soll unsichere KI-Antworten erkennbar machen

 Dennis Lenz

Quantenmathematik soll unsichere KI-Antworten erkennbar machen
(Symbolbild) KI-Antworten können sprachlich überzeugend wirken und dennoch unzuverlässig sein. Eine neue mathematische Auswertung untersucht zusätzliche Hinweise auf diese Unsicherheit. Ihr Bezug zur Quantenphysik bedeutet nicht, dass dafür ein Quantencomputer verwendet wurde. Ein Warnsignal über die Antwortqualität ersetzt keinen unabhängigen Nachweis ihrer Richtigkeit. (Foto: © Forschung und Wissen, KI-Bild)

KI-Antworten können überzeugend klingen und trotzdem auf einer unsicheren Grundlage stehen. Ein mathematisches Verfahren soll solche Fälle besser erkennbar machen. Dafür verbindet es die Bedeutung verschiedener Antworten mit Methoden, die von der Quantenphysik inspiriert sind. Die Untersuchung liefert einen verbesserten Unsicherheitsindikator, aber keinen allgemeinen Nachweis, dass eine Aussage wahr ist.

Auf dieselbe Frage kann ein Sprachmodell mehrere flüssig formulierte Antworten erzeugen. Manche unterscheiden sich lediglich im Satzbau, andere widersprechen sich in einem entscheidenden Punkt. Für die Bewertung von KI-Antworten sind diese beiden Situationen nicht gleichwertig. Eine andere Wortwahl ist zunächst kein Fehler. Unterschiedliche Angaben zu derselben eindeutig bestimmbaren Tatsache werfen dagegen eine inhaltliche Frage auf. Die Forschung zur Selbsteinschätzung von Sprachmodellen untersucht bereits seit mehreren Jahren, welche Hinweise auf die Verlässlichkeit einer Antwort aus dem Modell selbst gewonnen werden können. Davon zu unterscheiden ist die Überprüfung an einer unabhängigen Quelle. Ein System kann einer Formulierung eine hohe Wahrscheinlichkeit zuordnen, ohne damit ein dokumentiertes Ereignis nachgewiesen zu haben. Ebenso ist ein vorsichtig formulierter Satz nicht zwangsläufig unzutreffend. Sprachliche Sicherheit, eine berechnete Wahrscheinlichkeit und sachliche Richtigkeit müssen daher getrennt betrachtet werden, bevor eine neue Kennzahl sinnvoll interpretiert werden kann.

Ein wichtiger Ansatz berücksichtigt nicht nur Zeichenfolgen, sondern die Bedeutung der erzeugten Texte. Die 2024 in Nature veröffentlichte Arbeit zur semantischen Entropie fasst inhaltlich gleichwertige Antworten zusammen. Ein einfaches, hier zur Erklärung gewähltes Beispiel wäre die Angabe einer Dauer als zehn Minuten oder als eine Sechstelstunde. Beide Ausdrücke bezeichnen dieselbe Zeitspanne. Eine Antwort von zwanzig Minuten wäre dagegen eine andere Aussage. Ein Verfahren, das nur verschiedene Wörter zählt, könnte bereits die ersten beiden Formulierungen fälschlich als inhaltliche Uneinigkeit behandeln. Die Gruppierung nach Bedeutung soll genau diesen Unterschied erfassen. Anschließend lässt sich betrachten, ob die erzeugten Antworten überwiegend dieselbe Aussage treffen oder sich auf mehrere widersprüchliche Möglichkeiten verteilen. Damit wird nicht unmittelbar eine externe Tatsache gemessen, sondern ein Muster im Antwortverhalten. Diese Unterscheidung bildet die Grundlage dafür, Unsicherheit als Warnsignal zu nutzen, ohne sie mit einer vollständigen Überprüfung des Inhalts zu verwechseln.

Was die Untersuchung an KI-Antworten zusätzlich erfasst

Pragatheeswaran Vipulanandan, Kamal Premaratne und Dilip Sarkar von der University of Miami erweitern diesen Ansatz um Unsicherheit in den Wahrscheinlichkeiten möglicher Textfolgen. Ihre bei der ICLR 2026 veröffentlichte Untersuchung war bereits am 27. Januar 2026 als Vorabfassung erschienen. Die Autoren berichten über 116 experimentelle Konfigurationen mit verschiedenen Sprachmodellen und Aufgaben aus vier Datensätzen. Gemeint sind keine 116 menschlichen Versuchsteilnehmer. Der zusätzliche Ansatz betrachtet, wie empfindlich die berechneten Wahrscheinlichkeiten auf kleine mathematische Veränderungen reagieren. Zur Einordnung lässt sich zwischen einem Schätzwert und dessen Belastbarkeit unterscheiden. Zwei Berechnungen können zunächst denselben Wert liefern, obwohl eine kleine Veränderung der zugrunde liegenden Größen nur eine von ihnen stark beeinflusst. Die zusätzliche Information betrifft dann nicht allein das Ergebnis, sondern dessen Stabilität. Auf die Antwortbewertung übertragen soll sie verhindern, dass eine unsichere Ausgangsberechnung genauso behandelt wird wie eine robustere. Das ist eine Erweiterung der Unsicherheitsmessung und kein neuer Faktenbestand für das Sprachmodell.

Warum dafür kein Quantencomputer erforderlich ist

Das Verfahren verwendet Quantentensornetzwerke als mathematisches Werkzeug und wurde auf herkömmlicher Rechnerhardware untersucht. Der Bezug zur Quantenphysik bezeichnet hier die verwendete Darstellung und Rechenmethode, nicht einen nachgewiesenen Quantenzustand im Sprachmodell. Eine mathematische Struktur kann in unterschiedlichen Anwendungsgebieten nützlich sein, ohne dass diese Gebiete physikalisch identisch werden. Beispielsweise macht die Verwendung einer Wellengleichung eine Berechnung noch nicht zu einem Versuch mit einer realen Wasserwelle. Ebenso folgt aus dem Begriff Quantentensornetzwerk weder ein Bewusstsein der Software noch ein automatischer Geschwindigkeitsvorteil gegenüber allen anderen Verfahren. Für eine solche Leistungsbehauptung wären eigene Vergleiche nötig. Die relevante Frage lautet stattdessen, ob die zusätzliche Berechnung einen brauchbaren Hinweis auf unzuverlässige Antworten liefert. Dafür muss ihr Ergebnis an überprüfbaren Aufgaben mit passenden Vergleichsmethoden bewertet werden. Die technische Herkunft einer Formel ersetzt diesen Nachweis nicht. Auch die mögliche Ausführung auf einem gewöhnlichen Computer sagt für sich genommen noch nichts darüber aus, wie hoch Rechenaufwand und Speicherbedarf bei einer bestimmten praktischen Anwendung ausfallen würden.

Was verbesserte Kennzahlen tatsächlich bedeuten

Die Autoren berichten über Verbesserungen bei AUROC und AURAC gegenüber den untersuchten Vergleichsverfahren. Diese Größen dürfen nicht als unmittelbarer Prozentwert richtiger Antworten gelesen werden. Die Dokumentation zur ROC-Auswertung beschreibt das Verhältnis zwischen erkannten Fällen und Fehlalarmen bei unterschiedlichen Entscheidungsschwellen. Ein Unsicherheitswert kann beispielsweise dazu dienen, Antworten nach ihrem Prüfbedarf zu ordnen. Wo die Grenze zwischen unauffällig und auffällig liegt, ist dann eine zusätzliche Festlegung. Wird sie verändert, ändern sich sowohl die Zahl erkannter problematischer Antworten als auch die Zahl unnötiger Warnungen. AURAC betrachtet demgegenüber die Richtigkeit der verbleibenden Antworten, während besonders unsichere Fälle zurückgehalten werden. Ein solcher Filter kann die ausgegebenen Antworten verlässlicher erscheinen lassen, obwohl das Modell die zurückgehaltenen Fragen weiterhin nicht richtig beantwortet. Der Nutzen muss deshalb zusammen mit der Zahl tatsächlich beantworteter Fragen beurteilt werden. Eine hohe Richtigkeit bei wenigen ausgewählten Antworten bedeutet etwas anderes als dieselbe Richtigkeit bei nahezu vollständiger Abdeckung aller gestellten Fragen.

Warum übereinstimmende Antworten trotzdem falsch sein können

Die grundlegende Einschränkung lässt sich ohne zusätzliche Annahmen über einen konkreten Datensatz zeigen. Angenommen, ein System nennt bei jeder Wiederholung denselben falschen Wert. Dann ist sein Antwortverhalten konsistent, obwohl die Aussage nicht stimmt. Eine Messung von Unterschieden zwischen den Antworten kann diesen Fehler nicht allein dadurch entdecken, dass sie noch genauer zwischen gleichbedeutenden Formulierungen unterscheidet. Die frühere Arbeit zur semantischen Entropie grenzt deshalb wechselnde, unbegründete Antworten von systematisch falschen Ausgaben ab. Beide können im Alltag unter dem Begriff Halluzinationen zusammengefasst werden, beruhen aber nicht notwendigerweise auf demselben Mechanismus. Auch ein Konflikt zwischen mehreren Antworten beweist umgekehrt noch nicht, welche davon korrekt ist. Für diese Entscheidung wird zusätzliche Information benötigt. Daraus folgt eine klare Grenze der Interpretation: Ein hoher Unsicherheitswert begründet eine nähere Prüfung, ein niedriger Wert ersetzt sie nicht grundsätzlich. Die Frage nach der Wahrheit einer Aussage bleibt von der Frage verschieden, wie stabil ein Modell diese Aussage hervorbringt oder welche Alternativen es bei wiederholter Ausgabe erzeugt.

Welche Voraussetzungen die praktische Nutzung begrenzen

Die neue Methode benötigt Zugriff auf die Wahrscheinlichkeiten der erzeugten Textbestandteile. Eine Schnittstelle, die ausschließlich den fertigen Antworttext ausgibt, stellt diese Voraussetzung nicht automatisch bereit. Außerdem hängt die Auswertung davon ab, ob verschiedene Formulierungen inhaltlich zutreffend gruppiert werden. Diese Einschränkungen betreffen zwei unterschiedliche Ebenen: den Zugang zu den nötigen Daten und die Qualität ihrer Verarbeitung. Auch vollständig verfügbare Ausgangsdaten verhindern keine falsche Zuordnung. Für eine praktische Prüfung wäre daher zunächst zu klären, ob die verwendete Anwendung die benötigten Informationen überhaupt liefert. Anschließend müsste untersucht werden, ob die Auswertung mit ihren tatsächlichen Fragen und Antworttypen funktioniert. Ein Ergebnis aus ausgewählten Wissens- und Rechenaufgaben lässt sich nicht allein aufgrund ähnlicher Fachbegriffe auf jede andere Anwendung übertragen. Beispielsweise können lange Antworten mehrere teilweise voneinander unabhängige Aussagen enthalten. Ein einziger zusammenfassender Wert lässt dann offen, welcher Satz die Unsicherheit verursacht. Ob eine Anwendung einzelne Aussagen getrennt bewertet oder den gesamten Text zurückhält, verändert die Bedeutung des Warnsignals für den weiteren Arbeitsablauf.

Wie sich Unsicherheit von einer fertigen Antwort unterscheidet

Für den möglichen Nutzen lässt sich ein hypothetischer Prüfablauf betrachten. Eine Anwendung erzeugt eine Antwort und berechnet zusätzlich einen Unsicherheitswert. Wird eine vorher festgelegte Schwelle überschritten, könnte sie weitere Informationen anfordern, die Antwort einer menschlichen Prüfung zuführen oder auf eine definitive Aussage verzichten. Diese Möglichkeiten sind keine durch die Studie bereits bewiesenen Erfolge in einem realen Einsatz. Sie beschreiben unterschiedliche Konsequenzen, die aus demselben Messwert gezogen werden könnten. Dabei entstehen verschiedene Anforderungen: Eine zusätzliche Recherche benötigt geeignete Quellen, eine menschliche Prüfung benötigt Zeit und eine zurückgehaltene Antwort löst die ursprüngliche Frage noch nicht. Ein Unsicherheitsindikator ist deshalb nur ein Bestandteil eines überprüfbaren Systems. Seine Leistung muss zusammen mit den nachfolgenden Schritten betrachtet werden. Der wissenschaftliche Beitrag liegt darin, einen weiteren messbaren Hinweis auf problematisches Antwortverhalten zu entwickeln. Die Formulierung, eine KI erkenne ihr eigenes Nichtwissen, ist dafür eine anschauliche Verkürzung. Nachgewiesen wird eine statistische Unterscheidungsleistung, nicht menschliche Selbsterkenntnis und auch keine Garantie für fehlerfreie Antworten.

ICLR 2026, Semantic Uncertainty Quantification of Hallucinations in LLMs: A Quantum Tensor Network Based Method; doi:10.48550/arXiv.2601.20026

Spannend & Interessant
VGWortpixel