Blick ins Innere

KI-Chatbots klingen bei falschen Antworten oft besonders sicher

 Dennis Lenz

KI-Chatbots klingen bei falschen Antworten oft besonders sicher
(Symbolbild) KI-Chatbots geben manchmal falsche Antworten mit großer Sicherheit und zweifeln umgekehrt an richtigen. Forscher der University of California in Riverside haben untersucht, was dabei im Inneren der Sprachmodelle geschieht. Selbstsicherheit und Richtigkeit werden demnach von unterschiedlichen inneren Merkmalen gesteuert. Das eröffnet Wege, Modelle gezielt vorsichtiger zu machen, wenn sie wahrscheinlich falsch liegen. (Foto: © Forschung und Wissen, KI-Bild)

KI-Chatbots geben falsche Antworten oft mit großer Überzeugung und warnen umgekehrt vor Unsicherheit, obwohl sie richtig liegen. Forscher der University of California in Riverside haben nun herausgefunden, warum. In den untersuchten Sprachmodellen werden Selbstsicherheit und Richtigkeit von unterschiedlichen inneren Merkmalen gesteuert. Die Selbstsicherheit eines Modells ist deshalb kein verlässlicher Hinweis darauf, ob seine Antwort stimmt.

Große Sprachmodelle wie ChatGPT, Gemini oder Llama beantworten täglich Millionen Fragen, von Hausaufgaben über Reiseplanung bis zu Gesundheitsfragen. Dabei formulieren sie ihre Antworten meist flüssig und überzeugend, unabhängig davon, ob sie stimmen. Nutzer orientieren sich deshalb häufig an der Tonlage: Klingt ein Modell sicher, wird die Antwort eher geglaubt, äußert es Zweifel, wird sie eher hinterfragt. Genau diese Annahme ist jedoch problematisch. Sprachmodelle erzeugen immer wieder falsche Aussagen, die sogenannten Halluzinationen, und tragen sie mit demselben selbstbewussten Ton vor wie richtige. Umgekehrt kommt es vor, dass ein Modell Zweifel anmeldet, obwohl seine Antwort korrekt ist. Für Entwickler ist das ein zentrales Problem, weil Sprachmodelle zunehmend Entscheidungen vorbereiten und eigenständig Aufgaben erledigen. Sie benötigen bessere Wege, um festzustellen, wann die Antworten einer KI vertrauenswürdig sind und wann nicht. Ein Team um den Informatiker Het Patel von der University of California in Riverside hat deshalb in das Innere von Sprachmodellen geschaut.

Die Forscher untersuchten zwei offene Sprachmodelle, deren interne Abläufe sich von außen analysieren lassen: Llama-3.1-8B von Meta und Gemma-2-9B von Google. Sie legten beiden Modellen Multiple-Choice-Fragen vor und sortierten die Antworten in vier Gruppen, je nachdem, ob sie richtig oder falsch waren und ob das Modell dabei sicher oder unsicher wirkte. Anschließend nutzten sie Werkzeuge namens Sparse Autoencoder, um die innere Aktivität der Modelle zu zerlegen und zu erkennen, welche Merkmale bei welchem Verhalten aktiv werden, wie die University of California Riverside in ihrer Mitteilung vom 23. September beschreibt. Solche Autoencoder übersetzen die schwer durchschaubaren Zahlenmuster eines neuronalen Netzes in einzelne, besser interpretierbare Merkmale. So lässt sich beobachten, welche Bausteine im Modell aufleuchten, wenn es eine Frage beantwortet, und ob sich diese Bausteine bei sicheren und unsicheren Antworten unterscheiden.

Wo KI-Chatbots Sicherheit und Wissen trennen

Das zentrale Ergebnis: Selbstsicherheit und Richtigkeit entstehen in den untersuchten Modellen aus unterschiedlichen inneren Merkmalen. Die Merkmale, die mit einem sicheren Auftreten verbunden sind, überschneiden sich nur teilweise mit jenen, die mit einer korrekten Antwort einhergehen. Beide Eigenschaften können deshalb auseinanderlaufen, und genau das erklärt die beiden typischen Fehlerbilder. Im einen Fall ist das Merkmal für Sicherheit aktiv, obwohl die Wissensgrundlage für die Antwort fehlt, und das Modell trägt einen Fehler selbstbewusst vor. Im anderen Fall liegt das Modell richtig, aber das Sicherheitsmerkmal bleibt schwach, sodass es unnötige Zweifel äußert. Die Forscher sehen darin einen Widerspruch zu der verbreiteten Annahme, die Selbstsicherheit eines Modells sei ein verlässlicher Anzeiger für die Richtigkeit seiner Antworten. Für Nutzer bedeutet das: Ein souveräner Ton sagt wenig darüber aus, ob eine Antwort stimmt. Die Prüfung wichtiger Aussagen anhand verlässlicher Quellen bleibt unverzichtbar.

Innere Merkmale gezielt verstellen

Die Entdeckung ist nicht nur eine Erklärung, sondern könnte auch zu einer Lösung führen. Wenn Sicherheit und Richtigkeit an getrennten inneren Merkmalen hängen, lassen sich diese Merkmale womöglich gezielt beeinflussen. Ziel wäre ein Modell, das sich sicher gibt, wenn es richtig liegt, und vorsichtiger wird, wenn es wahrscheinlich falsch liegt. Patel sieht in dem Ansatz zudem eine allgemeine Methode: Forscher könnten nach inneren Merkmalen suchen, die mit anderen erwünschten oder unerwünschten Verhaltensweisen verbunden sind, und prüfen, ob sich diese durch Eingriffe verstärken oder abschwächen lassen. Solche gezielten Eingriffe in die innere Aktivität von Sprachmodellen gelten als vielversprechendes Werkzeug, um KI-Systeme transparenter und steuerbarer zu machen. Die Arbeit ist als Vorabveröffentlichung auf dem Preprint-Server arXiv erschienen und wurde noch nicht von unabhängigen Gutachtern geprüft. Die Ergebnisse gelten zudem zunächst nur für die beiden untersuchten, vergleichsweise kleinen Modelle.

Warum Selbstüberschätzung bei KI gefährlich ist

Die Frage, wie gut eine KI ihre eigene Unsicherheit einschätzt, gewinnt an Bedeutung, je mehr Verantwortung Sprachmodelle übernehmen. In der Medizin, im Recht oder in der Finanzberatung kann eine selbstbewusst vorgetragene Falschaussage erheblichen Schaden anrichten, wenn sie ungeprüft übernommen wird. Besonders heikel ist das bei sogenannten KI-Agenten, die mehrere Arbeitsschritte selbstständig hintereinander ausführen. Ein falsches Sicherheitssignal entscheidet dort darüber, ob ein Fehler rechtzeitig erkannt oder in die nächsten Schritte weitergetragen wird. Auch andere Forschungsgruppen arbeiten daran, Sprachmodelle ehrlicher über ihre Unsicherheit zu machen. Forscher des MIT hatten im Frühjahr gezeigt, dass bestimmte Trainingsverfahren Modelle dazu verleiten, jede Frage mit großer Sicherheit zu beantworten, weil sie für richtige Antworten belohnt und für falsche bestraft werden, ohne Zwischentöne zu berücksichtigen. Die Arbeit aus Riverside ergänzt diesen Blick um eine Erklärung dafür, was im Inneren der Modelle geschieht.

Was Nutzer daraus mitnehmen können

Für den Alltag mit Chatbots ergeben sich aus der Studie einige praktische Folgerungen. Der Ton einer Antwort ist kein Qualitätsmerkmal, eine besonders bestimmt formulierte Aussage verdient nicht automatisch mehr Vertrauen als eine vorsichtige. Wo es um Gesundheit, Geld oder rechtliche Fragen geht, sollten Antworten von Sprachmodellen mit unabhängigen Quellen abgeglichen werden. Hilfreich kann es auch sein, einem Chatbot dieselbe Frage anders formuliert erneut zu stellen und die Antworten zu vergleichen, weil widersprüchliche Ergebnisse auf Unsicherheit hindeuten. Die Forscher aus Riverside wollen ihren Ansatz nun auf größere Modelle und weitere Aufgabentypen übertragen. Sollte sich bestätigen, dass sich Selbstsicherheit und Richtigkeit gezielt aneinander angleichen lassen, könnten künftige Chatbots deutlicher signalisieren, wann ihnen zu trauen ist. Bis dahin bleibt kritisches Nachfragen die beste Absicherung gegen selbstbewusst vorgetragene Fehler einer künstlichen Intelligenz.

arXiv, Are LLM Uncertainty and Correctness Encoded by the Same Features? A Functional Dissociation via Sparse Autoencoders; doi:10.48550/arxiv.2604.19974

Spannend & Interessant
VGWortpixel