Virtuelle Vorurteile

KI mit Frauengesicht wird für gleiche Arbeit schlechter bezahlt

 Dennis Lenz

KI mit Frauengesicht wird für gleiche Arbeit schlechter bezahlt
(Symbolbild). KI mit Frauengesicht kann in einer Arbeitsumgebung anders bewertet werden als technisch identische Varianten. Das Experiment untersucht deshalb nicht die Leistungsfähigkeit der Software, sondern die Reaktionen von Menschen auf Namen, Aussehen und Menschenähnlichkeit. Die Teilnehmer arbeiteten dafür in einer virtuellen Büroumgebung mit mehreren Formen von KI-Assistenten. Entscheidend ist, ob äußerliche Gestaltung Urteile über Vertrauen, Beitrag und finanzielle Belohnung verschiebt. (Foto: © Forschung und Wissen, KI-Bild)

KI mit Frauengesicht kann in derselben Arbeitsaufgabe anders bewertet werden als technisch identische Varianten. Das zeigt ein Experiment in einer virtuellen Büroumgebung, in der 189 Teilnehmer mit verschiedenen KI-Assistenten zusammenarbeiteten und anschließend echtes Geld zwischen sich und dem jeweiligen System aufteilten. Es ging dabei nicht um ein Gehalt für eine künstliche Intelligenz, sondern um eine experimentelle Belohnung, mit der der wahrgenommene Beitrag des Assistenten messbar gemacht wurde. Gerade dieser Aufbau macht sichtbar, dass menschliche Urteile über KI nicht nur von ihrer Leistung, sondern auch von Gestaltung, Menschenähnlichkeit und zugeschriebenem Geschlecht beeinflusst werden können. Der Versuch trifft damit eine Frage, die mit der Verbreitung verkörperter KI-Systeme wichtiger wird: Was passiert, wenn dieselbe Software nicht mehr wie ein neutrales Werkzeug aussieht, sondern soziale Merkmale erhält, die Menschen aus ihrem Alltag kennen? Die Antwort fällt im Experiment messbar aus und widerspricht teilweise den Selbstauskünften der Teilnehmer.

Digitale Assistenten werden zunehmend so gestaltet, dass sie nicht nur Text ausgeben, sondern als Figuren, Stimmen oder virtuelle Kollegen auftreten. Damit verschiebt sich die Frage von reiner Funktionalität zu Human-Computer Interaction: Nutzer reagieren auf soziale Signale, obwohl sie wissen, dass ihnen Software gegenübersteht. Das neue Experiment untersucht diesen Effekt in einer Arbeitswelt, die bewusst wie ein Büro aufgebaut war. Eine KI mit Frauengesicht, ein männlich präsentierter Assistent, ein kleiner Schreibtischroboter und ein textbasierter Chatbot erledigten dabei Aufgaben auf derselben technischen Grundlage. Der entscheidende Unterschied lag nicht in der zugrunde liegenden KI, sondern in ihrer äußeren und sozialen Darstellung. So ließ sich prüfen, ob Menschen identische Unterstützung verschieden bewerten, sobald das System menschlicher wirkt oder mit einem männlichen beziehungsweise weiblichen Erscheinungsbild verbunden wird.

Solche Unterschiede sind für Unternehmen relevant, weil KI-Agenten immer häufiger als sichtbare Schnittstelle zwischen Software und Beschäftigten eingesetzt werden. Schon heute verändern KI-Systeme Tätigkeiten, Zuständigkeiten und Entscheidungswege in vielen Berufen. Forschung und Wissen hat etwa über Schätzungen berichtet, nach denen KI Millionen Arbeitsplätze in Deutschland verändert. Die aktuelle Studie setzt an einer früheren Stufe an: Noch bevor ein System reale Personalentscheidungen trifft, kann seine Gestaltung beeinflussen, wie viel Vertrauen in KI entsteht und wie Menschen seinen Beitrag einschätzen. Das ist besonders interessant, weil sich viele Teilnehmer in Befragungen selbst als relativ unbeeindruckt von Geschlecht oder Menschenähnlichkeit beschrieben. Ihr tatsächliches Verhalten im Experiment fiel jedoch differenzierter aus. Genau dieser Abstand ist methodisch interessant, weil Einstellungen und konkrete Entscheidungen nicht zwingend dasselbe abbilden. Ein Nutzer kann bewusst erklären, das Geschlecht eines Systems spiele keine Rolle, und dennoch auf subtile Unterschiede in Erscheinung oder Menschenähnlichkeit reagieren. Das Experiment versucht, diesen Effekt über eine reale Geldentscheidung greifbar zu machen.

Wie das Experiment mit 189 Teilnehmern aufgebaut war

Die Teilnehmer arbeiteten in virtueller Realität an Aufgaben in einem simulierten Büro und erhielten dabei Unterstützung von unterschiedlich gestalteten KI-Assistenten. Die Studie in Proceedings of the ACM on Human-Computer Interaction verglich vier Formen: einen textbasierten Chatbot, einen Schreibtischroboter sowie zwei menschenähnliche virtuelle Agenten mit männlicher oder weiblicher Präsentation. Die menschlich wirkenden Figuren trugen die Namen Johan und Johanna. Nach der gemeinsamen Arbeit erhielten die Teilnehmer echtes Geld, das sie zwischen sich und dem Assistenten aufteilen sollten. Diese Aufteilung diente als messbarer Indikator dafür, welchen Beitrag sie dem System zuschrieben. Zusätzlich erfassten die Forscher Bewertungen zu Vertrauen, Menschenähnlichkeit und Präferenzen. Weil die technische Leistungsfähigkeit der verglichenen Assistenten gleich gehalten wurde, richtete sich das Experiment gezielt auf die Wirkung ihres Designs. Damit sollte nicht geprüft werden, welcher Assistent objektiv bessere Ergebnisse liefert, sondern wie dieselbe Unterstützung sozial eingeordnet wird. Die monetäre Aufteilung ergänzte klassische Fragebögen um eine Entscheidung mit unmittelbarer Konsequenz für die Teilnehmer und machte Unterschiede zwischen den Varianten quantitativ vergleichbar.

Was bei Johan und Johanna geschah

Der deutlichste Unterschied zeigte sich bei der finanziellen Aufteilung. Die weiblich präsentierte Johanna erhielt für dieselbe zugrunde liegende Unterstützung im Mittel 10,25 Prozent weniger Geld als der männlich präsentierte Johan. Gleichzeitig wurde Johan von den Teilnehmern als stärker menschenähnlich wahrgenommen. Das Ergebnis lässt sich deshalb nicht simpel als isolierter Geschlechterbias deuten, denn Geschlechtsdarstellung und wahrgenommene Menschenähnlichkeit wirkten in diesem konkreten Design zusammen. Dennoch ist der Befund bemerkenswert: Die Software selbst war nicht leistungsfähiger, aber ihre äußere Verkörperung veränderte, wie ihr Beitrag bewertet wurde. Genau hier liegt die Stärke des Versuchs. Statt nur nach Einstellungen zu fragen, verbindet er subjektive Urteile mit einer Entscheidung, die für die Teilnehmer einen realen finanziellen Wert hatte. Damit wird sichtbar, dass selbst kleine Designmerkmale soziale Bewertungsmuster in eine Mensch-Maschine-Interaktion übertragen können.

Warum Menschenähnlichkeit Vertrauen verändert

Menschenähnliche Systeme können vertrauter wirken, weil Gesicht, Körperform und soziale Hinweise bekannte Erwartungen aktivieren. Im Versuch wurden die menschenähnlichen Agenten insgesamt anders beurteilt als der Schreibtischroboter, und der männlich präsentierte Agent schnitt bei der wahrgenommenen Menschenähnlichkeit besonders hoch ab. Die Originalmeldung der University of Limerick hebt deshalb hervor, dass Designer nicht davon ausgehen sollten, eine menschliche Erscheinung sei lediglich eine neutrale Hülle für dieselbe Software. Sie kann Erwartungen an Kompetenz, Nähe und sozialen Status auslösen. Vertrauen in KI ist dabei nicht automatisch gut oder schlecht. Zu wenig Vertrauen kann nützliche Systeme unbrauchbar machen, zu viel Vertrauen kann dagegen dazu führen, dass Nutzer Vorschläge weniger kritisch prüfen. Entscheidend ist deshalb, welche sozialen Signale eine Gestaltung unbeabsichtigt erzeugt. Eine menschenähnliche Oberfläche kann Kooperation erleichtern, zugleich aber Kategorien aktivieren, die aus zwischenmenschlichen Situationen stammen. Die Studie behandelt Anthropomorphismus deshalb nicht als reine Frage der Ästhetik, sondern als Faktor, der die Bewertung von Leistung und die Verteilung von Anerkennung mitformen kann.

Was die Aussagen der Teilnehmer nicht verrieten

Besonders aufschlussreich ist der Abstand zwischen Selbstauskunft und Verhalten. Viele Teilnehmer gaben an, das Geschlecht eines KI-Assistenten sei ihnen nicht besonders wichtig, und einige bevorzugten ausdrücklich Systeme, die klar als Maschine erkennbar bleiben. Trotzdem zeigten die Bewertungen und Geldentscheidungen Unterschiede zwischen den Designs. Daraus folgt nicht, dass die Teilnehmer bewusst diskriminierten oder verborgene Vorurteile zuverlässig ausgelesen wurden. Experimente dieser Art können Verhalten in einer konkreten Situation messen, aber keine vollständigen Aussagen über Motive liefern. Gerade deshalb sind die Ergebnisse für die Gestaltung von KI-Assistenten relevant. Wer nur nach erklärten Präferenzen fragt, kann übersehen, dass visuelle und soziale Eigenschaften Entscheidungen trotzdem beeinflussen. Das betrifft Namen, Stimme, Gesicht, Körperform und den Grad, in dem ein System als menschlicher Akteur statt als Werkzeug erscheint.

Was KI-Agenten in der Arbeitswelt daraus lernen lassen

Für den praktischen Einsatz entsteht daraus eine Designfrage: Wie menschlich sollte ein Assistent auftreten, wenn seine Darstellung messbar beeinflusst, wie sein Beitrag bewertet wird? Digitale Werkzeuge können die Produktivität steigern, wie Untersuchungen zu digitalen Tools im Büro zeigen. Bei anthropomorphen Systemen kommt jedoch eine soziale Ebene hinzu, die klassische Software kaum besitzt. Unternehmen könnten dadurch unbeabsichtigt stereotype Rollen reproduzieren, etwa wenn weiblich wirkende Agenten überwiegend als unterstützend und männlich wirkende Systeme als autoritativ gestaltet werden. Umgekehrt wäre es ebenfalls problematisch, aus einem einzelnen Experiment starre Regeln für jedes Produkt abzuleiten. Sinnvoller ist es, Varianten systematisch zu testen und nicht nur Funktion, sondern auch soziale Wirkung zu messen. Die Studie zeigt, dass Designentscheidungen bei KI-Agenten Teil der Arbeitsorganisation werden können. Das betrifft nicht nur virtuelle Figuren, sondern prinzipiell auch Stimme, Name, Sprachstil und Rollenzuweisung. Sobald solche Merkmale systematisch mit bestimmten Aufgaben verknüpft werden, können sie Erwartungen erzeugen, bevor ein Beschäftigter die tatsächliche Qualität eines Systems beurteilt hat. Deshalb wird die soziale Gestaltung zu einer prüfbaren Produkteigenschaft.

Welche Grenzen der Geschlechterbias im VR-Versuch hat

Der Befund darf nicht mit einem realen Lohnunterschied für künstliche Intelligenz verwechselt werden. Die Assistenten waren keine Beschäftigten, und das Geld war eine experimentelle Belohnung, die Teilnehmer nach einer begrenzten Aufgabe verteilten. Ebenso beweist ein einzelnes VR-Experiment nicht, dass weiblich gestaltete Systeme grundsätzlich in jeder Kultur, Branche oder Anwendung schlechter bewertet werden. Die Stichprobe, die konkrete virtuelle Realität, die Namen Johan und Johanna sowie das gewählte Erscheinungsbild können das Ergebnis mitgeprägt haben. Außerdem wurde der männliche Agent als menschenähnlicher wahrgenommen, sodass mehrere Designfaktoren nicht vollständig voneinander getrennt sind. Der Wert der Studie liegt deshalb weniger in einer universellen Prozentzahl als in dem Nachweis, dass technisch identische Systeme durch ihre soziale Darstellung unterschiedliche Urteile auslösen können. Für künftige Forschung sind größere, kulturell vielfältigere Studien und systematisch variierte Designs entscheidend.

Proceedings of the ACM on Human-Computer Interaction, Human-Like and Male? How AI Assistant Design Relates to Trust and Monetary Reward at Work in VR; doi:10.1145/3829807.3829910

Spannend & Interessant
VGWortpixel