Ein Text kann vollständig von einem Menschen stammen, komplett durch ein Sprachmodell erzeugt oder lediglich von einer KI umformuliert worden sein. Gerade die dritte Variante macht KI-Erkennung zunehmend schwierig. Ein neues System soll diese drei Ursprünge nun voneinander unterscheiden können und erreicht innerhalb eines großen Testkorpus eine Trefferquote von mehr als 96 Prozent. Entscheidend ist jedoch, was diese Zahl tatsächlich aussagt und wo ihre Grenzen liegen.
Seit große Sprachmodelle flüssige Texte erzeugen können, hat sich das Problem der Herkunftserkennung verändert. Frühe KI-Texte ließen sich häufig an gleichförmigen Satzstrukturen, auffälligen Übergängen oder wiederkehrenden Formulierungen erkennen. Moderne Modelle schreiben wesentlich variabler. Noch schwieriger wird es, wenn ein Mensch einen eigenen Text erstellt und anschließend ein Sprachmodell nur Stil, Wortwahl und Satzbau verändert. Inhaltlich stammt der Gedanke dann vom Menschen, sprachlich trägt das Dokument jedoch Merkmale maschineller Bearbeitung. Klassische Detektoren, die lediglich zwischen Mensch und Maschine unterscheiden, behandeln diese Mischform oft nicht als eigene Kategorie. Die neue Arbeit setzt genau dort an. Sie baut eine Textklassifikation mit drei Klassen auf: menschlich geschrieben, vollständig KI-generiert und AI-rephrased. Diese Unterscheidung ist für Universitäten, Verlage, Produktbewertungen und Plattformen relevant, weil die bloße Frage nach komplett generiertem Inhalt einen wachsenden Teil der tatsächlichen Nutzung nicht mehr erfasst.
Die Herausforderung zeigt sich auch daran, dass selbst Menschen erstaunlich schlecht zwischen den Ursprüngen unterscheiden können. In einer früheren Untersuchung konnten Sprachwissenschaftler menschliche Texte und ChatGPT nur unzuverlässig auseinanderhalten. Technische Systeme suchen deshalb nicht nur nach einzelnen verdächtigen Wörtern. Moderne KI-Erkennung analysiert statistische Muster über viele Merkmale gleichzeitig. Dazu gehören Wortverteilung, Satzlängen, grammatische Strukturen, stilistische Eigenschaften und abstrakte Repräsentationen aus neuronalen Sprachmodellen. Ein Detektor kann damit Muster erkennen, die einem menschlichen Leser kaum auffallen. Gleichzeitig entsteht ein grundsätzliches Problem: Sobald neue Generatoren anders schreiben als die Modelle im Trainingsmaterial, kann die Leistung sinken. Eine hohe Genauigkeit innerhalb eines kontrollierten Datensatzes ist deshalb noch kein Beweis für universelle Zuverlässigkeit im Internet.
Für die Untersuchung stellten die Autoren ein Korpus aus insgesamt 161.788 Textbeispielen zusammen. Darunter befanden sich 46.844 menschlich geschriebene Texte, 57.247 vollständig KI-generierte Texte und 57.697 umgeschriebene Inhalte. Als Ausgangsmaterial dienten Amazon-Produktbewertungen und Beiträge von Twitter. Für die maschinellen Varianten verwendete das Team mehrere aktuelle Sprachmodelle, darunter GPT, DeepSeek und Kimi. Die vollständig generierten Inhalte entstanden mit Zero-Shot-Anweisungen, während die umformulierten Beispiele durch Few-Shot-Prompts erzeugt wurden. Damit sollte das System nicht nur einen einzigen Generator wiedererkennen. Die Studie in Scientific Reports teilte den Datensatz anschließend in 113.249 Trainingsbeispiele, 16.180 Validierungsbeispiele und 32.359 Texte für den abschließenden Test auf.
Das neue Verfahren kombiniert deshalb zwei grundsätzlich verschiedene Informationsquellen. Ein Teil besteht aus 68 gezielt konstruierten sprachlichen und stilistischen Merkmalen. Dazu zählen beispielsweise lexikalische, syntaktische und stylometrische Eigenschaften. Der zweite Teil nutzt Repräsentationen moderner Transformer-Modelle. Aus RoBERTa und einem Sentence Transformer wurden zusätzliche Merkmale gewonnen, sodass ein 168-dimensionaler Merkmalsvektor entstand. Anschließend testeten die Forscher mehrere klassische Algorithmen wie Random Forest, Support Vector Machine und logistische Regression. Parallel wurden RoBERTa und DeBERTa direkt auf den Rohtexten feinabgestimmt. Der Ansatz ist deshalb interessant, weil Deep Learning nicht einfach alle handgefertigten Kriterien ersetzt. Stattdessen untersucht die Arbeit, ob explizite sprachliche Messwerte und abstrakte neuronale Repräsentationen sich ergänzen. Die Ablationstests sprechen dafür, dass beide Informationsarten zur Leistung des Gesamtsystems beitragen.
Die Transformer-Modelle schnitten deutlich besser ab als die klassischen Einzelverfahren. RoBERTa erreichte im Test eine Genauigkeit von 95,49 Prozent. DeBERTa kam auf 94,88 Prozent. Anschließend kombinierten die Forscher mehrere Modelle. Ein Ensemble, das die vorhergesagten Wahrscheinlichkeiten mittelte, steigerte die Genauigkeit auf 95,66 Prozent. Die höchste Trefferquote entstand durch sogenanntes Stacking. Dabei trifft nicht einfach ein einzelnes Modell die endgültige Entscheidung. Mehrere Basismodelle liefern zunächst ihre Einschätzungen, die anschließend von einem weiteren Random-Forest-Modell zusammengeführt werden. Dieses System erreichte 96,46 Prozent. Daraus entstand die gerundete Zahl von 96 Prozent in der Headline. Sie gilt allerdings ausschließlich für die definierte Testaufgabe mit den drei Klassen und dem vorliegenden Datensatz. Ein einzelner fremder Essay kann deshalb nicht automatisch mit einer Wahrscheinlichkeit von 96 Prozent korrekt klassifiziert werden.
Besonders aufschlussreich ist nicht die höchste Gesamtzahl, sondern die Verteilung der Fehler. AI-rephrased Inhalte waren für praktisch alle getesteten Verfahren schwieriger zu erkennen als vollständig generierte Texte. Das ist plausibel, weil diese Dokumente sprachliche und semantische Eigenschaften beider Welten verbinden. Die Ausgangsidee, Argumentationsstruktur oder persönliche Erfahrung kann menschlichen Ursprungs sein, während ein Modell Satzrhythmus und Wortwahl verändert. Dadurch verschwinden manche klassischen Hinweise auf maschinell generierte Sprache. Für den praktischen Einsatz ist genau diese Mischform besonders relevant. Studenten, Autoren oder Verkäufer müssen keinen kompletten Text durch ein Modell schreiben lassen, um dessen Stil zu verändern. Ein einzelner Überarbeitungsschritt reicht. Die Grenzen solcher Systeme erinnern deshalb an ein anderes Problem moderner Sprachmodelle: Auch KI-Chatbots können bei falschen Antworten sehr sicher klingen. Eine überzeugende Oberfläche verrät die tatsächliche Herkunft oder Qualität nicht zuverlässig.
Für Schulen und Hochschulen ist diese Einschränkung entscheidend. Ein Klassifikator kann bei bekannten Textsorten und Generatoren sehr gut funktionieren und dennoch Schwierigkeiten mit einem neuen Modell, einer anderen Sprache oder stark bearbeiteten Texten bekommen. Produktbewertungen und kurze Social-Media-Beiträge unterscheiden sich zudem strukturell von wissenschaftlichen Hausarbeiten, journalistischen Artikeln oder juristischen Dokumenten. Die Autoren nennen die Generalisierung auf unbekannte Generatoren und neue Domänen deshalb ausdrücklich als nächsten Forschungsschritt. Auch bei hoher Wahrscheinlichkeit sollte ein automatisches Ergebnis nicht ohne zusätzliche Prüfung als Beweis für Täuschung behandelt werden. Bereits kleine Fehlerraten können bei sehr vielen überprüften Texten zahlreiche falsche Verdächtigungen erzeugen. Die KI-Erkennung eignet sich damit eher als technisches Signal innerhalb einer breiteren Prüfung als als alleiniger Richter über die Autorenschaft eines Dokuments.
Die Studie entstand unter Beteiligung der COMSATS University Islamabad, der Jeju National University und der Recep Tayyip Erdogan University. Das offizielle Profil von Muhammad Shahzad Faisal nennt Natural Language Processing, Information Retrieval, maschinelles Lernen und generative KI als Forschungsschwerpunkte. Bemerkenswert ist auch eine Transparenzangabe der Autoren: Bei der sprachlichen Überarbeitung des Manuskripts wurde ChatGPT verwendet. Die Autoren erklären, dass sie den überarbeiteten Inhalt anschließend selbst geprüft haben und die Verantwortung dafür übernehmen. Gerade bei einer Studie über KI-Texte unterstreicht dieser Hinweis, wie unscharf die Grenze zwischen menschlicher und maschineller Textproduktion im Alltag bereits geworden ist. Der eigentliche Fortschritt der Arbeit liegt deshalb weniger in einer endgültigen Lösung als in einer realistischeren Klassifikation dieser Zwischenstufe.
Scientific Reports, Hybrid deep learning for three-way classification of human-written, AI-generated, and AI-rephrased text; doi:10.1038/s41598-026-73841-9