Vernichtende Studie: ChatGPT wurde dieselbe Frage 10 Mal gestellt – Die Antworten änderten sich ständig

von | 23. März 2026

ChatGPT mag überzeugend klingen, doch diese Studie zeigt, dass es ihm nach wie vor schwerfällt, zu unterscheiden, was tatsächlich wahr ist.

Mesut Cicek, Professor an der Washington State University, und sein Team haben ChatGPT wiederholt getestet, indem sie dem System Hypothesen aus wissenschaftlichen Studien vorgelegt haben. Die KI wurde gebeten, zu entscheiden, ob die jeweilige Aussage durch Forschungsergebnisse gestützt wird – im Wesentlichen sollte sie beurteilen, ob diese wahr oder falsch ist.

Insgesamt haben die Forscher mehr als 700 Hypothesen getestet und jede davon zehnmal eingegeben, um zu untersuchen, wie konsistent die Antworten ausfallen würden.

Genauigkeitsergebnisse und Leistungsgrenzen

Im ersten Experiment im Jahr 2024 gab ChatGPT in 76,5 % der Fälle die richtige Antwort. Als die Studie im Jahr 2025 wiederholt wurde, stieg die Genauigkeit leicht auf 80 % an. Nach Bereinigung der Ergebnisse um Zufallsraten wirkte die Leistung jedoch weitaus weniger zuverlässig. Die KI schnitt nur etwa 60 % besser ab als der Zufall, was die Forscher eher als schwache Leistung bezeichneten.

Das System hatte besondere Schwierigkeiten bei der Identifizierung falscher Aussagen und stufte diese nur in 16,4 % der Fälle korrekt ein. Es zeigte zudem Inkonsistenz. Bei zehnmaliger Eingabe genau derselben Eingabeaufforderung lieferte ChatGPT nur in etwa 73 % der Fälle konsistente Ergebnisse.

Uneinheitliche Antworten auf identische Fragen

Es geht hier nicht nur um Genauigkeit, sondern um Inkonsistenz, denn wenn man dieselbe Frage immer wieder stellt, erhält man unterschiedliche Antworten“, sagte Cicek, außerordentlicher Professor am Institut für Marketing und Internationale Wirtschaft am Carson College of Business der WSU und Hauptautor der neuen Veröffentlichung.

Wir haben 10 Eingabeaufforderungen mit genau derselben Frage verwendet. Alles war identisch. Mal wurde mit ‚wahr‘ geantwortet, dann wieder mit ‚falsch‘. Es ist wahr, es ist falsch, falsch, wahr. Es gab mehrere Fälle, in denen fünf Antworten ‚wahr‘ und fünf ‚falsch‘ lauteten.

Fließende KI-Sprache versus echtes Verständnis

Die in der „Rutgers Business Review“ veröffentlichte Studie unterstreicht, wie wichtig es ist, bei der Nutzung von KI für wichtige Entscheidungen Vorsicht walten zu lassen, insbesondere bei solchen, die Nuancen oder komplexe Schlussfolgerungen erfordern. Generative KI kann zwar fließende und überzeugende Sprache erzeugen, zeugt jedoch nicht unbedingt von echtem Verständnis.

Cicek sagte, die Ergebnisse deuteten darauf hin, dass eine künstliche allgemeine Intelligenz, die zu echtem logischem Denken fähig ist, möglicherweise noch weiter entfernt sei, als manche erwarten.

Aktuelle KI-Tools verstehen die Welt nicht so, wie wir sie verstehen – sie haben kein ‚Gehirn‘“, sagte Cicek. „Sie speichern lediglich Informationen und können Ihnen zwar gewisse Einblicke vermitteln, aber sie verstehen nicht, wovon sie sprechen.

Studiendesign und Methoden

Cicek arbeitete mit Sevincgul Ulu von der Southern Illinois University, Can Uslay von der Rutgers University und Kate Karniouchina von der Northeastern University zusammen.

Das Team analysierte 719 Hypothesen aus wissenschaftlichen Artikeln, die seit 2021 in Wirtschaftsmagazinen veröffentlicht wurden. Die Feststellung, ob Forschungsergebnisse eine Hypothese stützen, ist oft komplex und hängt von zahlreichen Faktoren ab, die das Ergebnis beeinflussen können. Diese Komplexität auf eine einfache Ja-oder-Nein-Entscheidung zu reduzieren, erfordert sorgfältige Überlegungen.

Die Forscher testeten die kostenlose Version von ChatGPT-3.5 im Jahr 2024 und die aktualisierte Version ChatGPT-5 mini im Jahr 2025. Insgesamt waren die Ergebnisse bei beiden Versionen ähnlich. Nach Bereinigung um Zufallseffekte, die eine Wahrscheinlichkeit von 50 % für eine richtige Antwort ergeben, lag die Leistung der KI in beiden Jahren nur etwa 60 % über dem Zufallsniveau.

Wesentliche Schwäche beim logischen Denken von KI

Die Ergebnisse zeigen eine wichtige Einschränkung von KI-Systemen auf Basis großer Sprachmodelle auf. Obwohl sie ausgefeilte und überzeugende Antworten generieren können, tun sie sich oft schwer mit tiefergehendem logischem Denken. Dies kann zu Antworten führen, die überzeugend klingen, aber tatsächlich falsch sind, so Cicek.

Warum Experten zur Vorsicht mahnen

Aufgrund dieser Ergebnisse empfehlen die Forscher Führungskräften, von KI generierte Ergebnisse zu überprüfen und ihnen mit Skepsis zu begegnen. Sie betonen zudem, wie wichtig es ist, die Nutzer darin zu schulen, sowohl die Stärken als auch die Grenzen von KI-Tools zu verstehen.

Während sich diese Studie auf ChatGPT konzentrierte, merkte Cicek an, dass ähnliche Tests mit anderen KI-Systemen zu vergleichbaren Ergebnissen geführt haben. Die Forschung baut zudem auf früheren Arbeiten auf, die Bedenken hinsichtlich des KI-Hypes hervorheben. Eine nationale Umfrage aus dem Jahr 2024 ergab, dass Konsumenten weniger geneigt waren, Produkte zu kaufen, wenn diese mit Fokus auf KI vermarktet wurden.

Seien Sie immer skeptisch“, sagte er. „Ich bin nicht gegen KI. Ich nutze sie selbst. Aber man muss sehr vorsichtig sein.

Quelle: SciTechDaily

Telegram zensiert nicht! Wenn du diese Information wichtig findest, kannst du Legitim auf Telegram kostenlos abonnieren: hier anmelden (Telegram herunterladen)

Legitim-Newsletter

 

Abonniere den Newsletter,


um die wichtigsten Updates per E-Mail zu erhalten!

Du hast dich erfolgreich angemeldet - danke!