KI-Halluzinationen sind plausibel klingende, aber falsche Aussagen von KI-Systemen. Sie entstehen durch die Funktionsweise von Sprachmodellen und treten besonders bei seltenen Fakten, Quellenangaben, aktuellen Ereignissen oder Fachthemen auf.
Stellen Sie sich vor: Sie fragen einen KI-Assistenten nach dem Geburtstag einer Person und bitten ausdrücklich darum, nur zu antworten, wenn das Datum bekannt ist. Dreimal gefragt, erhalten Sie drei verschiedene Daten, und keines davon stimmt. Genau dieses Beispiel beschreiben Forschende von OpenAI und dem Georgia Institute of Technology in einer Studie aus 2025 [1].
Solche Fehler heißen Halluzinationen. Sie sind kein Randphänomen, denn KI ist in vielen Unternehmen längst Teil des Arbeitsalltags. Je selbstverständlicher wir KI nutzen, desto wichtiger wird die Frage, wann wir ihren Antworten vertrauen können.
Statt allgemein vor KI-Fehlern zu warnen, zeigen wir in diesem Beitrag, warum KI manchmal Fakten erfindet, wo das besonders häufig passiert und wie Sie Antworten mit überschaubarem Aufwand prüfen.
Als Halluzination bezeichnet man eine Aussage eines KI-Systems, die plausibel klingt, aber falsch ist. Das US-amerikanische National Institute of Standards and Technology (NIST) spricht von Konfabulation und meint damit selbstbewusst formulierte, aber fehlerhafte Inhalte [2].
Betroffen sind vor allem Large Language Models (LLM), also Sprachmodelle, die aus großen Textmengen lernen, wie Sprache typischerweise weitergeht. Laut NIST sind Konfabulationen eine natürliche Folge dieser Bauweise. Die Modelle erzeugen Antworten, die der statistischen Verteilung ihrer Trainingsdaten folgen. Das kann richtige, manchmal aber auch falsche oder widersprüchliche Aussagen ergeben [2].
Das bedeutet: Eine Halluzination ist keine Lüge und kein klassischer Programmfehler, sondern eine Nebenwirkung der Funktionsweise. Die KI will nicht täuschen, erkennt aber auch nicht zuverlässig, wann sie etwas nicht weiß.
Die eingangs erwähnte Studie nennt zwei zentrale Ursachen [1]. Die erste liegt im Training. Häufig erwähnte Fakten wie Albert Einsteins Geburtstag geben Sprachmodelle selten falsch wieder. Fakten, die in den Trainingsdaten nur ein einziges Mal vorkommen, etwa in einer Todesanzeige, kann ein Modell dagegen kaum von plausiblen Alternativen unterscheiden. Allein beim Geburtstag stehen einer richtigen Antwort 364 falsche gegenüber.
Die zweite Ursache liegt in der Bewertung. Sprachmodelle werden meist mit Tests gemessen, die nur richtige Antworten belohnen. Ein ehrliches „Ich weiß es nicht“ bringt dort so wenig Punkte wie eine falsche Antwort. Wie Studierende bei einer Multiple-Choice-Prüfung lernen Modelle so, im Zweifel zu raten [1].
Daraus ergeben sich Situationen, in denen Sie besonders aufmerksam sein sollten:
seltene Detailangaben wie Namen, Daten, Zahlen oder Aktenzeichen
Quellenangaben, Zitate und Literaturverweise
aktuelle Ereignisse, die nach dem Trainingsstand liegen
Fachfragen, etwa aus Recht, Steuern oder Medizin
Fragen, die bereits eine falsche Annahme enthalten
Gemeinsam ist diesen Fällen, dass dem Modell oft die Wissensgrundlage fehlt, die Antwort aber trotzdem überzeugend klingt.
Wie verbreitet das Problem ist, zeigt eine Untersuchung der Europäischen Rundfunkunion (EBU) und der BBC aus 2025. Journalist:innen von 22 öffentlich-rechtlichen Medienhäusern aus 18 Ländern bewerteten über 2.700 Antworten von vier gängigen KI-Assistenten auf Nachrichtenfragen. 45 Prozent der Antworten wiesen mindestens ein erhebliches Problem auf, 31 Prozent gravierende Mängel bei den Quellen. 20 Prozent enthielten deutliche inhaltliche Fehler, etwa erfundene oder veraltete Informationen [4].
Eine Studie der Stanford University aus 2024 ergab bei konkreten Rechtsfragen Halluzinationsraten zwischen 69 und 88 Prozent, allerdings mit damals verbreiteten Modellen [5]. Seitdem hat die Forschung deutliche Fortschritte gemacht. Gelöst ist das Problem aber nicht, denn im AI Index 2026 der Stanford University lagen die Halluzinationsraten von 26 führenden Modellen in einem neuen Wissenstest zwischen 22 und 94 Prozent. Der Test misst, wie oft Modelle eine falsche Antwort geben, statt Unsicherheit einzugestehen. Ein weiterer Test im selben Bericht zeigt: Äußern Nutzende eine falsche Aussage als eigene Überzeugung, sinkt die Genauigkeit deutlich, bei GPT-4o etwa von 98 auf 64 Prozent [7].
NIST weist darauf hin, dass gerade selbstsichere Formulierungen sowie erfundene Begründungen und Quellen dazu verleiten können, falschen Inhalten zu glauben [2]. Für Ihren Arbeitsalltag heißt das: Eine Quellenangabe ist noch kein Beleg für Richtigkeit. Typische Warnsignale in einer KI-Antwort sind:
sehr konkrete Details ohne nachvollziehbaren Beleg
Quellen, die sich nicht auffinden lassen
Widersprüche innerhalb derselben Antwort
eine unkritische Bestätigung Ihrer eigenen Annahmen
Keines dieser Signale beweist einen Fehler, aber jedes ist ein guter Grund, genauer hinzusehen.
Forschende der University of Oxford haben eine Methode entwickelt, die erkennt, wenn ein Modell auf dieselbe Frage inhaltlich unterschiedliche Antworten gibt. Die Autor:innen benennen aber selbst die Grenze: Macht ein Modell denselben Fehler konsequent, erkennt die Methode ihn nicht [3].
Auch Retrieval Augmented Generation (RAG), eine Methode, bei der die KI vor dem Antworten in hinterlegten Dokumenten oder im Web nachschlägt, kann helfen, ersetzt die Prüfung aber nicht. Suche und schrittweises Schlussfolgern sind laut der OpenAI-Studie kein Allheilmittel [1].
Genau hier setzt die menschliche Verantwortung an. KI beschleunigt Recherche und Formulierung, die fachliche Prüfung und die finale Entscheidung bleiben aber beim Menschen. Auch der EU AI Act greift das auf: Artikel 4 verpflichtet Anbieter und Betreiber von KI-Systemen, Maßnahmen zu ergreifen, die den Aufbau von KI-Kompetenz ihres Personals unterstützen [6]. Warum Kompetenzaufbau dabei mehr bewirkt als jedes Tool, zeigt unser Beitrag Digital Upskilling – Warum KI-Tools alleine nicht reichen.
Aus unserer Sicht ist der Umgang mit Halluzinationen deshalb Teil von Responsible AI, also eines verantwortungsvollen KI-Einsatzes [8]. Dazu gehören nicht nur geschulte Mitarbeitende, sondern auch klare Regeln: Für welche Aufgaben darf KI eingesetzt werden, wer prüft die Ergebnisse, und welche Anwendungsfälle brauchen strengere Kontrollen?
Doch wie gelingt die Prüfung, ohne den Zeitgewinn wieder zu verlieren? Fünf Schritte helfen dabei.
Überlegen Sie zuerst, was von der Antwort abhängt. Ein Ideenentwurf verträgt Ungenauigkeiten, eine Zahl im Vorstandsbericht oder ein Gesetzesverweis nicht.
Vermeiden Sie Suggestivfragen und fordern Sie die KI ausdrücklich auf, Wissenslücken offen zu benennen. Wie Sie wirksame Prompts formulieren, zeigt unser Beitrag Prompt Engineering für Professionals – Wie ich Copilot sinnvoll nutze.
Lassen Sie sich Belege nennen und prüfen Sie, ob die Quelle existiert und die Aussage tatsächlich enthält. Öffnen Sie den Link selbst, statt sich auf die Zusammenfassung der KI zu verlassen.
Stellen Sie dieselbe Frage erneut oder anders formuliert. Weichen die Antworten inhaltlich voneinander ab, ist Vorsicht geboten. Eine gleichbleibende Antwort ist allerdings noch keine Bestätigung [3].
Gleichen Sie Namen, Zahlen, Daten, Zitate und Paragrafen mit Primärquellen ab. Bei wichtigen Ergebnissen empfiehlt sich zusätzlich das Vier-Augen-Prinzip. So wird aus einer plausiblen Antwort eine geprüfte.
KI-Halluzinationen sind kein Zufall, sondern eine erklärbare Folge davon, wie Sprachmodelle trainiert und bewertet werden. Wer diese Mechanismen kennt, weiß, wann besondere Vorsicht gefragt ist. Er oder sie kann Antworten dann gezielt prüfen, statt ihnen blind zu vertrauen oder sie pauschal abzulehnen.
KI bleibt damit ein wertvolles Werkzeug, das Arbeit beschleunigt, aber keine fachliche Verantwortung übernimmt. Wer KI als unfehlbares Nachschlagewerk betrachtet, wird früher oder später in die Irre geführt. Wer sie als Werkzeug mit bekannten Schwächen nutzt, gewinnt Tempo, ohne an Sorgfalt zu verlieren.
Gemeinsam schaffen wir die Grundlage dafür, dass Ihre Mitarbeitenden KI-Ergebnisse sicher einordnen, kritisch prüfen und verantwortungsvoll nutzen. Für ein Erstgespräch melden Sie sich gerne jederzeit bei uns!
Gregor Appeltauer
Senior Manager
PwC Österreich
Jonatan Acho
Intern/Trainee
PwC Österreich