Wenn KI sich irrt: Halluzinationen verstehen

  • Blog
  • 4 minute read
  • Oktober 06, 2026

KI-Halluzinationen sind plausibel klingende, aber falsche Aussagen von KI-Systemen. Sie entstehen durch die Funktionsweise von Sprachmodellen und treten besonders bei seltenen Fakten, Quellenangaben, aktuellen Ereignissen oder Fachthemen auf.

Stellen Sie sich vor: Sie fragen einen KI-Assistenten nach dem Geburtstag einer Person und bitten ausdrücklich darum, nur zu antworten, wenn das Datum bekannt ist. Dreimal gefragt, erhalten Sie drei verschiedene Daten, und keines davon stimmt. Genau dieses Beispiel beschreiben Forschende von OpenAI und dem Georgia Institute of Technology in einer Studie aus 2025 [1].

Solche Fehler heißen Halluzinationen. Sie sind kein Randphänomen, denn KI ist in vielen Unternehmen längst Teil des Arbeitsalltags. Je selbstverständlicher wir KI nutzen, desto wichtiger wird die Frage, wann wir ihren Antworten vertrauen können.

Statt allgemein vor KI-Fehlern zu warnen, zeigen wir in diesem Beitrag, warum KI manchmal Fakten erfindet, wo das besonders häufig passiert und wie Sie Antworten mit überschaubarem Aufwand prüfen.

Was sind KI-Halluzinationen?

Als Halluzination bezeichnet man eine Aussage eines KI-Systems, die plausibel klingt, aber falsch ist. Das US-amerikanische National Institute of Standards and Technology (NIST) spricht von Konfabulation und meint damit selbstbewusst formulierte, aber fehlerhafte Inhalte [2].

Betroffen sind vor allem Large Language Models (LLM), also Sprachmodelle, die aus großen Textmengen lernen, wie Sprache typischerweise weitergeht. Laut NIST sind Konfabulationen eine natürliche Folge dieser Bauweise. Die Modelle erzeugen Antworten, die der statistischen Verteilung ihrer Trainingsdaten folgen. Das kann richtige, manchmal aber auch falsche oder widersprüchliche Aussagen ergeben [2].

Das bedeutet: Eine Halluzination ist keine Lüge und kein klassischer Programmfehler, sondern eine Nebenwirkung der Funktionsweise. Die KI will nicht täuschen, erkennt aber auch nicht zuverlässig, wann sie etwas nicht weiß. 

Warum erfindet KI Fakten?

Die eingangs erwähnte Studie nennt zwei zentrale Ursachen [1]. Die erste liegt im Training. Häufig erwähnte Fakten wie Albert Einsteins Geburtstag geben Sprachmodelle selten falsch wieder. Fakten, die in den Trainingsdaten nur ein einziges Mal vorkommen, etwa in einer Todesanzeige, kann ein Modell dagegen kaum von plausiblen Alternativen unterscheiden. Allein beim Geburtstag stehen einer richtigen Antwort 364 falsche gegenüber.

Die zweite Ursache liegt in der Bewertung. Sprachmodelle werden meist mit Tests gemessen, die nur richtige Antworten belohnen. Ein ehrliches „Ich weiß es nicht“ bringt dort so wenig Punkte wie eine falsche Antwort. Wie Studierende bei einer Multiple-Choice-Prüfung lernen Modelle so, im Zweifel zu raten [1].

Daraus ergeben sich Situationen, in denen Sie besonders aufmerksam sein sollten: 

  • seltene Detailangaben wie Namen, Daten, Zahlen oder Aktenzeichen

  • Quellenangaben, Zitate und Literaturverweise

  • aktuelle Ereignisse, die nach dem Trainingsstand liegen

  • Fachfragen, etwa aus Recht, Steuern oder Medizin 

  • Fragen, die bereits eine falsche Annahme enthalten

Gemeinsam ist diesen Fällen, dass dem Modell oft die Wissensgrundlage fehlt, die Antwort aber trotzdem überzeugend klingt.

Halluzinationen in der Praxis

Wie verbreitet das Problem ist, zeigt eine Untersuchung der Europäischen Rundfunkunion (EBU) und der BBC aus 2025. Journalist:innen von 22 öffentlich-rechtlichen Medienhäusern aus 18 Ländern bewerteten über 2.700 Antworten von vier gängigen KI-Assistenten auf Nachrichtenfragen. 45 Prozent der Antworten wiesen mindestens ein erhebliches Problem auf, 31 Prozent gravierende Mängel bei den Quellen. 20 Prozent enthielten deutliche inhaltliche Fehler, etwa erfundene oder veraltete Informationen [4]. 

Eine Studie der Stanford University aus 2024 ergab bei konkreten Rechtsfragen Halluzinationsraten zwischen 69 und 88 Prozent, allerdings mit damals verbreiteten Modellen [5]. Seitdem hat die Forschung deutliche Fortschritte gemacht. Gelöst ist das Problem aber nicht, denn im AI Index 2026 der Stanford University lagen die Halluzinationsraten von 26 führenden Modellen in einem neuen Wissenstest zwischen 22 und 94 Prozent. Der Test misst, wie oft Modelle eine falsche Antwort geben, statt Unsicherheit einzugestehen. Ein weiterer Test im selben Bericht zeigt: Äußern Nutzende eine falsche Aussage als eigene Überzeugung, sinkt die Genauigkeit deutlich, bei GPT-4o etwa von 98 auf 64 Prozent [7].

NIST weist darauf hin, dass gerade selbstsichere Formulierungen sowie erfundene Begründungen und Quellen dazu verleiten können, falschen Inhalten zu glauben [2]. Für Ihren Arbeitsalltag heißt das: Eine Quellenangabe ist noch kein Beleg für Richtigkeit. Typische Warnsignale in einer KI-Antwort sind:

  • sehr konkrete Details ohne nachvollziehbaren Beleg

  • Quellen, die sich nicht auffinden lassen 

  • Widersprüche innerhalb derselben Antwort

  • eine unkritische Bestätigung Ihrer eigenen Annahmen

Keines dieser Signale beweist einen Fehler, aber jedes ist ein guter Grund, genauer hinzusehen.

Was Technik leisten kann und wo der Mensch entscheidet 

Forschende der University of Oxford haben eine Methode entwickelt, die erkennt, wenn ein Modell auf dieselbe Frage inhaltlich unterschiedliche Antworten gibt. Die Autor:innen benennen aber selbst die Grenze: Macht ein Modell denselben Fehler konsequent, erkennt die Methode ihn nicht [3].

Auch Retrieval Augmented Generation (RAG), eine Methode, bei der die KI vor dem Antworten in hinterlegten Dokumenten oder im Web nachschlägt, kann helfen, ersetzt die Prüfung aber nicht. Suche und schrittweises Schlussfolgern sind laut der OpenAI-Studie kein Allheilmittel [1].

Genau hier setzt die menschliche Verantwortung an. KI beschleunigt Recherche und Formulierung, die fachliche Prüfung und die finale Entscheidung bleiben aber beim Menschen. Auch der EU AI Act greift das auf: Artikel 4 verpflichtet Anbieter und Betreiber von KI-Systemen, Maßnahmen zu ergreifen, die den Aufbau von KI-Kompetenz ihres Personals unterstützen [6]. Warum Kompetenzaufbau dabei mehr bewirkt als jedes Tool, zeigt unser Beitrag Digital Upskilling – Warum KI-Tools alleine nicht reichen.

Aus unserer Sicht ist der Umgang mit Halluzinationen deshalb Teil von Responsible AI, also eines verantwortungsvollen KI-Einsatzes [8]. Dazu gehören nicht nur geschulte Mitarbeitende, sondern auch klare Regeln: Für welche Aufgaben darf KI eingesetzt werden, wer prüft die Ergebnisse, und welche Anwendungsfälle brauchen strengere Kontrollen? 

So prüfen Sie KI-Antworten

Doch wie gelingt die Prüfung, ohne den Zeitgewinn wieder zu verlieren? Fünf Schritte helfen dabei.

1. Risiko einschätzen

Überlegen Sie zuerst, was von der Antwort abhängt. Ein Ideenentwurf verträgt Ungenauigkeiten, eine Zahl im Vorstandsbericht oder ein Gesetzesverweis nicht. 

2. Offen fragen und Unsicherheit zulassen

Vermeiden Sie Suggestivfragen und fordern Sie die KI ausdrücklich auf, Wissenslücken offen zu benennen. Wie Sie wirksame Prompts formulieren, zeigt unser Beitrag Prompt Engineering für Professionals – Wie ich Copilot sinnvoll nutze.

3. Quellen verlangen und öffnen

Lassen Sie sich Belege nennen und prüfen Sie, ob die Quelle existiert und die Aussage tatsächlich enthält. Öffnen Sie den Link selbst, statt sich auf die Zusammenfassung der KI zu verlassen. 

4. Nachfragen und vergleichen

Stellen Sie dieselbe Frage erneut oder anders formuliert. Weichen die Antworten inhaltlich voneinander ab, ist Vorsicht geboten. Eine gleichbleibende Antwort ist allerdings noch keine Bestätigung [3].

5. Kritische Details gegenprüfen

Gleichen Sie Namen, Zahlen, Daten, Zitate und Paragrafen mit Primärquellen ab. Bei wichtigen Ergebnissen empfiehlt sich zusätzlich das Vier-Augen-Prinzip. So wird aus einer plausiblen Antwort eine geprüfte. 

Fazit

KI-Halluzinationen sind kein Zufall, sondern eine erklärbare Folge davon, wie Sprachmodelle trainiert und bewertet werden. Wer diese Mechanismen kennt, weiß, wann besondere Vorsicht gefragt ist. Er oder sie kann Antworten dann gezielt prüfen, statt ihnen blind zu vertrauen oder sie pauschal abzulehnen.

KI bleibt damit ein wertvolles Werkzeug, das Arbeit beschleunigt, aber keine fachliche Verantwortung übernimmt. Wer KI als unfehlbares Nachschlagewerk betrachtet, wird früher oder später in die Irre geführt. Wer sie als Werkzeug mit bekannten Schwächen nutzt, gewinnt Tempo, ohne an Sorgfalt zu verlieren.

Wir unterstützen Sie gerne! 

Gemeinsam schaffen wir die Grundlage dafür, dass Ihre Mitarbeitenden KI-Ergebnisse sicher einordnen, kritisch prüfen und verantwortungsvoll nutzen. Für ein Erstgespräch melden Sie sich gerne jederzeit bei uns!

Gregor Appeltauer
Senior Manager
PwC Österreich

Jonatan Acho
Intern/Trainee
PwC Österreich

[1] OpenAI / Georgia Institute of Technology – Why Language Models Hallucinate Quelle: Kalai, Nachum, Vempala, Zhang (OpenAI, Georgia Tech), Why Language Models Hallucinate, 2025. https://arxiv.org/abs/2509.04664

[2] NIST – Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile (NIST AI 600-1) Quelle: National Institute of Standards and Technology, NIST AI 600-1, 2024. https://nvlpubs.nist.gov/nistpubs/ai/NIST.AI.600-1.pdf

[3] University of Oxford – Detecting hallucinations in large language models using semantic entropy Quelle: University of Oxford, Farquhar, Kossen, Kuhn, Gal, Nature 630, 2024 (Presseaussendung zur Studie). https://www.ox.ac.uk/news/2024-06-20-major-research-hallucinating-generative-models-advances-reliability-artificial

[4] EBU / BBC – News Integrity in AI Assistants. An international PSM study Quelle: European Broadcasting Union und BBC, News Integrity in AI Assistants, 2025. Stichprobe: 2.709 ausgewertete Antworten auf 30 Kernfragen (insgesamt über 3.000 Antworten) von ChatGPT, Copilot, Gemini und Perplexity in den kostenlosen Versionen, erzeugt Mai/Juni 2025, bewertet von 271 Journalist:innen aus 22 öffentlich-rechtlichen Medienhäusern in 18 Ländern und 14 Sprachen. Die Prozentwerte stehen im Bericht auf S. 3 und S. 9–10. https://www.ebu.ch/files/live/sites/ebu/files/Publications/Intelligence/open/EBU-Intelligence-BBC_News_Integrity_in_AI_Assistants_Report_2025.pdf

[5] Stanford RegLab / Stanford HAI – Hallucinating Law: Legal Mistakes with Large Language Models are Pervasive Quelle: Stanford University, Dahl, Magesh, Suzgun, Ho, 2024. Stichprobe: drei verbreitete Sprachmodelle, spezifische und überprüfbare Rechtsfragen. https://hai.stanford.edu/news/hallucinating-law-legal-mistakes-large-language-models-are-pervasive

[6] Europäische Union – EU Artificial Intelligence Act, Artikel 4 (KI-Kompetenz), neu gefasst durch den Digital Omnibus zur KI Quelle: Europäisches Parlament und Rat, Verordnung (EU) 2026/1744 zur Änderung der Verordnung (EU) 2024/1689, Artikel 1 Nummer 5, Amtsblatt der EU vom 24.7.2026, in Kraft seit 27.7.2026. http://data.europa.eu/eli/reg/2026/1744/oj

[7] Stanford HAI – The 2026 AI Index Report, Kapitel Responsible AI Quelle: Stanford Institute for Human-Centered Artificial Intelligence, The 2026 AI Index Report, 2026. Stichprobe: 26 führende Sprachmodelle. https://hai.stanford.edu/ai-index/2026-ai-index-report/responsible-ai 

[8] PwC – Responsible AI Quelle: PwC, Responsible AI, 2026. https://www.pwc.com/gx/en/services/ai/responsible-ai.html

PwC News direkt ins E-Mail Postfach

Newsletter abonnieren

Folgen Sie uns

Pflichtfelder sind mit Sternchen markiert(*)

Mit dem Klick auf „Senden“ bestätige ich, die Datenschutzerklärung und die vertrauliche Verwendung meiner Daten zur Kenntnis genommen zu haben. Ich habe jederzeit die Möglichkeit, die zugesandten Informationen durch eine E-Mail über die Kontaktseite abzubestellen.

Hide