Blog › Die HalluCitations wachsen. Und wenn wir nicht aufpassen…

Die HalluCitations wachsen. Und wenn wir nicht aufpassen, wachsen sie uns über den Kopf und ziehen der Wissenschaft dabei die Füße weg.

12. Mai 2026 · 342 Wörter · Danny Walther

Frisch aus "The Lancet", jener ebenso renommierten wie altehrwürdigen Medizin-Fachzeitschrift, die vor gut 200 Jahren vom umtriebigen Thomas Wakley gegründet wurde. Wakley hätte sich wahrscheinlich nicht mal zu halluzinieren gewagt, mit welchen Problemen sich sein Journal anno 2026 rumschlagen muss.

Ausgangslage: Warum Referenzintegrität zählt

Die Ausgangslage:

Wissenschaftliche Literatur basiert auf der Integrität ihrer Referenzen. Halluzinationen, also von KI fabrizierte Referenzen, untergraben das Vertrauen in die Forschung und stellen eine reale Gefahr dar, gerade in der evidenzbasierten Medizin.

Bisher gab es keine systematische Überprüfung der Referenzintegrität in der biomedizinischen Literatur. Das hat die heute erschienene Studie von Maxim Topaz et al. geändert. ( Link)

Datenbasis und Methode der Studie

Die Datenbasis:

2.471.758 Papers aus PubMed Central Open Access von Januar 2023 bis Februar 2026. Insgesamt 125.615.773 strukturierte Referenzen, davon 97,1 Mio. mit PubMed-ID verifiziert und näher untersucht. (Der Rest war graue Literatur etc. und wurde ausgeschlossen.)

Der Verifikationsprozess:

Automatisierte Abgleichung: Vergleich der Referenzmetadaten, Filterung von False Positives, um Formatierungsfehler zu erkennen usw.

Das Ergebnis: 4.046 erfundene Referenzen

Das Ergebnis:

4.046 fabrizierte Referenzen in 2.810 Papers. Und das waren peer-reviewte Papers. Das heißt: an weniger strengen Publikationsorten ist das Problem wahrscheinlich noch deutlich größer.

Besonders erschreckend ist der zeitliche Anstieg. Der Anteil an Papers mit mind. einer Halluzination betrug 2023 noch 1 von 2.828 Papers. Anfang 2026 fanden sich dagegen schon in 1 pro 277 Papers fabrizierte Referenzen. Das macht 57 HalluCitations auf 10.000 Papers. (siehe die Grafik).

Liniendiagramm: erfundene Referenzen pro 10.000 Papers von Januar 2023 bis Januar 2026; von etwa 4 pro 10.000 (2023) auf 57 pro 10.000 (Anfang 2026).
Zum Vergrößern anklicken.

Das heißt: zwar waren 98,4% der untersuchten Papers (noch) sauber, aber der Trend geht in keine gute Richtung.

Liegt das "nur" an den LLMs? Welchen Anteil haben Paper Mills und einzelne Akteure? (relativ viele Halluzinationen stammten von einer eher kleinen Gruppe von Autoren). Gibt es organisierte Fälschernetzwerke? Und wie viel ist Absicht, wie viel einfach nur "KI-Dummheit"?

Über all das wird zu diskutieren sein. Fakt ist, in anderen Bereichen der Wissenschaft sind die Zahlen ähnlich.

In meinen KI-Workshops an Hochschulen merke ich, dass bei vielen noch das Problembewusstsein fehlt, wie groß die Halluzinations-Gefahr ist. Auch und gerade bei studentischen Arbeiten. Aber eben längst nicht mehr nur da.

Es ist Zeit für eine umfassende KI-Bildung für alle Akteure im wissenschaftlichen Bereich.