Blog › Was heißt eigentlich, KI Ergebnisse kritisch zu prüfen?

Was heißt eigentlich, KI Ergebnisse kritisch zu prüfen?

2. August 2026 · 431 Wörter · Danny Walther

Täglich wird ein Satz tausendfach gepredigt. Er lautet: "Nutzen Sie KI, aber prüfen Sie die Ergebnisse kritisch." Aber wie soll das Prüfen aussehen?

Fangen wir mit Bekanntem an: empirische Daten zeigen, dass die meisten Studierenden (wie viele Leute) KI-Ergebnisse nicht groß nachprüfen. Quellen werden kaum angeklickt, Ergebnisse weitgehend übernommen, Argumente nicht weiter durchleuchtet: copy, paste, passt.

Die Folge: KI raubt die Möglichkeit zur Selbstdiagnostik. Wo das tiefe, verstehende Wissen aufhört und das "Chatbot-Wissen" beginnt, wird zunehmend unklar.

Aber was, wenn uns selbst tiefes Wissen nicht rettet?

Ich will nicht schwarz malen. Fatalismus liegt mir fern. Aber ich lese Texte. Und ich mache mir Gedanken. Und ich schreibe, um die Gedanken zu ordnen. Ohne schreiben würde ich wahrscheinlich gar nichts verstehen.

Der Fall Aaron Tay: Ein Rechercheexperte scheitert

Gerade kreisen meine Gedanken um einen Essay des "KI-Bibliothekars" Aaron Tay. ( Link)

Tay ist Experte beim Thema Recherche. Er dachte, er könne auf seinem Gebiet gute KI-Ergebnisse von schlechten unterscheiden. Aber er merkt, dass das nicht mehr funktioniert. Tay hat mehrere LLMs gegeneinander und gegen sich selbst antreten lassen. Sie mussten verschiedene Positionen entwickeln und Tays Argumente angreifen. Tay wollte dadurch valide Aussagen bekommen, bekam aber nur valide Verwirrung.

"Ich lese ein Argument und finde es sofort überzeugend. [...] Dann lese ich die Gegenargumentation und ändere meine Meinung. Dann lese ich die Antwort auf die Gegenargumentation und kehre wieder zu meiner ursprünglichen Meinung zurück."

Und das nicht, weil Tay keine Ahnung hat oder wankelmütig ist, sondern weil die Antworten der KI jeweils so gut sind, dass er sie plausibel findet. Wohlgemerkt: auf seinem Fachgebiet. Aber Tay sagt noch was: Wer ein Modell zum Angriff auffordert, bekommt einen Angriff, aber kein Urteil.

Flussdiagramm zu Aaron Tays Test: Ausgangspunkt ist, dass Tay LLMs auf seinem eigenen Recherchegebiet prüft. Er lässt Modelle verschiedene Positionen entwickeln und gegenseitig angreifen. Beide Seiten liefern überzeugende, plausibel begründete Argumente, und auch Tay wechselt wiederholt seine Einschätzung: nicht mangelndes Fachwissen ist das Problem, sondern die wechselnde Plausibilität. LLMs können Argumente erzeugen, aber nicht entscheiden, welches Argument trägt. Die Aufforderung zum Angriff ergibt eine Widerlegung, die kein unabhängiges Urteil ist. Ergebnis: Gute Argumentation durch ein LLM ist nicht gleich verlässliche Erkenntnis. Plausibilität genügt nicht als Prüfkriterium, selbst Fachleute verlieren an Sicherheit, wenn sie nur Argumente vergleichen, und die offene Frage lautet: Wie lässt sich ein Urteil bilden?
Zum Vergrößern anklicken.

Und nun?

Ein Drei-Stufen-Modell fürs Prüfen

Tay hat keine Lösung, entwirft aber ein 3-teiliges Bild vom "Prüfen".

1.) Quellen prüfen: Existieren sie oder hat die KI halluziniert?

Ich sage: Ist machbar, zumal es Tools zur Halluzinations-Prüfung gibt.

2.) Aussagen prüfen: Stützen die Quellen die jeweilige Behauptung?

Ich sage: da wird's schon schwerer, weil viele gar nicht mehr in die Quellen reinschauen. Kein Wunder, dass es inzwischen Tools wie jenni.ai gibt, die prüfen, ob eine Aussage im Text zur zitierten Quelle passt.

3.) Quellenabdeckung prüfen: Wurden Gegenbefunde ausgelassen? Erlauben die Evidenzen diese Schlussfolgerungen?

Da sind wir am entscheidenden Punkt, denn "kritische Prüfung" endet nicht bei Nr. 3. Sie beginnt dort. Dafür muss man aber wissen, welche Such-Systeme auf welche Bestände zugreifen, was sie auswählen und wie sie es tun.

"Kritisch prüfen" heißt also erstmal, die eigene Recherche analysieren, nicht das KI-Ergebnis. Und das heißt: die Such-Infrastruktur kennen und die Datenbanken dahinter verstehen. Und es heißt auch: unser Verständnis vom kritischen Prüfen kritisch zu prüfen.

KI-Ergebnisse kritisch zu prüfen heißt erstmal, die eigene Recherche zu analysieren. Dazu aber muss man die Recherche-Infrastruktur kennen.