Was heißt eigentlich, KI Ergebnisse kritisch zu prüfen?
Täglich wird ein Satz tausendfach gepredigt. Er lautet: "Nutzen Sie KI, aber prüfen Sie die Ergebnisse kritisch." Aber wie soll das Prüfen aussehen?
Fangen wir mit Bekanntem an: empirische Daten zeigen, dass die meisten Studierenden (wie viele Leute) KI-Ergebnisse nicht groß nachprüfen. Quellen werden kaum angeklickt, Ergebnisse weitgehend übernommen, Argumente nicht weiter durchleuchtet: copy, paste, passt.
Die Folge: KI raubt die Möglichkeit zur Selbstdiagnostik. Wo das tiefe, verstehende Wissen aufhört und das "Chatbot-Wissen" beginnt, wird zunehmend unklar.
Aber was, wenn uns selbst tiefes Wissen nicht rettet?
Ich will nicht schwarz malen. Fatalismus liegt mir fern. Aber ich lese Texte. Und ich mache mir Gedanken. Und ich schreibe, um die Gedanken zu ordnen. Ohne schreiben würde ich wahrscheinlich gar nichts verstehen.
Der Fall Aaron Tay: Ein Rechercheexperte scheitert
Gerade kreisen meine Gedanken um einen Essay des "KI-Bibliothekars" Aaron Tay. ( Link)
Tay ist Experte beim Thema Recherche. Er dachte, er könne auf seinem Gebiet gute KI-Ergebnisse von schlechten unterscheiden. Aber er merkt, dass das nicht mehr funktioniert. Tay hat mehrere LLMs gegeneinander und gegen sich selbst antreten lassen. Sie mussten verschiedene Positionen entwickeln und Tays Argumente angreifen. Tay wollte dadurch valide Aussagen bekommen, bekam aber nur valide Verwirrung.
"Ich lese ein Argument und finde es sofort überzeugend. [...] Dann lese ich die Gegenargumentation und ändere meine Meinung. Dann lese ich die Antwort auf die Gegenargumentation und kehre wieder zu meiner ursprünglichen Meinung zurück."
Und das nicht, weil Tay keine Ahnung hat oder wankelmütig ist, sondern weil die Antworten der KI jeweils so gut sind, dass er sie plausibel findet. Wohlgemerkt: auf seinem Fachgebiet. Aber Tay sagt noch was: Wer ein Modell zum Angriff auffordert, bekommt einen Angriff, aber kein Urteil.

Und nun?
Ein Drei-Stufen-Modell fürs Prüfen
Tay hat keine Lösung, entwirft aber ein 3-teiliges Bild vom "Prüfen".
1.) Quellen prüfen: Existieren sie oder hat die KI halluziniert?
Ich sage: Ist machbar, zumal es Tools zur Halluzinations-Prüfung gibt.
2.) Aussagen prüfen: Stützen die Quellen die jeweilige Behauptung?
Ich sage: da wird's schon schwerer, weil viele gar nicht mehr in die Quellen reinschauen. Kein Wunder, dass es inzwischen Tools wie jenni.ai gibt, die prüfen, ob eine Aussage im Text zur zitierten Quelle passt.
3.) Quellenabdeckung prüfen: Wurden Gegenbefunde ausgelassen? Erlauben die Evidenzen diese Schlussfolgerungen?
Da sind wir am entscheidenden Punkt, denn "kritische Prüfung" endet nicht bei Nr. 3. Sie beginnt dort. Dafür muss man aber wissen, welche Such-Systeme auf welche Bestände zugreifen, was sie auswählen und wie sie es tun.
"Kritisch prüfen" heißt also erstmal, die eigene Recherche analysieren, nicht das KI-Ergebnis. Und das heißt: die Such-Infrastruktur kennen und die Datenbanken dahinter verstehen. Und es heißt auch: unser Verständnis vom kritischen Prüfen kritisch zu prüfen.
KI-Ergebnisse kritisch zu prüfen heißt erstmal, die eigene Recherche zu analysieren. Dazu aber muss man die Recherche-Infrastruktur kennen.


