72.644 Preprints und KI als Qualitäts-Gutachter. Das Ergebnis zeigt, wie gut Preprints inzwischen sind.
Ich verweise in meinen Recherche-Workshops regelmäßig auf Preprint-Server und ernte mitunter ein Stirnrunzeln: „Aber die Studien dort sind doch nicht begutachtet."
Der Einwand ist nicht neu. Im Grunde ist er so alt, dass man darüber eine kleine Mentalitätsgeschichte des deutschen Wissenschaftssystems schreiben könnte. Aber mir geht's um was anderes: Daten, Zahlen und Fakten. Denn die zeigen: Die Vorbehalte gegen Preprints haben keine empirische Grundlage.
Was die 72.644-Preprint-Studie zeigt
Hao Yin und Ruslan Rust haben gerade 72.644 bioRxiv-Preprints mit ihrer später begutachteten Fassung verglichen ( Link). Die zentrale Behauptung der Preprints blieb in 90 % der Fälle unverändert oder wurde nur minimal überarbeitet. Substanziell geändert wurde nur jedes zehnte Paper. Tendenz stark sinkend. Meist ändert sich dann nur die Stärke des Claims. In den Preprints waren die Behauptungen mitunter etwas optimistischer als in der Peer Review Version. Aber in manchen Fällen wurden die Claims von den Reviewern sogar noch stärker gemacht. Dass die Ergebnisse komplett verworfen und die Preprints zurückgezogen wurden, kam dagegen nur in 8,1 von 10.000 Fällen vor.

Und das ist die eigentliche Pointe der Studie von Yin und Rust: Papers, die nie als Preprint erschienen sind, wurden mehr als doppelt so oft zurückgezogen wie jene, die einen Preprint hatten. Mit anderen Worten: Der Geruch des Unfertigen und Mangelhaften, der Preprints mitunter noch anhaftet, lässt sich empirisch nicht bestätigen. Das Gegenteil ist eher der Fall.
Die Studie von Yin und Rust ist natürlich auch ein Preprint, erschienen auf bioRxiv (Link im 1. Kommentar.) Die Studie wurde (noch) nicht begutachtet. Zudem hat die 72.644 Vergleiche kein Gutachtergremium übernommen, sondern ein Sprachmodell (Claude Sonnet 4.6).
Wie KI und Preprints zusammenwachsen
Und genau hier wird es spannend, denn Preprint und KI verbinden sich immer mehr. Auf der Ebene der Forschung. Und auch bei der Daten- und Literaturrecherche. Das ist auch deshalb wichtig, weil immer mehr Studien auf Preprint-Servern erscheinen. Wer dort recherchiert, findet die neuesten Studien und Daten. Und das Beste: das geht inzwischen alles viel leichter als bisher, nämlich mit der Hilfe von KI.
Konkret bedeutet das: Die ersten Preprint-Server haben inzwischen KI so tief integriert, dass ihre Datenbanken mit natürlicher Sprache durchsucht werden können. Dazu gibt es viele weitere Funktionen: Studien können im Detail befragt, ähnliche Arbeiten automatisch ermittelt und die Ergebnisse der KI-gestützten Recherche mit Peer Review Papers abgeglichen werden.
Wie das alles geht, zeige ich - neben vielen anderen Dingen - in meinen Recherche-Workshops. Vorkenntnisse oder technisches Know-how sind dafür nicht nötig. Und ein Preprint-Paper müsst ihr auch nicht verfasst haben :) Es genügt das, was Studieren und Forschen ausmacht: die Lust am Wissen und Entdecken. Preprint-Server sind dafür eine wunderbare Quelle.


