← Lernen und Material · ki-recherchen.de
Recherche mit KI

Recherche mit KI

Aus dem Suchproblem wird ein Bewertungsproblem. Fünf Teile mit neunundzwanzig Kapiteln zum Ausprobieren: Prompts bauen, die Recherche-Infrastruktur erkunden, Verzerrungen aufspüren.

Grundlage sind meine Recherche-Workshops an der HTWK Leipzig (26.08. und 15.09.2026) und mein Blog ki-recherchen.de. Stand der Inhalte: meine Workshop-Folien August bis September 2026 (zuletzt 30.09.2026), Blogbeiträge Dezember 2025 bis September 2026. Hier stehen die Kernideen. In meinen Workshops vertiefe ich sie mit Live-Demos, aktuellen Daten und Übungen am eigenen Thema.

Breiter Prompt
Führt der Einsatz generativer KI bei Studierenden zu Deskilling?

Was bleibt offen?

  • Was genau bedeutet „Deskilling“?
    Verlust vorhandener Fähigkeitengeringerer Kompetenzerwerbweniger Übungstärkere Abhängigkeit von KI
  • Welche Kompetenzen sind gemeint?
    Schreibenwissenschaftliche Recherchekritisches DenkenProblemlösenProgrammierenFachwissen
  • Welche Form der KI-Nutzung wird untersucht?
    TextgenerierungRechercheZusammenfassungFeedbackÜbersetzungProblemlösung
  • Welche Vergleichssituation interessiert?
    Nutzung mit vs. ohne KIunterschiedliche Nutzungsintensitätverschiedene Arten der KI-Unterstützung
  • Welche Evidenz soll berücksichtigt werden?
    ExperimenteLängsschnittstudienBeobachtungsstudienBefragungenqualitative StudienReviews

Folge: Unterschiedliche Kompetenzbegriffe, Wirkmechanismen und Evidenztypen werden vermischt.

Prompt präzisieren

Ausgangslage: Was KI an Recherche verändert

Die Hauptschwierigkeit verschiebt sich vom Finden zum Bewerten. Drei Kapitel dazu, wie sich das zeigt, warum wir KI-Antworten glauben und wo sie in die Irre führen.

Vom Suchproblem zum Bewertungsproblem

Vor KI bestand die Hauptschwierigkeit darin, Informationen zu finden. Mit KI liegt sie darin, Antworten zu beurteilen: ihre Datengrundlage, mögliche Verzerrungen und die Logik des Modells.

Wo liegt die Hauptarbeit?

Schematische Darstellung des Schwerpunkts, keine Messwerte.

Was Nutzer tatsächlich tun
Google-Suchen ohne Klick auf ein Ergebnis (Zero-Click)60 bis 70 %
Quelle in meinen Workshop-Folien: SparkToro. Für Deutschland: 62 % (Fishkin 2026).
Perplexity: Zero-Click-Rate85 %
Quelle: Oldshue (2025). Perplexity vermarktet sich als „Antwortmaschine“.
ChatGPT: Nutzungsvorgänge ohne Klick auf einen Link oder eine Quelle95 bis 99 %
Je nach Messmethode und Bezugsgröße liegt der Wert bei 95 bis 99 %, in meinen Workshop-Folien bei 98 bis 99 % (Search Engine Journal).
Studierende, die mit den Antworten von KI-Tools wie ChatGPT zufrieden sind69 %
Quelle in meinen Workshop-Folien: KI4Edu-Studie. Basis sind über 1.000 Studierende aus 85 Hochschulen (Enes, Meckmann und Le-Vu 2025).

Schraffiert ist die Spanne bis zum oberen Wert. In meinen Workshops zeige ich anhand von Daten, dass Prüfung und Auseinandersetzung mit Quellen, Daten und Dokumenten abnehmen. Gelesen wird zunehmend nur noch die von der KI erzeugte Interpretationsschicht (Danny Walther: Recherchekompetenz an Hochschulen im Angesicht von KI, 2026, Hochschulforum Digitalisierung).

Warum KI-Antworten überzeugen

Processing Fluency

Was sich leicht und reibungslos anfühlt, wirkt richtiger und besser begründet, auch wenn es falsch ist. KI-Antworten erzeugen dieses Gefühl durch kohärente Sprache und schlüssig wirkende Argumentation.

Illusion der Erklärungstiefe

Nach einem Erklärvideo fühlt man sich wissend. Muss man das Thema später selbst erklären, wird es dünn (Explanatory Depth).

These aus dem Blog

Im Beitrag „Macht KI uns dümmer? Oder schlauer?“ (10. Januar 2026, dort ohne Quellenangaben) heißt es: Viele Arbeiten zeigten Upskilling und Newskilling (bessere Texte, mehr Ideen, schnellere Lösungen, bei mehr KI-Vorbildung oft stärker), andere Deskilling (unkritischer, weniger Nachprüfen, Kompetenzverlust). Beides sei gut belegt. Die Frage „klüger oder dümmer?“ sei deshalb falsch: Wir würden leistungsfähiger bei schlechterer Selbsteinschätzung.

Mein Vorbehalt aus den Workshops

Bei KI beruhen viele Daten auf Umfragen und Selbsteinschätzungen, aber wenig auf echten Kompetenz-Messungen. Deshalb trennt der Rechercheprompt in konsequent zwischen gemessenen Veränderungen, wahrgenommenen Effekten und bloßen Einstellungen.

Warum die Antwort wie das Ende der Suche wirkt

Vor KI begann eine Suche mit Schlagworten und führte zu Treffern und Links, die man anklicken musste, wenn man eine Antwort haben wollte. Heute beginnt sie mit einem Prompt, und die Antwort folgt auf dem Fuß. Ein weiterer Klick scheint oft unnötig. Die Antwort wirkt deshalb nicht wie der Beginn einer Suche, sondern wie ihr Ende. Die sprachliche Kohärenz der KI-Zusammenfassung erweckt zudem den Eindruck von Glaubwürdigkeit und befeuert die Tendenz, Ergebnisse ungeprüft zu übernehmen.

Verstärkt wird das durch die Anbieter: Laut meinen Workshop-Folien vom 30.09.2026 versuchen sie bewusst, Nutzer in der KI-Oberfläche zu halten. Je besser die KI eine Information liefert, desto weniger scheint es nötig, die Quelle zu öffnen. Das Problem ist also nicht fehlende Verlinkung: Auch wo Links gezeigt werden, öffnen Nutzer die Originalquellen seltener, obwohl die Antwort fertig wirkt.

Schlechte Prompts fallen nicht auf

Bei der klassischen Suche blieben unpassende Schlagworte in der Trefferliste sofort sichtbar: keine oder wenig hilfreiche Treffer. Bei KI ergeben auch schlechte Prompts oft schlüssig und überzeugend klingende Antworten, die schlechte Qualität fällt kaum auf (meine Workshop-Folien vom 30.09.2026). Im Blog heißt es: Selbst der lausigste Prompt liefert noch ein wohlklingendes Ergebnis, ein Scheitern ist bei einer KI-Suche im Grunde unmöglich.

Gefühl des Verstehens trügt

Die Illusion der Erklärungstiefe verstärkt KI laut Blog: Die Ergebnisse wirken perfekt, die Texte sind rund. Wer eine Erklärung gelesen hat, hält sich für wissend, kann das Thema später aber nicht erklären. Wir verlieren laut Blog nicht Fähigkeiten, sondern unser Gefühl fürs eigene Nichtwissen.

MerksatzKI macht aus dem Suchproblem ein Bewertungsproblem.

Warum wir KI-Antworten glauben

KI verändert nicht nur, wo gesucht wird, sondern auch, wann eine Suche als beendet gilt. Das hat weniger mit Technik zu tun als mit Wahrnehmung und Gewohnheit.

Trefferliste oder Antwort?

    Sieben Mechanismen
    MerksatzPrüfen kann der Nutzer nur, was ihm das System zeigt. Deshalb beginnt kritische Prüfung bei der Recherche, nicht beim Ergebnis.

    Halluzinationen erkennen und abfangen

    Halluzinationen betreffen nicht nur erfundene Quellen. Auch echte Quellen werden im Verlauf einer Recherche verfälscht oder zu stark verallgemeinert.

    Technische Gründe
    • Sprachmodelle erzeugen wahrscheinliche, nicht zwingend wahre Antworten.
    • Wissenslücken werden häufig plausibel ergänzt: In den Trainingsdaten folgen auf Fragen meist Antworten, bei der Feinabstimmung werden hilfreiche Antworten zusätzlich belohnt.
    Menschliche Gründe
    • Allzweck-KIs wie ChatGPT werden oft zur Recherche genutzt.
    • Fachspezifische KI-Bildung fehlt.
    Lösungen
    • Quellen prüfen und RAG-Systeme bzw. guideline-gebundenes RAG verwenden.
    • RAG reduziert, wie ich in den Workshops zeige, den Anteil von Halluzinationen bzw. unsicherer Empfehlungen deutlich.
    Wo kippt eine Quelle?

    Warum erfundene Quellen so lange unentdeckt bleiben

    Halluzinierte Quellen fallen oft nicht auf, weil Literaturverzeichnisse kaum geprüft werden. Sie werden stattdessen munter zitiert, setzen sich dadurch in den Zitationsnetzwerken fest und gewinnen scheinbar an Glaubwürdigkeit. Betroffen sind nicht nur studentische Arbeiten, sondern auch Konferenzbeiträge, Aufsätze in Peer-Review-Journalen und Handbücher. Mit bloßem Auge sind sie kaum zu erkennen: Lasse ich in meinen Workshops Professoren Literaturlisten aus ihrem eigenen Fachgebiet nach der einen halluzinierten Quelle durchsuchen, wird sie so gut wie nie gefunden.

    Dass alle Quellen einer Antwort existieren, sagt noch wenig über ihre Qualität. Laut meinen Workshop-Folien ist die Prüfung auf Halluzinationen nur ein Schritt: Selbst echte Quellen können an der Forschungsfrage vorbeigehen oder wichtige Perspektiven unberücksichtigt lassen. Zudem kann die KI Ergebnisse innerhalb einer echten Quelle verfälschen oder übermäßig verallgemeinern. Zur Existenzprüfung gehört deshalb der Abgleich mit dem Originaltext.

    Wie sich Quellen vor dem Zitieren prüfen lassen, zeigt .

    Die Frage stellen: Begriffe und Prompts

    Welche Treffer erscheinen, hängt von den Begriffen ab. Ein Kapitel zum präzisen Prompt, eines dazu, wie boolesche und semantische Suche damit umgehen, und eines zu Fachbegriffen und Thesauri.

    Vom breiten zum präzisen Prompt

    Begriffe wirken wie Register an einer Orgel: Je nachdem, welches Register gezogen wird, verändert sich der Klang. Bei KI verändert sich der semantische Suchraum.

    KI verändert die Suchlogik, aber nicht die Notwendigkeit guter Begriffsarbeit. Welche Treffer erscheinen, hängt zudem von Datenbasis, Indexierung, Suchlogik und Ranking des jeweiligen Systems ab.

    Prompt-Baukasten

    Ausgangspunkt ist die breite Frage. Bausteine anklicken: Der Prompt wächst, markiert ist jeweils der Beitrag des Bausteins. Mit allen Bausteinen entsteht im Wesentlichen der Rechercheprompt aus meinen Workshops.

    0 von 11 Bausteinen

    Was leisten breite und präzise Prompts?

    Breiter Prompt

    Geeignet, um

    • zentrale Problemfelder und Fragestellungen zu entdecken
    • einen ersten Überblick über das Forschungsfeld zu gewinnen

    Nicht geeignet, um

    • wissenschaftliche Evidenz gezielt zu prüfen
    • ein Thema differenziert und umfassend zu erschließen
    Mehrdimensionaler, präziser Prompt

    Bringt das System weg von einer rein narrativen Zusammenfassung hin zu einem strukturierten Vergleich der Studien. Er trennt Gemessenes von Wahrgenommenem und führt von „Was wissen wir?“ zu „Was wissen wir noch nicht?“.

    Was die breite Frage offenlässt und was vor den Prompt gehört

    Bei der breiten Frage „Führt der Einsatz generativer KI bei Studierenden zu Deskilling?“ bleibt offen, was „Deskilling“ genau meint, welche Kompetenzen gemeint sind, welcher Vergleich interessiert (etwa Nutzung mit und ohne KI) und welche Evidenz berücksichtigt werden soll (Experimente, Längsschnitt-, Beobachtungs-, Befragungsstudien, qualitative Studien, Reviews). Laut meinen Workshop-Folien werden deshalb unterschiedliche Kompetenzbegriffe, Wirkmechanismen und Evidenztypen in einer Antwort vermischt.

    Die Vorklärung in der Tabelle gilt mit und ohne KI und steht vor dem Prompt. Dazu gehört, welche Belege zählen (Evidenztyp), unter welchen Bedingungen sie gelten (Geltungsbereich) und welche Gegenhypothesen bzw. Alternativerklärungen mitzuprüfen sind, etwa Skill Shifting oder Kompetenzgewinn.

    MerksatzBreite Prompts kartieren das Forschungsfeld, präzise Prompts strukturieren die Evidenzsuche.
    Vorab klären: neun Dimensionen
    GeklärtDimensionLeitfrageBeispiel
    0 von 9 geklärt

    Auch ein guter Rechercheprompt führt nur dann zu validen Ergebnissen, wenn dafür die geeigneten wissenschaftlichen Recherche-Plattformen genutzt werden. Wo diese liegen, zeigt . Als Hilfsmittel empfehle ich in meinen Workshops einen Prompt-Generator für wissenschaftliche Recherche.

    Boolesch oder semantisch suchen

    OpenAlex bietet beide Suchlogiken. Welche passt, hängt davon ab, ob erkundet oder kontrolliert gesucht wird.

    Zwei Suchlogiken im Vergleich

    Welche Suche passt zur Situation?

    Warum ein langer Prompt hier scheitert

    Weitere OpenAlex-Funktionen

    Citation Tracking

    Rückwärts: welche Quellen ein Paper zitiert. Vorwärts: welche späteren Arbeiten es zitieren.

    Related Articles

    Verwandte Artikel müssen den Artikel weder zitieren noch von ihm zitiert werden.

    Field-Weighted Citation Impact

    Zeigt die Bedeutung einer Studie im Fach. In meinem Workshop-Beispiel wird sie 28-mal so häufig zitiert wie erwartet.

    OpenAlex findet viel graue Literatur, die zum Teil nicht einmal bei Google Scholar indiziert ist.

    Fachbegriffe und Thesauri: warum Latein hilft

    KI macht schlechte Begriffsarbeit unsichtbar. Früher führte eine unscharfe Suche zu wenigen und schlechten Treffern. Heute liefert KI auch bei unspezifischen Anfragen viele Publikationen und gut klingende Antworten.

    Das Ergebnis wirkt überzeugend, aber nur Eingeweihte sehen, was fehlt. Das gilt nicht nur für ChatGPT, sondern auch für spezialisierte KI-Recherchetools.

    Eine Frage, vier Konzepte
    Wie beeinflusst KI die Motivation von Studierenden?

    Ein KI-Recherchetool wie Elicit liefert dazu viele Treffer und eine Zusammenfassung mit vielen Quellen, von denen keine halluziniert ist. Trotzdem fehlt etwas: „Motivation“ ist in der Forschung in verschiedenen Theorien und Konzepten verdichtet.

    Intrinsic Motivation

    Motivation aus dem Interesse an der Sache selbst.

    Academic Engagement

    Wie aktiv und beteiligt Studierende im Studium sind.

    Self-Regulated Learning

    Wie Lernende ihr eigenes Lernen planen und steuern.

    Cognitive Load

    Wie stark eine Aufgabe das Arbeitsgedächtnis belastet.

    Das sind mehr als Synonyme für „Motivation“: Sie stehen für unterschiedliche Theorien, Perspektiven und Ansätze. Die Kurzbeschreibungen sind hier vereinfacht.

    Ohne Kenntnis der relevanten Konzepte, Theorien und Fachtermini kann die KI mit ihrer semantischen Suche den Suchraum zwar erweitern. Sie kann aber nicht bestimmen, welche Teile des Forschungsfeldes für die Fragestellung zentral sind. Das ist kein Problem der KI, sondern der fehlenden Recherchekompetenz: Schon vor KI arbeiteten viele Studierende und Lehrende kaum mit kontrolliertem Vokabular.

    Thesauri: kontrolliertes Vokabular

    Ein Thesaurus ist ein hierarchisch geordnetes Verzeichnis von Fachbegriffen. Fachthesauri gibt es seit Jahrzehnten, außerhalb systematischer Literaturrecherchen werden sie aber kaum genutzt. Sie werden nicht trotz, sondern wegen KI gebraucht: Damit die KI bei der Suche nicht alle, sondern die richtigen Register zieht (vergleiche die Orgel-Metapher in ).

    Der Blog zieht dazu den Vergleich zum Lateinunterricht: Erst der Umweg über ein altes System macht sichtbar, wie das neue funktioniert.

    Die Orgelmetapher: Register ziehen

    In meinen Workshop-Folien wirken Begriffe wie Register an einer Orgel: Je nachdem, welches Register gezogen wird, verändert sich der Klang. Bei KI verändert sich der semantische Suchraum. Für eine Recherche zu Deskilling an Hochschulen öffnet etwa „Generative AI in Higher Education“ einen breiten, heterogenen Raum, „Cognitive Offloading“ oder „Skill Shifting“ einen anderen.

    Die Wahl der Begriffe entscheidet damit, welche Literatur, Theorien und Evidenz man findet und welche unsichtbar bleibt. Breitere Begriffe bringen mehr Literatur und mehr Perspektiven, engere mehr Präzision, aber auch das höhere Risiko, angrenzende Forschung und alternative Deutungen auszuschließen. Ein bewusster Wechsel der Begriffe erweitert den Blick.

    MerksatzWer fundiert mit KI recherchieren will, muss die alten Suchtechniken kennen. Fachbegriffe und Thesauri gehören dazu.

    Grundlage: Blog-Beitrag „Wie Latein die KI-gestützte Recherche verbessert“ (4. Juni 2026). Die Beschreibung der vier Konzepte ist eine vereinfachte Erläuterung, keine Zitation.

    Die Werkzeuge: Recherche-Infrastruktur

    Typische Recherchefehler und die fünf Schritte moderner Recherche, wie KI-Recherchesysteme und KI-Recherchetools intern arbeiten, wo im wissenschaftlichen Recherchesystem KI schon steckt (Fachdatenbanken, Scholar Labs, Preprints), wie Zitationsnetzwerke Wege zur Literatur öffnen, wie Allzweck-KIs zu Recherche-Werkzeugen werden und wie sich Tools vergleichen lassen.

    Typische Recherchefehler und moderne Recherche

    Schon vor der KI hatten Hochschulen nach meiner Einschätzung ein Rechercheproblem. KI beseitigt es nicht, sondern legt neue Probleme darüber. Mein Vorschlag: mit echter Recherchekompetenz beginnen und KI sinnvoll darin einbinden.

    Sieben typische Fehler aus der Zeit vor der KI

    Ich zähle in meinem Blog sieben Gewohnheiten auf. Es ist meine Beschreibung aus der Praxis, keine Messung.

    Typische Recherchefehler (Blog, 2. Februar 2026)
    Falsche Quellen
    • Die meisten Studierenden googelten lieber, statt Bibliothekskataloge und Fachdatenbanken zu nutzen.
    • Repositorien wurden mit respektvoller Ignoranz behandelt.
    Falsche Suchtechnik
    • Phrasensuchen, Trunkierung und Boolesche Operatoren wurden nicht genutzt.
    • Die Forschungsfrage wurde so zielgerichtet eingesetzt wie eine Schrotflinte, also kaum zielgerichtet.
    • Ein Blick auf die zweite Trefferseite war selten.
    Falsche Haltung
    • Was nicht auf Deutsch oder Englisch erschienen war, war im Grunde nicht erschienen.
    • Statt systematisch zu recherchieren, dominierte die Mentalität „Ich habe was gefunden, das reicht“.

    Die Suchen waren damit kurz und oberflächlich. Der Blog macht dafür vor allem Google verantwortlich.

    Was KI daran ändert

    Mein Blog beschreibt ChatGPT als das Werkzeug, das an Hochschulen für fast alles genutzt wird, auch für die Recherche. Seine Diagnose: ChatGPT kaschiert die alten Defizite und packt neue Probleme obendrauf.

    Meine Workshop-Folien zeigen den Unterschied. Bei der klassischen Suche vor KI fielen unpassende Schlagworte in der Trefferliste sofort auf. Bei der KI-Recherche ergeben auch schlechte Prompts oft schlüssig klingende Antworten, sodass die schlechte Qualität kaum auffällt. Mehr dazu in .

    Fünf Schritte zeitgemäßer Recherche

    Mein Blog schlägt vor, zeitgemäß zu recherchieren, und nennt fünf Schritte:

    1. Wissenschaftsspezifische Recherche-KI-Tools nutzen. Es gibt eine ganze Reihe davon, und sie sind laut Blog sehr gut darin, Studien zu finden und Daten zu erklären (siehe ). Gemeint sind mehrere Tools, nicht eines.
    2. Fachdatenbanken (wieder) entdecken. Viele haben laut Blog inzwischen eigene KI-Assistenten. Anders als ChatGPT arbeiten diese auf dem Bestand der jeweiligen Datenbank, was das Risiko erfundener Quellen senkt. Ob eine Zusammenfassung die Befunde korrekt wiedergibt, ist damit nicht beantwortet (siehe und ).
    3. Tief in Repositorien eintauchen. Gemeint ist, die Forschung der eigenen Hochschule zu nutzen und Wissen aus anderen Ländern zu heben. Fremdsprachige Texte lassen sich mit KI übersetzen, Daten extrahieren und visualisieren (siehe ).
    4. Citation Tracking und semantische Cluster nutzen. Wer hat wen zitiert? Welche Themen hängen zusammen? Wissensgraphen machen das als Forschungslandkarte sichtbar (siehe ).
    5. Alle Teile systematisch verbinden. Literatur, Daten und Quellen werden miteinander verknüpft, und daraus entstehen Workflows (siehe ).

    KI kommt hier zu den klassischen Systemen hinzu und ersetzt sie nicht. In meinem Blog vom 29. Juli 2026 betone ich, dass KI allein nicht die Lösung ist und es weiterhin klassische Recherchesysteme und Suchtechniken braucht, von OPACs über Zeitschriften bis zu Fachdatenbanken. Auch meine Folien nennen klassische Suchsysteme weiterhin wichtig, weil sie Verzerrungen von KI-Tools teilweise ausgleichen.

    MerksatzNicht KI in den Suchschlitz kippen und hoffen, dass dabei Kompetenz entsteht, sondern mit echter Recherchekompetenz beginnen und KI sinnvoll darin integrieren.

    Grundlage: Blog-Beitrag „Google hat die Recherche versaut. ChatGPT erledigt den Rest.“ vom 2. Februar 2026, Blog-Beitrag „Wie man mit KI richtig recherchiert“ vom 29. Juli 2026 sowie meine Workshop-Folien vom 30.09.2026. Die Beschreibung der Fehler ist eine Einschätzung des Autors ohne Studienbeleg. Aussagen zu Tools und Fachdatenbanken geben den Stand des Beitrags vom Februar 2026 wieder.

    Wie KI-Recherchesysteme arbeiten

    Ein Sprachmodell erzeugt wahrscheinliche Antworten. Ob sie belastbar sind, hängt davon ab, woher die Quellen kommen, wie sie ausgewählt werden und was sich nachprüfen lässt.

    Vier Systemtypen im Vergleich
    Für alle Systeme gilt
    • Zusammenfassungen können Befunde übermäßig verallgemeinern oder falsch gewichten.
    • Auswahl und Weglassen sind für Nutzer nicht sichtbar.
    • Ein einzelner Suchlauf ist nicht reproduzierbar ().

    Die Zuordnung beschreibt Systemtypen, nicht jedes einzelne Tool. Grundlage sind meine Workshop-Folien und Walther (2026).

    MerksatzRAG bindet das Sprachmodell an einen Dokumentbestand und senkt so die Gefahr erfundener Quellen erheblich. Verzerrungen in Auswahl und Synthese beseitigt es nicht.

    Wie ein KI-Recherchetool intern arbeitet

    Ein KI-Recherchetool besteht aus zwei Teilen: einer Datenbasis und einer Schicht, die fragt, auswählt und formuliert. Wer beides trennt, erkennt, woher Lücken und Verzerrungen kommen.

    Zwei Schichten: Datenbasis und Interpretation

    Datenbasis (Korpus)
    • Viele Tools greifen auf dieselben Korpora zurück, zum Beispiel Semantic Scholar oder OpenAlex (Stand: Oktober 2026).
    • Ein Korpus bringt eine eigene Bias-Problematik mit.
    • Literatur, die dort nicht indexiert ist, existiert für das Tool praktisch nicht.
    Interaktions- und Interpretationsschicht
    • Das Tool nimmt Fragen in natürlicher Sprache entgegen, meist als Chat.
    • Die KI übernimmt Auswahl und Interpretation.
    • Sie sitzt als Oberfläche auf dem Korpus.

    Meine Workshop-Folien zeigen das an zwei Tools, die beide Semantic Scholar als Datenbasis nutzen (Stand: Oktober 2026). Das jeweilige Tool liefert die Such-, Interaktions- und Analyseebene. Daraus folgt: Lücken im Korpus schlagen durch (siehe ), und die KI-Schicht gleicht sie nicht aus, sondern wählt und interpretiert zusätzlich.

    Auch bei gleicher Datenbasis können zwei Tools verschiedene Treffer zeigen. Laut meinem Blog vom 29. Juli 2026 unterscheiden sich nämlich Suchlogik, Ranking und Filter. Gute Ergebnisse hängen dort von drei Ebenen ab: Fragequalität, Datenbasis und Systemlogik.

    Sieben Schritte von der Frage zur Antwort

    Die Pipeline zeige ich in meinen Folien am Beispiel eines frei nutzbaren Rechercheassistenten (Stand: Oktober 2026). Im Detail unterscheiden sich die Tools.

    SchrittWas passiert?
    1. AnfrageDer Nutzer stellt eine, meist komplexe, Forschungsfrage in natürlicher Sprache.
    2. ZerlegungDas System interpretiert Intention, Kriterien und Teilaspekte.
    3. RetrievalKandidaten-Paper werden aus dem Korpus gesucht.
    4. RerankingDie Treffer werden nach Relevanz für die konkrete Frage neu gewichtet.
    5. EvidenzextraktionPassagen und Belege werden aus den Paperdaten herangezogen.
    6. SyntheseEin Sprachmodell erzeugt Antwort, Paperliste oder Bericht.
    7. QuellenbindungAussagen werden mit Zitationen und Belegkarten verknüpft.

    Reranking und die verdeckte Rangfolge

    Der vierte Schritt ist für die Bewertung der Ergebnisse besonders wichtig. Dort entscheidet ein Modell aktiv, welche Passagen als „wichtiger“ gelten. Meine Folien führen als Kriterien beispielhaft Relevanz, semantische Nähe, Evidenzqualität und Kontextpassung an. Es entstehen verdeckte Evidenzhierarchien: Die Rangfolge bleibt für den Nutzer unsichtbar.

    Die Gewichtung richtet sich nach der Relevanz für die Frage. Sie ist keine Prüfung, ob Quellen existieren oder sauber zitiert sind. Auch die Kriterien unterscheiden sich je Tool. Bei einem zweiten Beispiel nennen meine Folien neben semantischer Relevanz unter anderem Publikationsdatum, Zitationswirkung und die Qualität des Publikationsorgans. Welche strukturellen Schwächen aus dieser Kette folgen, behandelt .

    Abstract statt Volltext

    Nach meinen Folien erfolgt die Analyse bei fast allen KI-Tools primär auf Basis von Abstracts und Metadaten. Der Vorteil ist die hohe Verarbeitungsgeschwindigkeit. Der Nachteil: Methodische Details und inhaltliche Nuancen können verloren gehen. Mein Blog nennt als Grund, dass lizenzierte Volltexte außerhalb von Open Access für die Tools bisher schwer zugänglich waren (Beitrag „Vollgas mit Volltexten. Wie Wissenschaftsverlage und KI-Anbieter die Recherche-Infrastruktur neu bauen.“ vom 4. Juni 2026). Kooperationen mit Verlagen sollen aus flüchtigen Abstract-Lektüren Volltext-Analysen machen (Beitrag „KI-Skills, Medical-Modi und Volltexte: Was beim KI-Workshop für Mediziner wirklich überraschte.“ vom 14. September 2026).

    Meine Folien zeigen das am Beispiel scienceOS (Stand: Oktober 2026). Ist ein PDF vorhanden oder zugänglich, lassen sich detaillierte Fragen zu Inhalt, Methoden, Befunden und Grenzen stellen. Ohne PDF werden Abstract und Metadaten ausgewertet.

    Wenn nur der Abstract vorliegt
    • Das Paper selbst besorgen, etwa über Google Scholar oder eine andere Plattform.
    • Es in das Tool hochladen, bei scienceOS in die Bibliothek.
    • Fragen zu Methodik und Grenzen erst danach am Volltext stellen.
    • Die Methodik nicht aus dem Abstract ableiten lassen.

    Das Hochladen externer Paper in den Chat nennen meine Folien auch bei alphaXiv (siehe ).

    MerksatzDatenbasis und KI-Schicht sind zwei Dinge: Lücken des Korpus schlagen durch, und die KI wählt und interpretiert zusätzlich. Beim Reranking entscheidet ein Modell, welche Passagen wichtiger sind, und diese Rangfolge bleibt verdeckt. Liegt nur der Abstract vor, besorge ich das PDF selbst und lade es hoch.

    Grundlage: meine Workshop-Folien vom 30.09.2026 (Pipeline und Schwächen am Beispiel von Asta, Auswahl am Beispiel von scienceOS), Blog-Beitrag „Wie man mit KI richtig recherchiert“ vom 29. Juli 2026 sowie die genannten Blog-Beiträge vom 4. Juni und 14. September 2026. Die Tools dienen nur als Beispiel. Funktionen und Korpora ändern sich schnell, Zahlen zu Korpusgrößen nenne ich deshalb nicht.

    Die Recherche-Landkarte

    Wissenschaftliche Recherche verteilt sich auf sechs Bereiche. An welchen Stellen ist KI schon integriert, und wo bleibt die klassische Suche unverzichtbar?

    Die wissenschaftliche Recherche-Infrastruktur
    gelb: KI-Integration in klassische Plattformen bzw. genuine KI-Tools Fett und punktiert unterstrichen: Steckbrief öffnen
    Die wissenschaftliche Recherche-InfrastrukturAn welchen Stationen ist KI schon integriert?

    ChatGPT, Claude, Gemini und Co. fehlen auf der Karte bewusst: Sie können Recherche unterstützen, sind aber keine genuin wissenschaftlichen Plattformen. Wie sie mit Konnektoren und Skills zu Recherche-Werkzeugen werden, zeigt .

    Warum bleiben OPAC und Fachdatenbanken auf der Karte, obwohl immer mehr KI hinzukommt? Nach meinen Workshop-Folien sind KI-Systeme datenabhängig und mit verschiedenen Verzerrungen behaftet. Sie entstehen unter anderem durch die Dominanz englischsprachiger Forschung, journalbasierte Fachkulturen, Paywalls, Zitationslogiken, Modellarchitektur und Trainingsdaten.

    Klassische Suchsysteme wie der OPAC der Bibliothek gleichen diese Verzerrungen zum Teil aus. Das ist kein Gegensatz zur KI: Im Blog schreibe ich, dass KI allein nicht die Lösung ist und es weiterhin klassische Recherchesysteme braucht, von OPACs über Zeitschriften bis zu Fachdatenbanken (29. Juli 2026). Die Verzerrungen im Einzelnen zeigt , die blinden Flecken bei Büchern und Deutschsprachigem .

    Zu Perplexity: Ich bewerte das Tool in meinem Blog (8. Januar 2026) nach der Auswertung von 22 Studien kritisch, siehe . In meinen Workshop-Folien führe ich es als Tool der Auswahl auf, dort noch ohne diesen Vorbehalt.

    Fachdatenbanken mit KI: Scopus, JSTOR, EBSCO

    Viele Fachdatenbanken haben inzwischen eigene KI-Assistenten. Die Hochschule hat sie oft lizenziert, genutzt werden sie kaum. Was sie leisten, ist selten klar.

    Der Blog nennt als Vorteil gegenüber ChatGPT, dass die Assistenten auf dem Bestand der jeweiligen Datenbank arbeiten. Das senkt das Risiko erfundener Quellen. Verzerrte oder übergeneralisierte Zusammenfassungen schließt es nicht aus (siehe ).

    Beispiel Scopus AI
    über 100 Mio.Dokumente, bibliografisch erschlossen
    über 2 Mrd.Zitationsverbindungen
    ca. 28.000Peer-Review-Journale
    über 150Metadaten-Datenpunkte je Dokument

    Scopus ist primär eine bibliografische Datenbank: In der Regel liegen keine Volltexte im System, aber Verknüpfungen dorthin. Die vielen Metadaten machen Dokumente auch ohne Volltext gut durchsuchbar. Seit 2024 gibt es einen integrierten KI-Assistenten. Wie stark ein einzelner Suchlauf schwankt, zeigt . Eine Kurzanalyse zu Scopus AI (PDF) beruht auf Praxistests und weiteren Studien.

    Drei Plattformen, drei Ausgangslagen

    Scopus

    Große bibliografische Datenbank mit KI-Assistent seit 2024. Stärke: Metadaten und Zitationsverbindungen.

    JSTOR

    Seit 2025 mit KI-Assistent: Er beantwortet Fragen zu einem Dokument, zeigt relevante Passagen und empfiehlt thematisch ähnliche Inhalte. Er arbeitet auch mit älteren Studien gut, weil bei vielen eine brauchbare OCR-Texterkennung vorliegt. Bestand: Bücher und viel Deutschsprachiges (mehr in ).

    EBSCOhost

    Bietet für seine Datenbanken inzwischen eine Suche in natürlicher Sprache. Im Mai 2026 kündigte EBSCO eine Partnerschaft mit Perplexity an.

    Verlage und KI-Anbieter bauen die Infrastruktur um

    Bisher durchsuchten die meisten KI-Recherchetools nur Abstracts und Metadaten, weil lizenzierte Volltexte außerhalb von Open Access schwer zugänglich waren. Das ändert sich durch Kooperationen mit Wissenschaftsverlagen.

    Consensus

    Kooperiert laut Blog mit Wiley, Sage, Taylor & Francis, der American Chemical Society, der American Psychological Association und zuletzt De Gruyter Brill. Im Mai 2026 warb das Unternehmen 30 Mio. Dollar Kapital ein.

    EBSCO und Perplexity

    Perplexity erhält Zugang zu tausenden Zeitschriften und Millionen Volltexten, die sonst hinter Bezahlschranken liegen. EBSCO nennt das einen „truth layer“ aus kuratierten Wissensbeständen.

    Auch Recherchetools wie Consensus und Scite binden sich als Apps und Konnektoren in ChatGPT und Claude ein: Man geht dorthin, wo die Nutzer sind (siehe ). Wie Bibliotheken diese Verbindung zu ihren Beständen herstellen können, zeigt .

    Dahinter steht eine Verschiebung, die ich im Blog beschreibe: Nicht mehr das Finden, sondern das Bewerten von Informationen wird entscheidend. Dazu muss man die Datenbestände kennen, also wissen, ob ein System nur Abstracts und Metadaten sieht oder lizenzierte Volltexte auswerten kann.

    MerksatzDie Frage „Welche Datenbank hat die meisten Papers?“ verliert an Gewicht. Wichtiger wird: Welches KI-System hat den besten Zugriff auf lizenzierte Volltexte und kann sie nachvollziehbar auswerten?

    Grundlage: Blog-Beiträge vom 27. März 2026 (Scopus AI), 16. Mai, 4. Juni und 8. August 2026 (Verlagskooperationen), 18. September 2026 (JSTOR). Die Angaben zu Kooperationen und Kapital stammen aus dem Blog und geben den damaligen Stand wieder.

    Google Scholar Labs: von der Fassade zur Volltext-Vorschau

    Scholar Labs ist die KI-Variante von Google Scholar. Ich zeige sie in meinen Workshops regelmäßig, weil sie kaum jemand kennt. Anfangs bot sie neben der Suche in natürlicher Sprache wenig mehr als knappe KI-Zusammenfassungen.

    Drei Entwicklungsschritte
    Anfang

    Suchanfrage in natürlicher Sprache, dazu ein paar KI-generierte Zeilen je Treffer. Geringer Mehrwert gegenüber dem klassischen Google Scholar.

    25. August 2026: Quick Read

    Ein Klick, und die KI fasst ein Paper strukturiert zusammen, in drei Teilen: Answers (Was sagt das Paper zu meiner Frage?), Approach (Welche Methode?), Considerations (Welche Einschränkungen?). Die Ausgabe lässt sich mit „Show details“ ausklappen.

    September 2026: Schnellüberblick

    Auch ein deutscher Prompt liefert nun die Funktion, auf Deutsch. Vorher erschien sie nur bei englischen Prompts.

    Eine Einschränkung blieb bis zuletzt: Quick Read funktioniert nur bei Artikeln, zu denen ein Volltext zugänglich ist. Wo Google Scholar nur das Abstract hat, bleibt es bei der kurzen KI-Zusammenfassung zur Suchanfrage.

    MerksatzKI-Tools ändern sich schnell. Eine Einschränkung, die heute gilt, kann in zwei Wochen behoben sein. Funktionen deshalb selbst testen, statt sich auf alte Beschreibungen zu verlassen.

    Grundlage: Blog-Beiträge vom 3. September und 19. September 2026 (mit Screenshot des deutschen Schnellüberblicks). Die Beschreibung des Funktionsumfangs gibt den Stand dieser Beiträge wieder.

    Preprints und alphaXiv

    Immer mehr aktuelle Studien erscheinen zuerst als Preprint. Wer dort recherchiert, findet die neuesten Daten. KI macht das inzwischen deutlich leichter.

    Zahlen zu arXiv
    über 30.000Preprints pro Monat neu eingereicht
    über 3,1 Mio.Paper insgesamt auf arXiv

    Angaben aus dem Blog-Beitrag vom 20. September 2026, mit Bildquelle arXiv.

    alphaXiv: ein KI-Overlay für arXiv

    alphaXiv legt sich als Oberfläche über arXiv, greift aber auch auf weitere Datenquellen zu. Technisch beschreibe ich in meinem Blog einen RAG-Ansatz mit mehrstufigem, agentischem Retrieval: Keyword-Suche, Vektorsuche, Lesen von Abstracts und Volltexten, verbunden durch ein Sprachmodell, das nach verschiedenen Metriken rankt und dann eine Antwort erstellt (mehr zur Funktionsweise in ).

    Von arXiv zu alphaXiv

    In der Adresse eines arXiv-Papers „arxiv“ durch „alphaxiv“ ersetzen, und die alphaXiv-Oberfläche öffnet sich mit dem Paper.

    Was sich damit machen lässt

    Textstellen markieren und Notizen anlegen, Formeln, Abbildungen und Absätze im Kontext des Papers erklären lassen, einen KI-Überblick als wissenschaftsjournalistischen Blogbeitrag lesen (auf Wunsch auf Deutsch), verwandte Paper suchen und Papers zur Basis eines Forschungsprojekts machen („Autoresearch“).

    Im Live-Test eines Workshops fand alphaXiv in einem medizinischen Preprint einen methodischen Fehler, den ein Teilnehmer vermutet hatte: Es markierte die Stelle und erklärte, warum die Methode dort problematisch ist. Das zeigt, dass Recherche-Tools mehr können als Literatur zu suchen. Die Grenzen bleiben: Das Ergebnis ist ein Hinweis, den man am Text prüft (siehe ). Weitere Tools wie Semantic Scholar mit dem Semantic Reader sind ebenfalls im Blog erwähnt.

    Sind Preprints unzuverlässig?

    Gegen Preprints gibt es oft den Einwand, sie seien nicht begutachtet. Eine Studie von Yin und Rust verglich 72.644 bioRxiv-Preprints mit ihren später begutachteten Fassungen:

    72.644 Preprints im Vergleich
    90 %zentrale Behauptung unverändert oder nur minimal überarbeitet
    etwa jedes 10.Paper substanziell geändert, meist nur in der Stärke des Claims
    8,1 von 10.000Preprints wurden verworfen und zurückgezogen

    Papers, die nie als Preprint erschienen, wurden laut Blog mehr als doppelt so oft zurückgezogen wie solche mit Preprint.

    EinschränkungDie Studie ist selbst ein Preprint und (noch) nicht begutachtet. Den Vergleich der 72.644 Paare hat kein Gutachtergremium übernommen, sondern ein Sprachmodell (Claude Sonnet 4.6). Sie zeigt einen Trend, keinen Beweis, und wird im Blog auch so gerahmt.

    Grundlage: Blog-Beiträge vom 15. Mai, 10. Juli, 19. August und 20. September 2026. Zum Thema gibt es am 24.09.2026, 13:30 bis 14:00 Uhr, ein kostenloses Webinar in der Reihe „Tool Tipp Thursday“ mit der DGI (Anmeldung).

    Wege zur Literatur

    Vor KI führten zwei Wege zur Literatur: Keyword-Suche und lineares Citation Tracking. KI ergänzt sie um Ähnlichkeit, Netzwerke und die Bewertung von Zitationen.

    Vom Seed Paper aus

    Folgearbeiten finden: „Zitiert von“ in Google Scholar

    Vorwärts heißt: Welche späteren Arbeiten haben das Seed Paper zitiert? So sehe ich, von wem ein Text aufgenommen wurde, und kann die Forschungslandkarte bis heute erkunden. Rückwärts folge ich dagegen der Literaturliste des Papers und sichte seine Quellen.

    Für Google Scholar beschreibe ich im Blog (14. Juni 2026) einen Dreischritt (Stand: Oktober 2026):

    1. Die Suche zeigt, welche Studien einen Suchbegriff enthalten.
    2. „Zitiert von“ unter dem Paper zeigt, welche späteren Paper sich auf die gefundene Studie beziehen.
    3. Danach öffnet sich ein Feld mit einem kleinen Haken, „In Artikeln mit Zitaten suchen“. Wer ihn setzt und Begriffe eingibt, durchsucht nicht mehr den ganzen Index, sondern nur noch die zitierenden Arbeiten.

    Der Haken ist also ein Feinfilter der Vorwärtssuche. Er hilft besonders bei oft zitierten Studien, weil er die Treffermenge auf einen Teilaspekt eingrenzt. Das Feld mit dem Haken wird nach meiner Erfahrung noch seltener genutzt als „Zitiert von“ selbst. Die Literaturliste des Seed Papers führt dagegen nur zu älteren Quellen, nicht zu Folgearbeiten.

    Schematische Darstellung mit erfundenen Studien. Auch in echten Netzwerkansichten wie in scienceOS ist die Position der Paper vor allem ein Layout-Ergebnis: Distanz ist kein Maß für inhaltliche Ähnlichkeit.

    LLM, Skill und Konnektor

    Allzweck-KIs wie Claude oder ChatGPT werden zu Recherche-Werkzeugen, wenn drei Teile zusammenkommen. Skill und Konnektor lassen sich zu- und abschalten.

    Pipeline zusammenstellen

    Stolpersteine

    Nur so stark wie das schwächste Glied

    Ein solcher Stack kann, wenn Zugriff, Einstellungen und Datenbankanbindung stimmen, mehrere Datenbanken durchsuchen, Treffer deduplizieren, nach klaren Kriterien screenen, Ausschlussgründe notieren, die Qualität bewerten und am Ende DOIs prüfen. Die Ergebnisse sind laut Blog aber oft (noch) nicht gut. Schwachstellen sind:

    Konnektor

    Erreicht relevante Quellen nicht, oder Datenbanken drosseln bzw. blockieren Anfragen. In Claude kann die Domain-Freigabe auf „nur Paketmanager“ stehen; dann müssen die relevanten Datenbanken freigegeben werden.

    Skill

    Gibt die Suchmethode zu vage vor. Ein Skill ist ein Recherche-Rezept, etwa: mindestens fünf Datenbanken durchsuchen, deduplizieren, jede Studie nach Kriterien bewerten.

    KI

    Bewertet Treffer schlecht, ist mal zu streng, mal zu großzügig, und erkennt Lücken im Korpus nicht.

    Mensch

    Vertraut zu sehr auf die KI (siehe ). Auch Datenbank-Kenntnis wird gebraucht: Wer OpenAlex, BASE, Livivo, PubMed, Scopus und Web of Science nicht kennt, kann sie nicht freigeben.

    Mehr Durchfluss bedeutet zudem mehr Dubletten, mehr irrelevante und falsch-positive Treffer und mehr Screening-Aufwand. Grundlage ist der Blog-Beitrag vom 9. Juni 2026.

    Konnektoren im Prompt nennen

    Konnektoren werden bei Claude nicht automatisch bei jeder Suche einbezogen, auch wenn sie verbunden sind. Bei ChatGPT gilt das für Plugins und Skills, dort hilft ein @ oder + im Prompt. In meinen Workshops hänge ich an den Rechercheprompt aus diesen Zusatz an:

    Nutze zusätzlich meine Konnektoren: Consensus, Elicit, alphaXiv, Scite.ai, Paperguide, Undermind und alle weiteren Recherche-Tools. Gib mir deren Treffer jeweils gesondert aus.

    Zur Begriffsklärung: Was bei Claude Konnektor heißt, heißt bei ChatGPT Plugin. In meinen Workshop-Folien beschreibe ich beide als Zugang zu externen Tools und Korpora wie Consensus, Scite oder alphaXiv. Sie öffnen den Zugang, legen aber weder die Methode fest (das leistet der Skill) noch lesen und synthetisieren sie die Texte (das leistet das Sprachmodell).

    Welches KI-Recherchetool ist das beste?

    Eine Frage, die in jedem meiner Workshops kommt. Die Antwort hängt von Fach, Ziel und Zugriff ab. Es gibt kein bestes Tool, sondern eines, das zur Aufgabe passt.

    Vier Fragen vor der Toolwahl
    Wohin will ich?

    Ein Feld erst verstehen oder tief und systematisch suchen?

    Was brauche ich?

    Genügen Abstracts, oder sind Volltexte nötig?

    Welches Fach?

    Jedes Tool deckt Disziplinen unterschiedlich gut ab. In der Medizin etwa ist der Medical-Modus von Consensus oft zu eng gewählt und übersieht Paper: Der allgemeine Korpus sollte zusätzlich durchsucht werden.

    Was ist möglich?

    Datenschutz (DSGVO), Extra-Funktionen und Preis unterscheiden sich stark. Freemium-Angebote lohnen einen Test, und für viele Abos gibt es Rabattcodes.

    Ein Benchmark mit Vorbehalt

    Im Juni 2026 erschien ein Test mit 200 komplexen Suchanfragen aus allen Fachgebieten, der SciSpace, Consensus und Elicit vergleicht. Ergebnis: Alle haben Stärken, insgesamt liegt SciSpace vorn. Als Erklärung nenne ich in meinem Blog, dass SciSpace mehrere Datenbanken gleichzeitig durchsucht (Google Scholar, PubMed, arXiv).

    OffenlegungDer Test wurde nicht von einem neutralen Institut durchgeführt, sondern vom SciSpace Research Team, die Ergebnisse berechneten KI-Modelle. Ich halte im Auftrag mehrerer KI-Anbieter, darunter SciSpace, Webinare. Der Test ist deshalb eine Momentaufnahme mit Eigeninteresse des Herstellers. Die Prüfung am eigenen Thema bleibt die beste Methode.

    Zudem verschieben sich die Verhältnisse: Consensus schließt Kooperationen mit Wissenschaftsverlagen, und Millionen Volltexte fließen in die Datenbank, was die Ergebnisse verändern wird. Auch Scite hat Partnerschaften mit medizinischen Verlagen und Fachorganisationen (etwa American Medical Association, BMJ Group, Thieme) geschlossen und gilt dem Blog für medizinische Recherche derzeit als besonders stark. Modelle und Tools zählen, aber Partnerschaftsverträge entscheiden mit darüber, ob aus Abstract-Lektüre eine Volltext-Analyse wird (siehe ).

    Regeln statt Rangliste

    Statt einer Rangliste gebe ich in meinen Workshop-Folien (Folie 68) Regeln für die Toolwahl:

    • Die Auswahl an KI-Tools ist sehr groß, am besten ausprobieren.
    • Die Tools greifen auf unterschiedliche Datengrundlagen zurück, etwa Semantic Scholar oder OpenAlex.
    • Testen, welche Tools für das eigene Themen- und Fachgebiet taugen.
    • Für den Einstieg genügt ein kostenloser Account.

    Ein Tool mit vielen Nutzern ist deshalb nicht in jedem Fach gleich gut. Nach dem Blog deckt das eine Tool ein bestimmtes Fach besonders gut ab, ein anderes hat viele Volltexte, ein drittes ist DSGVO-konform. Zur Toolwahl gehört darum die Frage nach den Datenbeständen, und dazu muss man sie kennen (Blog, 4. Juni 2026).

    Auch ein aktueller Benchmark oder eine Rangliste ersetzt den eigenen Test nicht. Er ist eine Momentaufnahme, und die Prüfung am eigenen Thema bleibt die beste Methode.

    Merksatz„Prüfet alles und behaltet das Gute.“ Das gilt auch für KI-Tools: mehrere testen, am eigenen Thema vergleichen und die Ergebnisse gegeneinander halten ().

    Grundlage: Blog-Beiträge vom 11. Juni und 14. September 2026.

    Belastbarkeit: Prüfen und Bewerten

    Verzerrungen und blinde Flecken, strukturelle Schwächen und Scheinkonsens, schwankende Ergebnisse, die Einordnung von Treffern, das Prüfen von Quellen vor dem Zitieren und die Frage, was menschliche Kontrolle leistet.

    Wo Verzerrungen entstehen

    Zwischen der Frage und der Antwort liegen fünf Stationen. An jeder können Verzerrungen entstehen.

    Die Kette der Verzerrungen

    Verzerrungen entstehen nicht nur im System, sondern auch im Dialog. Sycophancy nennt man die Neigung von Sprachmodellen, dem Nutzer zuzustimmen, auch wenn er falsch liegt. Laut Blog (14. März 2026) liegt das unter anderem daran, dass die Modelle mit menschlichem Feedback trainiert werden und dabei Antworten lernen, die Menschen gefallen. Außerdem bewerten Nutzer bestätigende Antworten oft besser.

    Memory und Personalisierung erhöhen die Relevanz der Antwort, aber auch das Risiko eines Bestätigungsbias. Wer eine Hypothese beurteilen lässt, stellt deshalb eine offene Frage mit Fragezeichen und bringt eigene Meinungen und Identitätssignale sparsam ein. Außerdem fragt er aktiv nach Unsicherheiten und fordert Quellen. Ein Teil des Problems ist systemisch und vom Nutzer nicht zu ändern.

    KonsequenzVerschiedene Recherchesysteme kombinieren. Klassische Systeme wie OPACs und Fachdatenbanken bleiben unverzichtbar, weil sie zum Teil andere Bestände und Publikationstypen erschließen und ihre Suchlogik besser steuerbar ist.

    Blinde Flecken: Bücher, Deutsch, Geisteswissenschaften

    Kein KI-Recherchetool zeigt alles. Wahrscheinlich zeigt keines auch nur die Hälfte der relevanten Literatur. Besonders groß ist die Lücke dort, wo Wissen in Büchern, auf Deutsch und in regionalen Zusammenhängen steckt.

    Was in den Korpora oft fehlt
    Bücher

    Werden von fast keinem Recherche-Tool erfasst.

    Deutschsprachiges

    Ist in den durchsuchten Korpora unterrepräsentiert.

    Randständiges und Regionales

    Wenig zitierte Arbeiten gehen oft unter, Regionalia sind kaum vorhanden.

    Warum die Geisteswissenschaften besonders betroffen sind

    Fächerkultur

    Die Fächer sind stark monografisch geprägt, forschen traditionell häufiger auf Deutsch, setzen weniger auf Zitationsmetriken und haben viele regionale Schwerpunkte.

    Zurückhaltung der Verlage

    Viele geisteswissenschaftliche Verlage und Plattformen standen und stehen KI eher kritisch gegenüber. Die geringe Repräsentation ist also nicht nur ein Produkt der KI-Architektur, sondern auch der Verlagspolitik.

    Ein Beispiel ist JSTOR, eine der größten Plattformen für geisteswissenschaftliche Texte und Bücher. Nach Einschätzung des Blogs gewährt JSTOR externen KI-Rechercheplattformen keinen Zugang zum eigenen Korpus, der Autor formuliert das ausdrücklich unter Vorbehalt („wenn ich recht informiert bin“). Kooperationen wie bei Consensus oder Scite in anderen Disziplinen (siehe ) gibt es dort demnach nicht. Dafür hat JSTOR seit 2025 einen eigenen KI-Assistenten, und die Plattform führt mehr Bücher, mehr Deutschsprachiges und mehr regionalwissenschaftliche Forschung als viele andere Datenbanken.

    Fünf Gründe, warum Tools verschiedene Treffer zeigen

    1. Jedes Tool greift auf andere Datenbestände zurück, die sich nur zum Teil überlappen.
    2. Selbst bei gleicher Datenbasis unterscheiden sich Suchlogik, Ranking und Filter. Manche Tools zerlegen die Frage und verfolgen Zitationen, andere suchen nach semantischer Ähnlichkeit.
    3. Titel, Abstract, Volltext und Zitationskontext werden unterschiedlich genutzt.
    4. Generative und agentische Komponenten arbeiten probabilistisch: Zusammenfassungen und Kategorisierungen können selbst beim gleichen Prompt stark abweichen (siehe ).
    5. Jedes Tool ist für eine andere Aufgabe gebaut: schnelle Synthese, systematisches Screening, Citation Tracking.

    Deshalb sind mehr Treffer nicht automatisch besser, und Übereinstimmungen sind kein Wahrheitsbeweis: Greifen mehrere Systeme auf denselben Index zu, teilen sie womöglich denselben blinden Fleck. Auch fachlich exzellente Arbeiten können nirgends auftauchen, wenn die Metadaten schwach sind oder ein Begriff im Ranking nicht zieht. Gute Ergebnisse hängen laut Blog von drei Ebenen ab: Fragequalität, Datenbasis und Systemlogik.

    Liefert die KI-Suche zu einem regionalgeschichtlichen Thema mit überwiegend deutschsprachigen Büchern kaum Treffer, ist das keine Aussage über den Stand der Forschung. Bücher, Deutschsprachiges und Regionalia fehlen in den Korpora oft. Zudem genügen schwache Metadaten, damit auch fachlich exzellente Arbeiten nirgends auftauchen. Kaum Treffer sind deshalb noch kein Beleg für eine Forschungslücke. Klassische Systeme wie der OPAC der Bibliothek gleichen diese Verzerrungen nach meinen Workshop-Folien zum Teil aus (Folie 38) und gehören deshalb zusätzlich in die Suche.

    Heißt es zu einem Nischenthema, es gebe kaum Literatur, suche ich als Nächstes auf Repositorien. Oft lieferten Abschlussarbeiten und Dissertationen die entscheidenden Daten, nicht Studien in Peer-Review-Journalen. Sie liegen meist auf Repositorien, und dort schaut kaum jemand nach, etwa über BASE. Manche Hochschulen erklären Abschlussarbeiten pauschal für nicht zitierwürdig. Ich wünsche mir, Arbeiten nach ihrem Inhalt zu bewerten statt nach ihrem formalen Namen (Blog, 1. Juli 2026).

    MerksatzSysteme auswählen, Datenbasis verstehen, Lücken erkennen, Evidenz prüfen. Und dann von vorn.

    Grundlage: Blog-Beiträge vom 29. Juli 2026 („Wie man mit KI richtig recherchiert“) und 18. September 2026 („Die KI-Recherche hat ein Geisteswissenschaften-Problem“). Die Aussagen zu JSTOR und den Korpora sind Einschätzungen des Autors, keine Herstellerangaben.

    Strukturelle Schwächen und Scheinkonsens

    Neben Lücken im Korpus (siehe ) haben KI-Recherchetools Schwächen, die in ihrer Bauweise liegen. Sie wirken selbst dann, wenn die Datenbasis gut ist. Ihr Ergebnis kann am Ende wie ein einhelliger Forschungsstand aussehen, obwohl das Feld umstritten ist.

    Vier strukturelle Schwächen

    In meinen Workshop-Folien vom 30.09.2026 zeige ich die Schwächen am Beispiel eines Rechercheassistenten. Laut Untertitel der Folie gelten sie für fast alle KI-Tools. Ich formuliere sie deshalb allgemein.

    Stark vorselektierte Evidenzmenge

    Das Tool arbeitet mit einer stark vorselektierten Evidenzmenge. Es bleibt gegebenenfalls viel Literatur unberücksichtigt. Eine KI-Synthese ist deshalb keine Vollerhebung.

    Reranking mit verdeckter Evidenzhierarchie

    Nach dem Suchen werden die Treffer für die konkrete Frage neu gewichtet (Reranking). Dabei entscheidet das Modell aktiv, welche Passagen als „wichtiger“ gelten. Der Nutzer sieht diese Hierarchie nicht.

    Verstärkung von Bekanntem

    Tools, die Literatur über Zitationsnetzwerke erweitern, verstärken die bestehende Sichtbarkeit. Häufig zitierte Forschungsrichtungen werden bevorzugt, wenig beachtete Arbeiten bleiben unsichtbar.

    Sprachliche Nähe

    Semantische Ähnlichkeit bevorzugt sprachlich ähnliche Papers. Methodisch relevante, aber anders formulierte Arbeiten fehlen deshalb eventuell, auch wenn sie im Korpus liegen. Wie semantische Suche funktioniert, steht in .

    Die Kette von der Zerlegung der Anfrage über Retrieval, Reranking und Evidenzextraktion bis zur Synthese und Quellenbindung (Folie 74) besteht aus mehreren Schritten. Retrieval, Reranking und Evidenzextraktion wählen dabei jeweils aus. Wie die Schritte ablaufen, zeigt .

    Der Scheinkonsens

    Aus diesen Schwächen kann ein Scheinkonsens entstehen. Mit dem Begriff meine ich in meinem PDF „Scheinkonsens durch KI-gestützte (wissenschaftliche) Recherchen“ den Eindruck einer weitgehend stabilen wissenschaftlichen Übereinstimmung, obwohl das Feld plural, kontrovers oder paradigmatisch gespalten ist.

    Ein Scheinkonsens ist kein Fake und keine Halluzination. Es geht nicht um erfundene Quellen. Es ist eine systematische Verzerrung durch Auswahl und Darstellung der Ergebnisse.

    Bei der Auswahl
    • Bevorzugt werden häufig zitierte Arbeiten, etablierte Zeitschriften, neue Studien vor älteren, gut strukturierte Abstracts und bekannte Namen oder Institutionen.
    • Unterrepräsentiert sind fachliche Minderheitspositionen, theoretische Alternativen, kleine Journale und graue Literatur wie Abschlussarbeiten und Dissertationen.
    • Sichtbarkeit wird mit Relevanz verwechselt.
    Bei der Darstellung
    • KI-Zusammenfassungen glätten tendenziell Widersprüche und entfernen Einschränkungen.
    • Worte wie „however“, „contested“ oder „limited evidence“ verschwinden.
    • Die Aussagen wirken oft kohärenter als die Originaltexte.

    Der Scheinkonsens bleibt stabil, weil Nutzer dem selbstbewussten Sprachstil vertrauen, Quellen seltener prüfen und die Recherche früher beenden. Außerdem wissen sie oft nicht, dass alle KI-Tools nur auf einen Teil der relevanten Daten zugreifen. Die gefühlte Klarheit steigt, während die Breite des Wissens sinkt.

    Was dagegen hilft

    • Gezielte Dissens-Prompts und eine explizite Suche nach Gegen- und Minderheitspositionen, etwa: „Suche nach Daten, die dem widersprechen …“ (siehe auch ).
    • Mehrere KI-Recherchetools einsetzen.
    • Zusätzlich traditionelle Suchtechniken und Portale nutzen, also Fachdatenbanken und Bibliothekskataloge (siehe ).
    • Misstrauen gegenüber „zu glatten“ Ergebnissen entwickeln und Konsens als potenzielles Problem betrachten, nicht als Lösung.
    MerksatzEine stimmig klingende KI-Zusammenfassung ist kein Beleg für Konsens, denn sie kann ein kontroverses Feld glätten und Einschränkungen weglassen.

    Grundlage: meine Workshop-Folien vom 30.09.2026 (Folien 74, 77 und 78) und das PDF „Scheinkonsens durch KI-gestützte (wissenschaftliche) Recherchen“ (Walther 2026), verlinkt im Blogbeitrag „Wie KI bei Wissensrecherchen für Scheinkonsens sorgt & was dagegen getan werden kann“ (Januar 2026).

    Eine KI-Suche ist kein Endergebnis

    KI-Recherchetools können bei ähnlichen oder sogar identischen Anfragen unterschiedliche Quellen auswählen, gewichten und zusammenfassen. Selbst derselbe Prompt am selben Computer liefert nicht immer dasselbe.

    Reale Daten: Scopus-AI-Test

    Drei inhaltlich nahezu identische Suchläufe mit dem KI-Assistenten der Fachdatenbank Scopus lieferten zusammen 163 Referenzen (Walther 2026).

    138Referenzen nur in einem Lauf
    22Referenzen in zwei Läufen (rechnerisch)
    3Referenzen in allen drei Läufen

    Die 22 sind aus den genannten Zahlen errechnet: 163 minus 138 minus 3. Schon dieselbe Frage auf Deutsch statt auf Englisch verschiebt die Treffermenge massiv.

    Zum Protokoll einer KI-Suche gehört nach meinem Blog (31. Juli 2026) mehr als das Wiederholen. Ich lasse denselben Prompt mehrfach laufen, teste Varianten und zähle nach jedem Lauf, wie viele Titel neu sind. Diese Zahl sollte irgendwann sinken. Sinkt sie, nähert sich die Suche einer Sättigung, und weitere Läufe bringen weniger Neues. Ob ein Treffer existiert und taugt, sagt sie nicht, das klärt erst die Prüfung (siehe ). Danach vergleiche ich die Ergebnisse, auch mit KI, hinsichtlich Suchmethodik und Abdeckung.

    Auch innerhalb eines Tools hängt das Ergebnis vom Modus ab. In einem Test (Blog, 25. Juni 2026) gab ich in Perplexity denselben Prompt in der normalen Suche, im Academic-Modus und in einem Space mit fest hinterlegten Rechercheregeln ein. Die normale Suche lieferte 30 Quellen, der Academic-Modus 16 Studien, der Space 45. Normale Suche und Academic hatten keine Quelle gemeinsam, Academic und Space eine, normale Suche und Space drei.

    Ich spreche von drei Ausschnitten aus einem Tool. Verglichen werden sollte deshalb innerhalb eines Tools, zwischen Tools und zwischen den Säulen der Recherche-Infrastruktur, also OPACs, Fachdatenbanken, Preprint-Servern, Repositorien und KI-Tools.

    KonsequenzEin einzelner KI-Suchlauf ist kein belastbares Rechercheergebnis und lässt sich nach üblichen Standards nicht transparent machen. Nötig sind Prozess- statt Prompt-Dokumentationen. Ein Vorschlag dafür steht im Logbuch von .
    Zum Ausprobieren: denselben Prompt mehrfach starten

    Schematische Simulation mit erfundenen Treffern. Sie zeigt nur das Prinzip: Ein Kern kehrt immer wieder, der Rand wechselt.

    LaufTrefferdavon neu

    Was daraus für die Praxis folgt

    • Recherche mit demselben Prompt mehrfach durchführen.
    • Prüfen, ob zusätzliche Suchen noch relevante neue Literatur liefern.
    • Formulierungen und Suchbegriffe variieren.
    • Neue und wiederkehrende Treffer vergleichen.
    • Ergebnisse mit klassischen Suchwegen und Citation Tracking ergänzen.

    Treffer bewerten und einordnen

    Ein Treffer ist noch kein Beleg. Zitationszahlen, Zeitschriftenindikatoren und Zitationskontexte helfen bei der Einordnung, ersetzen aber nicht die Frage, was eine Studie tatsächlich gemessen hat.

    Dieselbe Studie, zwei Zitationszahlen
    Zitationen in scienceOS27
    Zitationen bei Google Scholar55

    Beispiel aus meinen Workshops: Gerlich (2025), „From Offloading to Engagement“. Die Balken sind auf 60 Zitationen skaliert. Die Zahlen weichen ab, weil Datenbanken unterschiedliche Abdeckungs- und Indexierungsmethoden verwenden. Keine der beiden ist „die richtige“.

    Vier Signale zur Einordnung
    Gemessen, wahrgenommen oder Einstellung?
    Gemessen

    Tatsächliches Können oder Wissen, festgestellt durch Aufgabe oder Test.

    Wahrgenommen

    Selbsteinschätzung: Was Befragte über ihr eigenes Können sagen.

    Einstellung

    Haltung oder Zufriedenheit gegenüber KI oder einem Angebot.

    Die Aussagen stammen aus Walther (2026), dort stehen auch die jeweiligen Studien. Die Zuordnung folgt der Unterscheidung aus dem Rechercheprompt.

    Warum Umfragen täuschen können

    Soziale Erwünschtheit

    Studien zur Informationskompetenz nutzten meist Umfragen. Das führte zu Verzerrungen durch sozial erwünschte Antworten. Wurde das Rechercheverhalten technisch erfasst, fielen die Ergebnisse deutlich schlechter aus.

    Wackelige Evidenz zu KI

    Auch bei KI werden fast nur Angebote und Selbstauskünfte gemessen. Eine Meta-Meta-Analyse von 67 Meta-Analysen (Bartoš et al. 2026) fand erhebliche Publikationsbias und andere Mängel, sodass valide verallgemeinernde Aussagen über Lernwirkungen kaum möglich seien.

    Liefern mehrere KI-Tools weitgehend dieselben Treffer, folgt daraus noch nichts Verlässliches. Übereinstimmung ist kein Wahrheitsbeweis: Greifen mehrere Systeme auf denselben Index zu, teilen sie womöglich denselben blinden Fleck. Kein Tool zeigt alles, und mehr Treffer sind nicht automatisch besser. Dass kein weiteres Tool etwas Zusätzliches findet, belegt deshalb keine Vollständigkeit (Blog, 29. Juli 2026; Folie 37). Warum Tools unterschiedliche Treffer zeigen, steht in .

    Die Zahl der Zitierenden sagt noch nicht, wie die Fachwelt eine Studie aufgenommen hat. Mehr verrät der Zitationskontext. Tools wie Scite und scienceOS ordnen Zitationen als unterstützend, erwähnend oder widersprechend ein (Stand: Oktober 2026). Eine Zitation ist also nicht automatisch eine Bestätigung. Die Zuordnung beruht auf einer semantischen Analyse von Sprache, Formulierung und Zitationskontext und ist damit selbst eine KI-Auswertung. Sie geht über die reinen Zitationszahlen hinaus (meine Workshop-Folien zu Scite und scienceOS). Wie das im Netzwerk aussieht, zeigt .

    Auch eine Studie, die Vorbehalte gegen Preprints entkräftet, ist selbst zu prüfen. Die Untersuchung von Yin und Rust zu 72.644 bioRxiv-Preprints ist laut Blog (10. Juli 2026) selbst ein Preprint und noch nicht begutachtet. Den Vergleich der Preprints mit ihren begutachteten Fassungen hat zudem kein Gutachtergremium übernommen, sondern ein Sprachmodell. Ich messe Vorbehalte gegen Preprints gern an Daten. Befund und Methode sind deshalb zusammen zu prüfen. Mehr zur Studie steht in .

    MerksatzErst fragen, ob etwas gemessen, wahrgenommen oder nur eingestellt ist, dann fragen, wie viel es zählt.

    Vor dem Zitieren prüfen

    Gefundene Quellen und Dokumente immer auf Echtheit prüfen und zusätzlich sicherstellen, welche Inhalte nach mehreren Arbeitsschritten noch aus dem Originaltext stammen. Die Existenz einer Quelle zu prüfen, ist dabei nur die niedrigste Prüfstufe.

    Stufe 1: Existenz

    Gibt es die Quelle wirklich? Leicht zu prüfen, wird aber oft nicht einmal das getan.

    Stufe 2: Inhalt

    Steht die Aussage im Originaltext, und ist sie im Verlauf nicht verfälscht oder übergeneralisiert worden?

    Stufe 3: Auswahl

    Wurden die Quellen angemessen ausgewählt, und sind Gegenbefunde berücksichtigt? Geprüft werden kann nur, was das System zeigt. Deshalb beginnt diese Stufe bei der Recherche.

    Vor dem Zitieren

    Wie groß ist das Problem?
    147.000geschätzte halluzinierte Referenzen im Jahr 2025, konservativ, aus über 111 Mio. Literaturangaben (Zhao et al. 2026)
    17.000Paper bei Google Scholar mit dem ChatGPT-Parameter utm_source=chatgpt.com im Februar 2026 (Bienz et al. 2026)
    32.500solche Zitationen bei einer Prüfung des Autors am 9. August 2026

    Als Hauptursache gilt die massenhafte Nutzung von Allzweck-KIs für die Literaturrecherche, als zweite ein fehlendes Problembewusstsein: In der bisher größten Umfrage zur KI-Nutzung unter deutschen Wissenschaftlern mit über 6.000 Teilnehmern kommt das Thema Halluzinationen nicht einmal vor.

    Halluzinierte Referenzen in der Medizin (Topaz et al., The Lancet, Mai 2026)
    2,47 Mio.Papers aus PubMed Central Open Access, Januar 2023 bis Februar 2026
    4.046fabrizierte Referenzen in 2.810 Papers, alle peer-reviewt
    1 von 2.828 → 1 von 277Papers mit mindestens einer halluzinierten Referenz, 2023 gegenüber Anfang 2026

    Geprüft wurden rund 97 Mio. Referenzen mit PubMed-ID. Wie ich im Blog schreibe, kommen Halluzinationen in der Medizin nicht häufiger vor als in anderen Fächern, die Fallhöhe ist aber größer. Bei weniger streng geprüften Publikationsorten ist das Problem vermutlich größer. Offen bleibt, wie viel auf Sprachmodelle, Paper Mills oder einzelne Akteure entfällt: relativ viele Fälle stammten von einer kleinen Gruppe von Autoren.

    Ein Prüfweg in scienceOS: Deep Citation Check

    Der Deep Citation Check dient der Quellen- und Zitierkontextprüfung. Nach meinen Workshop-Folien geht es in vier Schritten:

    1. Alle im Manuskript zitierten Quellen in die scienceOS-Bibliothek hochladen.
    2. Ein neues Projekt erstellen und die Quellen dem Projekt hinzufügen.
    3. Das zu prüfende Manuskript in einen Projekt-Chat hochladen.
    4. In „Deep Research“ jede Aussage mit der jeweils zitierten Quelle abgleichen lassen.

    Anleitung von scienceOS. Weitere Prüfwerkzeuge wie BibFox und Halluzinations-Erkennungs-Skills stehen in .

    Die drei Prüfebenen gehen auf ein Modell des Bibliothekars Aaron Tay zurück, das ich im Blog aufgreife (2. August 2026). Er unterscheidet: Quellen prüfen (existieren sie, oder hat die KI halluziniert?), Aussagen prüfen (stützen die Quellen die jeweilige Behauptung?) und die Quellenabdeckung prüfen (wurden Gegenbefunde ausgelassen, erlauben die Evidenzen diese Schlussfolgerungen?). Meine „Stufe 3: Auswahl“ heißt bei Tay also Abdeckung.

    Ich ergänze: Kritische Prüfung endet bei der dritten Ebene nicht, sie beginnt dort. Dafür muss man wissen, welche Suchsysteme auf welche Bestände zugreifen. Kritisch prüfen heißt deshalb zuerst, die eigene Recherche und die Recherche-Infrastruktur dahinter zu analysieren.

    MerksatzPrüfen heißt dreierlei: Existiert die Quelle, steht die Aussage wirklich darin, und wurde angemessen ausgewählt?

    Human-in-the-loop: was die Evidenz sagt

    Alle sagen, der Mensch müsse die KI kontrollieren. Ob das hilft, hängt davon ab, wie die Kontrolle gestaltet ist. Die Evidenz ist gemischter, als der Satz vermuten lässt.

    Das Konzept stammt von Norbert Wiener aus den 1940er Jahren und war als Sicherheitsnetz gedacht: Feedback-Schleifen in komplexen, potenziell gefährlichen Systemen, in denen der Mensch korrigierend eingreifen kann. Ich habe für meinen Blog fünf KI-Systeme nach der Wirksamkeit gefragt. Die Antworten fielen nicht einheitlich aus:

    Fünf Systeme, fünf Zusammenfassungen (Blog, 4. Juli 2026)
    Perplexity

    Mensch-KI-Kombinationen übertreffen die beste Einzelkomponente im Durchschnitt nicht, sondern schneiden signifikant schlechter ab. Ausnahme: Inhaltserstellung.

    ChatGPT

    Die Evidenz ist heterogen. Eine Meta-Analyse fand im Mittel Unterlegenheit der Kombination, mit Gewinnen eher bei kreativen und Verlusten eher bei Entscheidungsaufgaben.

    Claude mit Skill und Konnektoren

    Automatisierungs-Bias und „Out-of-the-Loop“-Probleme. Die größte Meta-Analyse (106 Studien, 370 Effektstärken) findet im Schnitt schlechtere Ergebnisse der Kombination, vor allem bei Entscheidungsaufgaben.

    SciSpace

    Menschliches Feedback verbessert typischerweise Leistung, Fehlerreduktion und Robustheit, besonders bei unsicheren Eingaben, abhängig von Einsatzszenario und Prozessdesign.

    Consensus

    HITL verbessert häufig Genauigkeit, Sicherheit und Akzeptanz, besonders in risikoreichen oder datenarmen Aufgaben. Ohne gutes Interface, Training und Eskalationslogik drohen Übervertrauen und Bias.

    Die Zusammenfassungen stammen aus verschiedenen Modi und Tools und sind selbst KI-Ausgaben. Sie zeigen vor allem, wie unterschiedlich die Systeme dieselbe Frage einordnen (vergleiche ).

    Zwei Mechanismen tauchen immer wieder auf: Automatisierungs-Bias, also das unkritische Abnicken von Vorschlägen des Systems, und der Verlust von Situationswahrnehmung, wenn ein Eingriff nur selten nötig ist. Beides gilt auch für KI-Recherche, etwa wenn Trefferlisten und Zusammenfassungen ungeprüft übernommen werden (siehe ).

    Wie Automatisierungs-Bias wirkt, zeigt sich bei KI-Statistiktools. Sie liefern Analysen und Grafiken, doch je bequemer die Statistik wird, desto größer die Versuchung, sie nicht mehr zu verstehen. Ihre Ergebnisse klingen gut, wirken rund und sehen grafisch überzeugend aus, also wird es schon stimmen. In den meisten Fällen stimmt es auch. Ohne Fachwissen lässt sich aber kaum prüfen, in welchen nicht.

    Als Ansatz nenne ich im Blog (25. Dezember 2025), die Ergebnisse mehrerer Tools miteinander zu vergleichen. Das macht allerdings kaum jemand. Ein weiteres Risiko ist der Code unter der Haube: Für einzelne Tools zeigen Studien, dass er funktioniert, bei anderen fehlen diese Daten noch.

    Konsequenz„Der Mensch prüft es ja“ ist kein Qualitätsnachweis. Kontrolle wirkt, wenn Prüfpunkte, Kriterien und Zuständigkeiten klar festgelegt sind, wie in den Prüfstufen von .

    Grundlage: Blog-Beitrag vom 4. Juli 2026. Die genannten Meta-Analysen sind dort über KI-Ausgaben vermittelt, nicht im Original zitiert. Wer sich darauf stützen will, sollte die Primärquellen selbst prüfen.

    Die Hochschule: Bibliotheken und KI-Bildung

    Recherchekompetenz entsteht nicht im Werkzeug, sondern in Institutionen. Drei Kapitel: Bibliotheken als Schlüsselinstanz und die Lücke zwischen Angebot und Wirklichkeit in der KI-Bildung (Thesen 5 und 6 aus Walther 2026) sowie KI-Betrug, Detektoren und Prüfungsformen.

    Hochschulbibliotheken im KI-Zeitalter

    Die Studierenden, die jetzt an die Hochschulen kommen, sind nicht mehr Schlagwort-sozialisiert, sondern gewohnt, per Prompt zu recherchieren. Bibliotheken werden zur KI-Schlüsselinstanz oder verlieren weiter an Bedeutung. So lautet These 5 (Walther 2026).

    Sechs Handlungsfelder
    Vom KI-Tool zum Volltext

      Schulungen heute

      Wie sie aussehen

      Die meisten Schulungen dauern 60 bis 90 Minuten, bestehen aus einer Sitzung, bleiben auf Einführungsniveau und sind eher allgemein als fachspezifisch. Fast alle Angebote sind freiwillig, die Teilnahme ist insgesamt noch deutlich zu niedrig. Der Anteil der KI-Kurse wächst, ist aber quantitativ und qualitativ noch nicht ausreichend.

      Was fehlt

      Vertiefende Angebote, Schulungen zu speziellen KI-Tools und dazu, wie KI den wissenschaftlichen Workflow von der Themenfindung bis zur Publikation verändert. Es fehlen auch Wirkungsforschung, valide Zahlen zur Reichweite und aktuelle bundesweite Daten zur Verankerung. Aufbauen lässt sich die neue Informationskompetenz nicht durch Bibliotheken allein (weiter in ).

      Warum ein volles Haus wenig beweist

      Gegen die These vom Bedeutungsverlust wird oft eingewandt, die Bibliotheken seien voll. Ich halte das nicht für einen Gegenbeleg: Studierende können die Bibliothek füllen und trotzdem bei ChatGPT recherchieren. Institutionelles Ansehen und individuelles Verhalten sind nicht gekoppelt. In der Studie einer europäischen Hochschulallianz, die ich im Blog zitiere, gilt die Bibliothek vor allem als ruhiger Arbeitsplatz. Wer eine ungenügende Antwort erhält, formuliert den Prompt neu und vereinbart keinen Beratungstermin. Für die Annahme, Bibliotheken würden durch KI wichtiger, gibt es laut Blog keine Belege.

      MerksatzKlassische Recherchewege und KI-Kompetenz müssen zusammen vermittelt werden: Ohne die klassischen Wege gelingt auch im KI-Zeitalter keine strukturierte Recherche.

      KI-Bildung: Angebot und Wirklichkeit

      KI-Bildung und Informationskompetenz bleiben mangelhaft, und die Hochschulen haben daran großen Anteil. So lautet These 6 (Walther 2026).

      Angebot, Nutzung, Wirkung
      Wer trägt Verantwortung?

      Das Muster ist alt

      Ausgangslage vor KI

      Die Informationskompetenz der meisten Studierenden und vieler Lehrender war mangelhaft, eine fundierte, curricular verankerte Vermittlung gab es kaum. Schon eine BMBF-Studie von 2001 stellte fest, dass sie eher autodidaktisch erfolgt und Information Literacy und Lehre zwei getrennte Welten sind. Die Suchen waren kurz, unterkomplex und unsystematisch, Google und Wikipedia dominierten.

      Warum die Daten täuschten

      Studien nutzten meist Umfragen, was zu Verzerrungen durch sozial erwünschte Antworten führte. Bei KI wiederholt sich das: Gemessen werden fast nur Angebote und Selbstauskünfte. Auch der Wissenschaftsrat sieht dringenden Bedarf an empirischer Evidenz (mehr dazu in ).

      Warum die Hochschultools nicht genutzt werden

      Dasselbe Modell, andere Verpackung

      Unter der Haube läuft bei Hochschultools wie HAWKI laut Blog oft dasselbe Modell wie bei ChatGPT. Studierende und Dozenten meiden demnach nicht das schlechtere Modell, sondern die datenschutzfreundlichere Verpackung desselben Modells. Der Grund ist Gewohnheit, dazu kommen Bekanntheit, Bedienkomfort und Funktionsumfang. Auf diese Weise entsteht die Schatten-KI, und ChatGPT ist ihr größter Vertreter.

      Meine Position

      Ich halte Nutzung für nicht wegregulierbar, aber für sicherer machbar. Datenschutz muss dort ansetzen, wo die Daten verarbeitet werden, nicht dort, wo Institutionen sie gern verarbeitet hätten. Mein Ansatz ist pragmatisch: in die Einstellungen des tatsächlich genutzten Tools gehen (im Blog: ChatGPT) und erklären, was die einzelnen Optionen für Datenschutz und Nutzungskomfort bringen.

      „DSGVO-konform“ ist kein Label. Laut Blog ist es das Ergebnis eines Prüfprozesses, und geprüft werden die Tools auf ihre DSGVO-Konformität oft nicht. Zugleich werden vielerorts Experimente mit dem Schlagwort „Datenschutz“ von vornherein verhindert, und die Schatten-KI-Nutzung blüht trotzdem. Zum gefahrlosen Üben arbeite ich in Hochschulen und Firmen mit synthetischen Datensätzen.

      Anreize statt Appelle

      Lösungsgeber ist rational

      Die KI-Didaktik wünscht KI als Sparringspartner, die meisten Studierenden nutzen sie aber als Lösungsgeber. Ich kann es ihnen nicht verdenken: Werkzeuge werden entlang der Anreize genutzt, die ein System setzt. Bewerten Leistungsnachweise vor allem Endprodukte wie Hausarbeiten oder Programmcode, ist KI rational betrachtet ein Endproduktgenerator. Das Problem liegt damit im System der Leistungsnachweise, nicht bei einzelnen Studierenden.

      Ethik-Richtlinien reichen nicht

      Richtlinien setzen voraus, dass jeder die Regel kennt und danach handelt. Ich halte dagegen: Kaum jemand liest sie, die meisten handeln nur danach, wenn sie passen, und Rationalisierungen lösen Widersprüche später auf. Nach Parker et al. (2026) stieg in einer Befragung die Nutzung stark und KI galt zunehmend als ethisch in Ordnung. Empfohlen wird eine Kombination aus Regeln, KI-Bildung, transparentem Einsatz und kritischem Denken.

      Fachwissen als Voraussetzung: das Fudan-Experiment

      An der Fudan-Universität in Shanghai stellten Studierende in der Klausur eines Data-Mining-Kurses der KI Fragen, an denen sie scheitert. Vorher mussten sie die Aufgaben selbst lösen, denn ohne Fachwissen lassen sich die Ergebnisse der KI nicht prüfen. Wer ihre Grenzen testen will, muss außerdem wissen, wie ein KI-System funktioniert und auf welche Daten es Zugriff hat. So verband das Experiment Fachexpertise mit KI-Bildung (laut Blog). Meine Überlegung im Blog: Nicht nur Prüfungen umbauen, sondern ganze Studiengänge KI-robust machen und Fachwissen und KI-Bildung von Beginn an verschmelzen.

      MerksatzVorhandensein von Angeboten ist nicht Nutzung, und Nutzung ist nicht Kompetenz.

      KI-Betrug, Detektoren und Prüfungsformen

      Generative KI ist tief in den Studienalltag integriert, und viele Prüfungen finden unbeaufsichtigt statt. Hochschulen stehen unter Druck, Täuschung zu verhindern, und greifen deshalb zu KI-Detektoren. Ich halte das für den falschen Weg.

      Was KI-Detektoren tun

      Detektoren prüfen nicht, wie ein Text entstanden ist, sondern nur, wie er aussieht. Grundlage sind statistische Muster, nicht Wissen über die Autorschaft. Das Ergebnis ist eine Schätzung, keine Gewissheit.

      Was ein Ergebnis nicht sagt

      „Diesen Text hat KI geschrieben.“

      Was ein Ergebnis sagt

      „Dieser Text ähnelt vielen KI-Texten.“

      Warum sie als Beweis nicht taugen

      • Detektoren können nicht unterscheiden, ob ein Text von einer KI stammt, von einem Menschen geschrieben oder mit KI-Hilfe überarbeitet wurde.
      • Auch menschliche Texte können KI-typisch wirken, besonders sehr klare, formale und sprachlich saubere Arbeiten. Studien wie Liang et al. (2023) und Erol et al. (2025) zeigen mehr Fehlalarme bei kurzen, sachlichen Texten und bei ausländischen Studierenden.
      • Weber-Wulff et al. (2023) fanden in einem systematischen Test viele Fehlalarme und raten, die getesteten Systeme nicht im akademischen Bereich einzusetzen.
      • Laut Walther (2026) zeigen viele Studien, dass eine leichte Überarbeitung von KI-Texten die Erkennung deutlich senkt. Täuschung lässt sich also leicht verschleiern.

      Ein Verdacht kann Nichtbestehen und einen Täuschungsvorwurf bedeuten. Dafür braucht es sehr verlässliche Grundlagen, und die liefern Detektoren nicht.

      Plagiatssoftware ist etwas anderes

      Plagiatssoftware

      Sie prüft Übereinstimmungen mit echten Quellen.

      KI-Detektor

      Er stellt auf Basis statistischer Muster eine Vermutung an.

      Beide Begriffe werden oft synonym verwendet, sind es aber nicht. In Prüfungsordnungen ist der Einsatz von Plagiatssoftware oft geregelt, der von KI-Detektoren häufig nicht. Eine Prüfungsordnung, die Plagiatssoftware erlaubt, erlaubt daher nicht automatisch Detektoren.

      Der rechtliche Rahmen

      Die folgenden Aussagen fasse ich nur zusammen. Sie stammen aus meiner Analyse „Sollen an Hochschulen KI-Detektoren eingesetzt werden?“ (Walther 2026, Stand 31. Januar 2026), die sich auf Heckmann/Rachut (2024) und Baresel et al. (2025) stützt. Das ist keine Rechtsberatung.

      • Eine Täuschung muss nachgewiesen werden, und die Beweislast liegt bei der Hochschule.
      • Indizien müssen nachvollziehbar, überprüfbar und widerspruchsfrei sein.
      • Gerichtsurteile sehen in Detektoren laut Walther (2026) höchstens einen Hinweis, keinen Beweis. Nötig bleibt eine eigenständige, transparente menschliche Bewertung.
      • Schreibstil, Fehlerfreiheit und Qualität einer Arbeit sind laut Heckmann/Rachut (2024) keine belastbaren Indizien für KI-Einsatz.
      • Ob bei Prüfungen eine freiwillige Einwilligung in die automatisierte Verarbeitung nach Art. 22 Abs. 2 DSGVO vorliegt, ist umstritten (Baresel et al. 2025). Eine Abgabe ohne Detektor-Prüfung müsste dann immer möglich bleiben.

      Baresel et al. (2025) raten deshalb von Detektoren an Hochschulen ab. Sie wollen die Prüfungsformate und Prüfungskulturen insgesamt auf den Prüfstand stellen.

      Alternative: andere Prüfungsformen

      Meine Position lautet: Hände weg von Detektoren, andere Prüfungsformen. Was das heißt, beschreibe ich im Blogbeitrag „Wie man Studium und Prüfungen KI-robust macht“ vom 31. August 2026 nach einem Workshop für Lehrende der Sozialen Arbeit.

      • Prüfungen sollten mehr mündliche Teile enthalten.
      • Sie sollten Wissenschaft mit Transfer- und Fallaufgaben verbinden.
      • Sie sollten stärker iterativ angelegt sein.
      • Das bedeutet mehr Betreuung. Aber nur so funktioniert es, meine ich.
      Das Fudan-Beispiel

      An der Fudan-Universität in Shanghai war eine Klausur im Data-Mining-Kurs umgekehrt aufgebaut. Die Studierenden stellten der KI Fragen, an denen die KI scheitert, und je öfter die KI scheiterte, desto besser die Note. Die Aufgaben mussten sie vorher selbst lösen, denn ohne Fachwissen lassen sich die Ergebnisse der KI nicht prüfen. Das Prinzip: Wer KI-Fehler finden will, braucht Fachwissen. Meine Überlegung im Blogbeitrag vom 12. Juli 2026: Vielleicht wäre es besser, nicht nur Prüfungen umzubauen, sondern ganze Studiengänge KI-robust zu machen und Fachwissen mit KI-Bildung von Beginn an zu verbinden.

      MerksatzEin KI-Detektor-Ergebnis ist nur eine Schätzung aus statistischen Mustern, nach der ausgewerteten Rechtsprechung höchstens ein Hinweis, und die Beweislast liegt bei der Hochschule.

      Grundlage: PDF „Sollen an Hochschulen KI-Detektoren eingesetzt werden?“ (Walther 2026, Stand 31. Januar 2026) zum Blogbeitrag „Zahl der KI-Betrugsfälle an Hochschulen wächst. KI-Detektoren versprechen Aufklärung. Forscher und Juristen sehen das anders“ (30. Januar 2026); Blogbeiträge „Wie man Studium und Prüfungen KI-robust macht“ (31. August 2026) und „An dieser Uni bekommen Studierende bessere Noten, je öfter die KI versagt – und wir sollten das genau so machen“ (12. Juli 2026). Die Rechtsaussagen sind eine Zusammenfassung und keine Rechtsberatung. Die Forderung nach anderen Prüfungsformen ist meine Position.

      Abschluss

      Ein Rechercheablauf, der alles verbindet, dazu der Weg zum Quiz und alle Quellen.

      Ein Rechercheablauf

      Die Kapitel dieser Seite lassen sich zu einem Ablauf verbinden. Er kombiniert KI und klassische Suchwege und hält den Weg nachvollziehbar fest.

      Acht Schritte
      0 von 8 erledigt
      Recherche-Logbuch

      Ein Suchlauf lässt sich nicht 1:1 wiederholen. Deshalb ist Prozess- statt Prompt-Dokumentation gefragt. Die Felder unten füllen ein Logbuch, das sich kopieren lässt.

      Das Logbuch ist ein Vorschlag aus Workshop und Walther (2026), kein genormtes Verfahren.

      Selbsttest

      Das Quiz zu dieser Seite hat 40 Fragen in fünf Runden, die den Teilen dieser Seite folgen, dazu einen Mischtest. Es fragt nach Zusammenhängen statt nach Einzelheiten. Am Ende jeder Runde steht ein Merksatz, und falsche Antworten verweisen auf das passende Kapitel.

      Fünf Runden und ein Mischtest
      1. Ausgangslage: warum KI-Antworten überzeugen und was das für die Recherche bedeutet
      2. Die Frage stellen: Begriffe, Prompts und Suchlogik
      3. Werkzeuge verstehen: Datenbasis, Pipeline und Auswahl
      4. Prüfen und Bewerten: Existenz, Stützung und Abdeckung der Quellen
      5. Hochschule und Praxis: Angebot, Nutzung, Prüfungen und Detektoren

      Zum Quiz

      Quellen und Weiterlesen

      Die Links stammen aus meinen Workshop-Folien vom 15.09.2026 und aus meinem Blog.

      Die sechs Thesen und diese Seite

      Der Beitrag „Vom Google-Dilemma zum KI-Dilemma?“ (Hochschulforum Digitalisierung, 17.08.2026, CC BY-SA 4.0) formuliert sechs Thesen. So verteilen sie sich auf die Kapitel:

      These (sinngemäß)Auf dieser Seite
      1 Das Google-Dilemma war die Generalprobe: Die KI-Antwort wirkt wie das Ende der Suche.,
      2 KI tritt zwischen Nutzer und Quelle: Aus dem Suchproblem wird ein Bewertungsproblem, Suchläufe sind nicht reproduzierbar., ,
      3 KI steckt in weiten Teilen der Recherche-Infrastruktur, genutzt wird sie kaum. bis
      4 Halluzinierte Quellen zeigen die Wahl falscher Systeme und ein Qualitätsproblem.,
      5 Hochschulbibliotheken werden KI-Schlüsselinstanz oder verlieren weiter an Bedeutung.
      6 KI-Bildung und Informationskompetenz bleiben mangelhaft, die Hochschulen haben daran großen Anteil., ,

      Alle Links

      Inhalte: Danny Walther, Recherche-Workshops HTWK Leipzig (26.08. und 15.09.2026) und Blog (Dezember 2025 bis Januar 2026), ki-recherchen.de. Interaktive Aufbereitung mit Claude. Angaben zu Tools und Zahlen entsprechen dem Stand meiner Workshop-Folien und sollten vor der Weitergabe geprüft werden.
      Impressum

      Angaben gemäß § 5 DDG
      Danny Walther, Freiberufler
      Hammerstraße 10, 04277 Leipzig, Deutschland

      Kontakt: info@ki-recherchen.de, Telefon +49 178 8212548
      Wirtschafts-Identifikationsnummer lt. § 139c AO: DE 405495295-00001

      Verantwortlich für den Inhalt nach § 18 Abs. 2 MStV: Danny Walther, Hammerstraße 10, 04277 Leipzig

      Datenschutzerklärung