An dieser Uni bekommen Studierende bessere Noten, je öfter die KI versagt - und wir sollten das genau so machen
Im Grunde sind sich alle einig: KI verändert Studium und Prüfung grundlegend. Im Studium sollen die Studis lernen, KI kritisch zu nutzen, die Ergebnisse zu prüfen und ihren eigenen Geist anzustrengen. Und die Prüfungen sollen so gestaltet sein, dass sie KI-robust sind, d.h. es muss Aufgaben geben, die von der KI nicht so einfach gelöst werden können. Auf jeden Fall muss ein klar erkennbarer Eigenanteil des Prüflings sichtbar werden: mündliche Prüfungen, iterative Aufgaben und eine schriftliche Reflektion des KI-Einsatzes sind Möglichkeiten. Der Fokus muss stärker auf Prozessen als auf Ergebnissen liegen, mehr auf Nachdenken als auf Nachplappern. Das Problem: so einig sich alle darin sind, so wenig Praxiserfahrungen gibt es. Die Forderungen nach KI-zeitgemäßen Studien- und Prüfungsformen sind und bleiben oft nicht mehr als Handreichungs-Prosa.
Das Gegenmodell: die Fudan-Universität in Shanghai
Nicht so an der Fudan-Universität in Shanghai. Dort wurde der Spieß jetzt umgedreht und die Klausur eines Data-Mining-Kurses so konzipiert, dass nicht die Studierenden die Fragen beantworten mussten, sondern die KI. Das heißt: die Studis mussten der KI die Fragen stellen. Und zwar am besten solche, die die KI nicht beantworten konnte ( Link).

Natürlich mussten die Studis die Aufgaben vorher selbst lösen, denn ohne Fachwissen geht's nicht, sonst ließen sich die Ergebnisse der KI auch nicht prüfen. Aber dann wurde die KI malträtiert. Auf diese Weise wurde Fachexpertise mit KI-Bildung verbunden. Denn nur wenn man weiß, wie ein KI-System funktioniert, auf welche Daten es Zugriff hat und auf welche nicht, erst dann kann man anfangen, Aufgaben zu bauen, die es an seine Grenzen bringen.
Wobei jedes System andere Grenzen hat, weshalb es auch je verschiedene Punkte für "besiegte" Sprachmodelle gab. Ein Claude-Fehler gab 3 Punkte, ein DeepSeek-Fehler 1,5. Je besser die KI, desto wertvoller ihr Versagen. Und: je öfter die KI scheiterte, desto besser die Note.
Das Ergebnis: Bis auf einen, der offensichtlich bei der Aufgabenstellung gepennt hatte, brachten alle 51 Studis mindestens ein Modell zum Stolpern. Allerdings gelang es nur vieren, die LLMs systematisch zu überfordern.
Das ist wichtig, gerade für unsere KI-Debatten, denn es zeigt, dass man den Stoff tief verstehen muss, um die Maschine zu "besiegen".
Der bessere Weg: Studiengänge KI-robust machen
Das erfordert Zeit. Aber vielleicht wäre das eine bessere Herangehensweise: nicht einfach die Prüfungen umbauen, sondern die ganzen Studiengänge KI-robust machen. Das heißt Fachwissen mit KI-Bildung von Beginn an verschmelzen. Oder es zumindest mal ein Semester lang an einem Thema probieren.
Ich habe Ähnliches schon oft in meinen Workshops getan und gefragt: "Wie muss man eine Aufgabe bauen, damit eine KI daran scheitern kann?" Das bringt die Leute ins Denken und fördert das Verständnis mehr als jede Handreichung mit Veränderungsprosa. Und: KI-robuste Prüfungsaufgaben bekommt man damit gleich noch dazu :)
Die Hochschulen müssen Studium und Prüfungen KI-robust machen. Es fehlt nicht an Ideen, sondern an der Umsetzung. China liefert.


