Digital resources in the Social Sciences and Humanities OpenEdition Our platforms OpenEdition Books OpenEdition Journals Hypotheses Calenda Libraries OpenEdition Freemium Follow us

Test der Nutzungsmöglichkeiten von ChatGPT für das (Geschichts-)Studium

Die Nutzung von KI für Recherche- und Lernzwecke ist nach wie vor riskant. Ich wollte mir eine Erklärung für ein Modell der Geschichtsdidaktik ausgeben lassen, damit die KI es mir erklären kann, während ich anderweitig beschäftigt bin, beispielsweise mit Wäschewaschen oder Spülen. Ohne Vorwissen zum Thema hätte ich allerdings Falschinformationen erhalten. Die KI hat mehrfach halluziniert und dabei Dinge erklärt, die schlichtweg nicht stimmten.

Der Prompt lautete: „Kannst du mir das FUER-Modell aus der Geschichtsdidaktik erklären?“ Die KI gab zwar eine Erklärung aus, die sinnvoll und glaubwürdig klang, jedoch nicht vollständig zutraf. Bereits der erste Abschnitt enthielt eine Falschinformation:

„Ja. Das FUER-Modell ist eines der einflussreichsten Kompetenzmodelle der deutschsprachigen Geschichtsdidaktik. Es wurde von der FUER-Gruppe entwickelt (der Name steht ursprünglich für den Forschungsverbund der beteiligten Universitäten) und beschreibt, welche Kompetenzen Menschen benötigen, um historisch denken zu können. Es geht also weniger darum, möglichst viele historische Fakten zu kennen, sondern darum, Geschichte reflektiert zu verstehen und mit ihr umzugehen.“

Der Name des Forschungsverbunds setzt sich jedoch nicht aus den beteiligten Universitäten zusammen.

Mit dem nächsten Prompt: „Woher sind deine Quellen? Bitte mach es neu und gib deine Quellen an. Denn in der letzten Antwort sind Fehler.“ hat die KI deutlich länger „nachgedacht“ und anschließend tatsächlich eine korrekte Antwort geliefert. Jeder Absatz war zudem mit passenden Internetquellen belegt.

Diese Erfahrung mit KI hat wieder einmal gezeigt, was bereits häufig gesagt wurde und wovor immer wieder gewarnt wird: Die generierten Antworten entsprechen der wahrscheinlichsten Antwort, also dem, was statistisch am ehesten zutrifft, nicht zwangsläufig der richtigen Antwort. Das hängt damit zusammen, wie KI-Modelle trainiert werden. Die ausgegebene Antwort wird also nicht automatisch auf ihre Richtigkeit überprüft. Das kritische Denken bleibt uns daher nach wie vor selbst überlassen.

Um weiterzumachen, habe ich mir den bislang geschriebenen Text auf Grammatik- und Zeichenfehler überprüfen und anschließend korrigiert ausgeben lassen. Diese Aufgaben scheinen für KI besser geeignet zu sein. Meiner Überprüfung nach hat die KI alles richtig gemacht und mir einen grammatikalisch korrekten Text ausgegeben, ohne den Originaltext wesentlich zu verändern. Auch Bibliografien und Quellenangaben zu vereinheitlichen, erledigt die KI recht zuverlässig, weshalb ich sie dafür bei Hausarbeiten sehr gerne nutze.

Nun wollte ich noch eine letzte Sache testen. Letztes Jahr war es ein Trend, die KI einen bestimmten Buchstaben in Wörtern zählen zu lassen. Deshalb wollte ich überprüfen, ob sie auch die Zeichenanzahl eines Textes korrekt bestimmen kann. Die Antwort lautete:

„Der korrigierte Text umfasst:
• 2.096 Zeichen (inklusive Leerzeichen)
• 1.814 Zeichen (ohne Leerzeichen)

Falls du stattdessen die Zeichenzahl ohne die Zitatformatierung (z. B. *, >, **) oder als reinen Fließtext benötigst, kann ich diese ebenfalls ausrechnen.“

Bevor ich das überprüfte, nahm ich noch den Vorschlag an, die Zeichenzahl als reinen Fließtext anzugeben. Da mein Text ohnehin keine Markdown-Formatierung enthielt, war ich gespannt, ob sich dadurch etwas ändern würde. Die Antwort lautete:

„Als reiner Fließtext (ohne Markdown-Formatierung wie >, * oder **) umfasst der Text:
• 2.078 Zeichen (inklusive Leerzeichen)
• 1.787 Zeichen (ohne Leerzeichen)

Wenn du den Text zusätzlich ohne Absatzumbrüche als einen einzigen Fließtext meinst, bleibt die Zeichenzahl bis auf die entfernten Zeilenumbrüche nahezu identisch. In diesem Fall wären es 2.074 Zeichen inklusive Leerzeichen (da die vier Zeilenumbrüche entfallen).“

Die Zeichenzählung von Word ergab 1.787 Zeichen ohne Leerzeichen, was mit der zweiten Zählung übereinstimmte. Mit Leerzeichen wurden jedoch 2.069 Zeichen angezeigt. Es haben sich also anscheinend neun zusätzliche Leerzeichen eingeschlichen. Ich kann mir allerdings nicht erklären, woher diese stammen. Die Differenz ist jedoch so gering, dass ich sie als insignifikant betrachte. Offenbar haben die Entwickler*innen das frühere Problem bei der Zeichenzählung inzwischen weitgehend behoben.

Diese Tests haben mir insgesamt erneut nahegelegt, dass ich KI für Aufgaben im Studium nutzen kann, die lediglich Zeit kosten würden. Inhaltliche oder kreative Arbeiten bleiben jedoch weiterhin meine eigene Aufgabe.

 


OpenEdition schlägt Ihnen vor, diesen Beitrag wie folgt zu zitieren:
lhofmann (30. August 2026). Test der Nutzungsmöglichkeiten von ChatGPT für das (Geschichts-)Studium. Archivalia. Abgerufen am 10. September 2026 von https://doi.org/10.58079/16p84


5 Gedanken zu „Test der Nutzungsmöglichkeiten von ChatGPT für das (Geschichts-)Studium“

  1. Chat-GPT eignet sich ganz hervorragend für die sprachliche Analyse von zeitgenössischen Texten, darunter auch von Briefen und Emails. Der Tonfall eines/einer Historiker/in* eines führenden Instituts für Geschichtsforschung wurde von Chat-GPT ohne Umschweife folgendermaßen beschrieben:

    – Streng autoritär und hierarchiebetont (Befehl-und-Gehorsam)
    – Extrem direkt und grenzüberschreitend unhöflich (Aggressiver Stil)
    – Bürokratisch und unflexibel (Rigider Regel-Fokus)
    – Mangel an Empathie und moderner Führungskompetenz
    – pauschale Behauptungen
    – Beharren auf der eigenen Machtposition, Unflexibilität gegenüber externen Anforderungen

    Der Selbsttest wird das selbe Ergebnis bestätigen 🙂

  2. Mit ist absolut schleierhaft, wie Sie zu diesem Ergebnis kommen! Ein relativ gut eingestelltes aktuelles Modell von ChatGPT Plus (inkl. eines sauberen systemweiten Prompts, angepasst auf Historiographie) spuckt mir auf diese simple One-Shot-Frage, ohne weiteres Prompting ca. 2-3 DIN-A4-Seiten Text, inkl. Quellenangaben und löst das Akronym vermutlich sauber auf: “Förderung und Entwicklung eines reflektierten und (selbst-)reflexiven Geschichtsbewusstseins”.

    Geprüft habe ich diese nun nicht, weil mich das inhaltlich nicht interessiert. Aber ich habe das Gefühl, dass Sie hier über Dinge schreiben, mit denen Sie sich nicht mal ansatzweise beschäftigt haben. Dazu passen auch Aussagen wie “Diese Erfahrung mit KI hat wieder einmal gezeigt, was bereits häufig gesagt wurde und wovor immer wieder gewarnt wird: Die generierten Antworten entsprechen der wahrscheinlichsten Antwort, also dem, was statistisch am ehesten zutrifft, nicht zwangsläufig der richtigen Antwort. Das hängt damit zusammen, wie KI-Modelle trainiert werden.” Das mag in seiner Allgemeinheit richtig sein, ist aber eigentlich schon derart vereinfachend, dass man damit nichts anfangen kann. Die Zeiten des “stochastic Parrots” sind weitgehend vorbei — wenngleich klar ist, und da gibt es bei ArXiv auch genug Paper, dass Halluzinationen inhärent sind, da gebe ich Ihnen ja recht –, Recherche, Rückkopplung, RAG & Co. sind praktisch immer dabei. Und hätten Sie angepasste Tools wie Perplexity genutzt (oder einfach gleich sauber geprompted), wären Ihre Ergebnisse vermutlich sofort gut gewesen. (Prüfen muss man immer, aber das gilt auch, wenn man im Brockhaus oder Wikipedia nachschlägt.)

    Kurz: Sie machen einfach Fehler bei der Anwendung eines Hilfsmittels und schließen unzulässig, dass das Hilfsmittel mangelhaft ist. Es ist als würden Sie nach einer Volltextsuche in einem historischen Korpus zur dt. Geschichte (bspw. den Plenarprotokollen des Bundestages) sagen: Oh, ich habe nichts zum Nichtverbreitungsvertrag gefunden, da gab es keine Diskussion im Parlament, und nicht berücksichtigt haben, dass es vielleicht eher unter Atomwaffensperrvertrag, NPT oder Kernwaffensperrvertrag etc. pp. läuft.

    PS: Was das zählen angeht, praktisch jedes moderne LLM aktiviert dafür seine Codeumgebung und übergibt den Text an ein kleines Script, dass dann die Zählung übernimmt: print(len(“””Hier meine Antwort einfügen”””))

  3. Interessantes Experiment insofern, als ich selbst mit ähnlicher Fragestellung die Lieferung verschiedener verfügbarer KI’s geprüft habe – die Ergebnisse stimmen exakt mit Ihren überein: KI ist nichts, aber auch gar nichts für eine Suche nach “Wissen”, geschweige denn brauchbarer “Erkenntnis”, und schon gar keine Hilfe für Recherche nach unbekannten Sujets, also nix z.B. für Schülerreferate oder fix zusammengehämmerte Lösungen von schriftlichen Seminaraufgaben der ersten Semester, wenn du keinen Ahnung hast. Zur Literatur: Gedrucktes findes sie auch auf Nachfrage nur, wenn das Sujet titelgebend ist. Entscheidende Quellen, selbst wenn diese als Digitalisate zur Verfügung stehen, kann sie nicht nennen, die findest du via KI nur, wenn du sie kennst und sie also nach etwas fragst, das du ohnehin längst weißt und hast.

    Mein Prüfgegenstand war/ist ein Sujet, dass a) in der Forschung (Geisteswissenschaft) relativ exklusiv ist, und b) in der (noch seltenen, aber gelegentlich auch open access-)Literatur mitunter mit i.d.R zwei verschiedenen Bezeichnungen geführt wird. Dabei hab ich auch die Quelle einer stets wiederholten KI-Unstimmigkeit in der ansonsten wie bei Ihnen manierlichen Erklärung gefunden, und damit auch den Beleg für das, was diese Maschine nunmal ist: ein hochgerüsteter Zählmechanismus im Internet – Abstimmung mit den Füßen, google hochgerüstet?! Sätze bauen kann sie gut, aber auch da so glatt wie ein errechnetes Idealantlitz – also sprachlich entsprechend langweilig und letztlich nichtssagend.

    1. Kleine Ergänzung, Ihofnmann, zu Ihrem letzten Absatz: dem würde ich, so wie er da steht, widersprechen mögen. Aber das wär’ ein neues Thema: Suchen & Finden (nebst trial & error?;-) und die vermeintliche Zeitersparnis.

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

This site uses Akismet to reduce spam. Learn how your comment data is processed.