Holle Meding und Aurel Daugs | Digitale Geschichte(n). Projekte und Praktiken der Digital History
Wie verändert sich die geschichtswissenschaftliche Forschungspraxis, wenn probabilistische Modelle für Recherche, Quellenerschließung und Interpretation eingesetzt werden? Welche Formen von Bias treten auf, wenn kommerzielle Modelle, die zu großen Teilen auf anglophonen Internetquellen trainiert sind, für die Auswertung historischer Archivdokumente genutzt werden? Mit diesen Fragen beschäftigen sich aktuelle Projekte an der Humboldt-Universität zu Berlin und der Freie Universität Berlin, die den Einsatz von Large Language Models als methodische und epistemologische Herausforderung für die Geschichtswissenschaft untersuchen. Als Ergebnisse dieser Arbeiten sind zwei Beiträge für den neuen Sammelband Understanding Science with Large Language Models? Potentials for the History, Philosophy, and Sociology of Science entstanden.
Der erste Beitrag, On the Use and Limitations of Large Language Models in Historical Scholarship (Meding/Daugs 2026a, S.71–101), diskutiert fünf strukturelle Herausforderungen beim Einsatz von Large Language Models (LLMs) in der historischen Forschung. Diese betreffen einerseits bekannte Probleme wie Halluzinationen, Gegenwartsbias oder Opazität, andererseits verweisen sie auf grundsätzliche Fragen, wie sich probabilistische Sprachmodelle zu den epistemischen Standards historischer Forschung verhalten.
Zugleich argumentieren wir, dass diese Grenzen einen Einsatz von LLMs nicht grundsätzlich ausschließen. Wenn Problemstellung, Datenbasis und Evaluationskriterien klar definiert sind, lassen sie sich durchaus produktive Anwendungsfelder erkennen. Wie ein solcher kritisch integrierter Umgang praktisch aussehen kann, zeigen wir exemplarisch anhand einer LLM-basierten und domänenspezifischen Named Entity Recognition (NER), d.h. die automatisierte Erkennung und Klassifikation von Entitäten wie Personen, Organisationen oder historischen Ereignissen, in geschichtskulturellen Diskursen auf Social Media, bei denen LLMs klassische NLP-Verfahren (Natural Language Processing, also etablierte Verfahren der automatisierten Sprachverarbeitung) übertreffen können.
Der zweite Beitrag, From RAGs to Rich Responses (Meding/Daugs 2026b, S.353–368), knüpft hier an den ersten Aufsatz an und untersucht mit Retrieval-Augmented Generation (RAG), inwiefern sich die Zuverlässigkeit generativer Modelle steigern lässt, wenn Antworten an externe Quellenbestände, in diesem Fall einen großen Korpus historischer Zeitungsartikel, rückgebunden werden. Gemeinsam loten beide Beiträge damit die Grenzen und Potenziale generativer KI für die Geschichtswissenschaften anhand konkreter Anwendungsfälle aus.