Automatisierte Erfassung und semantische Erschließung der Vereinsauflösungen im „Amtlichen Nachrichtenblatt“ 1938–1940
- Hosting-Organisationen
- Universität Wien
- Verantwortliche Personen
- Markus Stumpf und Martin Gasteiner
- Beginn
- Ende
Nach dem „Anschluss“ Österreichs im Jahr 1938 wurden zahlreiche Vereine, Organisationen und Verbände durch den sogenannten Stillhaltekommissar zwangsweise aufgelöst. Die entsprechenden Verfügungen wurden im „Amtlichen Nachrichtenblatt“ veröffentlicht. Sie bilden eine wichtige Quelle für die Erforschung der systematischen Zerschlagung der österreichischen Zivilgesellschaft sowie der Verfolgung und Enteignung insbesondere jüdischer Organisationen während des Nationalsozialismus.
Bislang sind diese Quellen jedoch nicht systematisch digital erschlossen. Das Projekt entwickelt daher einen KI-gestützten Workflow, mit dem die in den Nachrichtenblättern dokumentierten Vereinsauflösungen automatisiert erfasst, strukturiert und semantisch angereichert werden können. Die entstehenden Daten sollen für historische Forschung, Gedenkinitiativen und digitale Forschungsinfrastrukturen nachhaltig nachnutzbar gemacht werden.
Über das Projekt
Im Zentrum des Projekts steht die Entwicklung und Erprobung einer mehrstufigen Verarbeitungskette für die Jahrgänge 1938 bis 1940 des „Amtlichen Nachrichtenblatts“. Sie verbindet Verfahren der Optical Character Recognition (OCR) mit KI-gestützter Informationsextraktion, Qualitätskontrolle und strukturierter Datenmodellierung.
Die Arbeiten umfassen insbesondere:
- Sicherung, Sichtung und Analyse der relevanten Jahrgänge sowie ihrer Formate, Layoutvarianten und typischen Formulierungen
- Anwendung und Optimierung von OCR-Verfahren zur Aufbereitung der digitalisierten Quellen
- KI-gestützte Extraktion zentraler Angaben wie Vereinsname, Ort, Auflösungsdatum, Begründung und Informationen zum Verbleib des Vereinsvermögens
- Qualitätskontrolle und Überführung der extrahierten Informationen in ein strukturiertes Datenmodell
- Vorbereitung von Exportformaten und Schnittstellen zu bestehenden Forschungs- und Erinnerungsinfrastrukturen
Seit Projektbeginn wurden die relevanten Jahrgänge gesichert und hinsichtlich ihrer formalen und inhaltlichen Struktur untersucht. Auf dieser Grundlage wurde eine Verarbeitungskette konzipiert, die OCR, Vorverarbeitung, Informationsextraktion, Qualitätskontrolle und Datenexport miteinander verbindet. Darüber hinaus wurden Möglichkeiten zur Verknüpfung der erschlossenen Informationen mit Normdaten und kontrollierten Vokabularen wie der Gemeinsamen Normdatei (GND) und Wikidata geprüft.
Als Zwischenergebnis liegt ein technischer Prototyp für wesentliche Teile der Extraktionskette vor. Dieser ermöglicht unter manueller Kontrolle die vorläufige Verarbeitung einzelner Ausgaben des „Amtlichen Nachrichtenblatts“. Erste, teilweise nachkuratierte Testdatensätze wurden bereits im vorgesehenen Datenmodell erfasst. Sie bestätigen die grundsätzliche Eignung des Ansatzes für eine skalierbare Erschließung des Gesamtbestands.
Die vollständige Konfiguration und Abstimmung der einzelnen Verarbeitungsschritte soll Anfang 2026 abgeschlossen werden. Die skriptbasierte Verarbeitung des gesamten Quellenbestands ist für Februar bis Anfang März 2026 vorgesehen. Ob darüber hinaus ein eigenständiges Userinterface für Endnutzer entwickelt wird, ist derzeit noch offen.
Die im Projekt entwickelten Codes, Skripte und Prompts werden in einem GitLab-Repository dokumentiert und veröffentlicht. Dadurch sollen die eingesetzten Workflows und Prompt-Strukturen transparent, nachvollziehbar und für vergleichbare Projekte nachnutzbar werden. Ergänzend ist der Aufbau einer strukturierten Datenbank vorgesehen, die perspektivisch mit bestehenden Infrastrukturen des Nationalfonds verknüpft werden soll.
Das Projekt leistet damit einen Beitrag zur FAIR-orientierten Aufbereitung historischer Quellen, zur digitalen Erforschung der nationalsozialistischen Verfolgungs- und Enteignungspolitik sowie zur Weiterentwicklung KI-gestützter Erschließungsverfahren in den Digital Humanities.