Zum Hauptinhalt springen

WB meets MHDBDB: Die Wenzelsbibel als Pilotmodell für interoperable Editionen

Hosting-Organisationen
Universität Salzburg
Verantwortliche Personen
Julia Hintersteiner
Beginn
Ende

Das Projekt „WB meets MHDBDB“ widmet sich der Integration der Wenzelsbibel, einer böhmischen Prosa-Bibelübersetzung aus dem Jahr 1390, in die Mittelhochdeutsche Begriffsdatenbank (MHDBDB). Ziel ist es, die Wenzelsbibel als Pilotmodell für die Entwicklung interoperabler digitaler Editionen zu etablieren. Die Edition wird erstmals vollständig lemmatisiert, POS-getaggt und semantisch erschlossen in einer öffentlich zugänglichen Datenbank bereitgestellt. 

Die Wenzelsbibel umfasst etwa 150.000 Wörter, verteilt auf fünf Bücher (Genesis, Exodus, Leviticus, Numeri, Deuteronomium). Ihre Integration in die MHDBDB erfolgt unter Berücksichtigung der Prinzipien von Linked Open Data (LOD) und den FAIR-Prinzipien (Findable, Accessible, Interoperable, Reusable). Das Projekt eröffnet neue Möglichkeiten für die semantische Modellierung mittelhochdeutscher Begriffe und deren interdisziplinäre Verknüpfung mit anderen Forschungsdatenbanken. 

Über das Projekt 

Das Projekt basiert auf einem mehrstufigen Prozess zur Datenaufbereitung und Integration: 

  • Entwicklung eines nachhaltigen Workflows: Ein automatisierter Workflow wird entwickelt, um die Editionsdaten der Wenzelsbibel verlustfrei in ein MHDBDB-kompatibles Format zu überführen. Dieser Workflow nutzt Python-Skripte und LLM-Technologien, um die Daten effizient zu transformieren und zu annotieren. 
  • Semantische Harmonisierung: Die semantische Struktur der Wenzelsbibel wird an die Ontologien und kontrollierten Vokabulare der MHDBDB angepasst. Dies umfasst die Verknüpfung zentraler Begriffe mit etablierten LOD-Vokabularen wie Wikidata, CIDOC CRM und ICONCLASS. 
  • Automatische Lemmatisierung und POS-Tagging: Mithilfe von LLM-Technologien werden die Wortformen der Wenzelsbibel automatisch lemmatisiert und mit Part-of-Speech-Tags versehen. Ambige und ungematchte Formen werden durch maschinelle Disambiguierung weiter bearbeitet. 
  • Semantische Modellierung: Die mittelhochdeutschen Begriffe der Wenzelsbibel werden semantisch erschlossen und in das Begriffsnetz der MHDBDB integriert. Dies ermöglicht eine tiefere Analyse der Begriffsverwendung, Narratologie und intertextuellen Verbindungen. 

Das Projekt trägt zur Stärkung der digitalen Forschungsinfrastrukturen bei und bietet eine methodische Grundlage für die Nachnutzung komplexer Editionsdaten. Die Ergebnisse sollen nicht nur die Nachnutzung digitaler Editionen verbessern, sondern auch neue Forschungsperspektiven zur Begriffsverwendung und intertextuellen Vernetzung eröffnen.