Zum Hauptinhalt springen

OCR/HTR Workshop for Under-resourced and Under-represented Languages in Digital Humanities

Hosting-Organisationen
Central European University (CEU)
Verantwortliche Personen
Alíz Horváth
Beginn
Ende

Viele digitale geisteswissenschaftliche Projekte setzen voraus, dass gedruckte oder handschriftliche Quellen zuverlässig maschinenlesbar gemacht werden können. Während OCR- und HTR-Verfahren für einige weit verbreitete Sprachen und Schriften bereits gut etabliert sind, bestehen bei unterrepräsentierten und ressourcenschwachen Sprachen, insbesondere bei nicht-lateinischen Schriften, weiterhin erhebliche technische und methodische Herausforderungen. Der Workshop reagierte auf diesen Bedarf, indem er Forschende, Bibliotheksfachleute und technische Expert:innen zusammenbrachte, um Erfahrungen, Probleme und Lösungsansätze im Bereich der Texterkennung zu diskutieren. 

Über das Projekt 

Der zweitägige Workshop fand am 3. und 4. Oktober 2025 an der Central European University statt und wurde von CLARIAH-AT sowie dem FWF Cluster of Excellence EurAsian Transformations gefördert. Er versammelte 23 Teilnehmer:innen vor Ort aus Österreich, Deutschland, Frankreich, Israel, Japan und den USA sowie mehr als 20 Online-Teilnehmer:innen aus weiteren Ländern. 

Im Mittelpunkt standen OCR- und HTR-Workflows für Sprachen und Schriften, die in bestehenden digitalen Infrastrukturen häufig nur unzureichend unterstützt werden. Dazu gehörten unter anderem Devanagari, Hebräisch, Kanbun, Sanskrit und Newar, Altgriechisch, Armeno-Türkisch, Garshuni Malayalam, klassisches Chinesisch, Osmanisch-Türkisch und Tibetisch. Diskutiert wurden wiederkehrende Problemfelder wie Layout und Textausrichtung, Zeichenvariation, Erkennungsgenauigkeit, Fehlerkorrektur, Rechts-nach-links-Schreibung, vertikale Ausrichtung sowie bi- und multidirektionale Textstrukturen. 

Das Programm kombinierte kurze fachliche Beiträge, thematische Panels, ausführliche Diskussionen, eine technische Roundtable-Diskussion sowie ein Forum mit Bibliotheks- und Infrastrukturperspektiven. Ein wichtiges Ziel war es, Personen mit unterschiedlichen disziplinären, sprachlichen und institutionellen Hintergründen miteinander in Austausch zu bringen, da vergleichbare technische Probleme häufig in getrennten Fachcommunities bearbeitet werden. 

Als konkretes Ergebnis wurde eine Zenodo-Community eingerichtet, in der Präsentationsfolien und weitere Materialien gesammelt werden. Darüber hinaus entstand im Rahmen eines gemeinsamen Writing Sprints ein Zine mit dem Titel „Ten annoying things about digitizing under-resourced languages (And what might help fixing them)“. Es fasst zentrale Herausforderungen und mögliche Lösungswege knapp und verständlich zusammen und soll zur Sensibilisierung verschiedener Stakeholder beitragen. Der Workshop stärkte zudem die Vernetzung der Beteiligten und eröffnete Anschlussmöglichkeiten an die SCOOP-Community (Source Codes of the Past), die 2026 ein weiteres Treffen in Wien plant.