
NLP in der Sprachdokumentation am Beispiel des Kyanga/Shanga DoBeS-Projekts (Niger-Kongo, Ost-Mande)
Die DoBeS Initiative (VolkswagenStiftung) fördert(e) Dokumentationsprojekte zu bedrohten Sprachen für welche die Gefahr besteht, dass deren Sprechergemeinschaften eine Sprachwechsel vollziehen und die Sprache somit in den nächsten Jahren oder innerhalb eines Jahrzehnts ausstirbt. Die Zielsetzung der Sprachdokumentation liegt nicht primär in der grammatischen Beschreibung, sondern in der Erstellung eines umfassenden ethnographischen Korpus zu einer undokumentierten Sprache. Die in einem annotierten Korpus gespeicherten audio-visuellen Daten sollen als multimodale Ressource für die Sprechergemeinschaften und deren Nachkommen dienen, aber auch als Repositorium für linguistische Forschungen verfügbar sein. Solche Korpora sind insbesondere für eine datenorientierte Sprachtypologie von Interesse, die typologische Merkmale aus der Annotation und nicht aus der grammatischen Beschreibung bezieht.
Es scheint deutlich, dass die Ausgangslage in einem Dokumentationsprojekt – ein enger Zeitrahmen in der Feldforschung, kleine und mittlere Teams von Forschungsassistenten und Forschern und die Zielsetzung einen umfangreichen digitalen Korpus zu erstellen – für die Erstellung umfangreicher Korpora den Einsatz von effektiven korpuslinguistischen Verfahren, wie semi-automatische Annotation und linguistische Analysemethoden, gebietet. In der Korpuslinguistik wurden allerdings zuletzt vor allem statistische Verfahren präferiert, die ein bestehendes Annotationsmodell, vor allem aber umfangreiche annotierte Korpora für das Training erfordern. Daraus ergibt sich für die Sprachdokumentation die Situation eines Sparse Data Paradox: die Voraussetzung für die semi-automatische Annotation umfangreicher Korpora besteht in einem umfangreich annotierten Korpus. Außerdem kommt hinzu, dass die produzierten Resultate statistischer Modelle für die linguistische Analyse selbst, im Gegensatz zu regelbasierten Resultaten, für den Linguisten und die Annotation kaum zu verwerten sind.
Vor diesem Hintergrund wird der Dokumentations-Workflow des Kyanga/Shanga DoBeS-Projekts und das entwickelte Forschungsdesign vorgestellt. Wir diskutieren in diesem Zusammenhang Ansätze zum Einsatz von NLP Tools und gehen auf Techniken ein, die sich typologische Eigenschaften und das bestehende Wissen in der Linguistik über den „Grammar Codec“ zu Nutze machen, um für die Sprachdokumentation umfangreiche Korpora audio-visueller ethnographischer Daten zu erstellen. Die Darstellung konzentriert sich auf die Frage nach der Relation von Wortstruktur und Tokenisierung und beschreibt außerdem eher unkonventionelle Verfahren des POS-Tagging.
2022
2021
2020
2019
- Home
- Schedule
- Workshops
- Lectures (public)
- Projects (public)
- Poster Session (public)
- Panel (public)
- Teasers (public)
- Cultural programme
- Experts
- Lecturers
- Scientific Committee
- Important dates (new)
- Application
- Scholarships (updated)
- Participation fees
- Refund policy
- T-Shirts
- Child care
- Birthday thoughts












