Entwicklung domänenspezifischer Datensätze und automatisierter Evaluation für ein Framework zur neuronalen Textvereinfachung in leichte Sprache
Leichte Sprache ermöglicht Menschen mit Lernschwierigkeiten oder geringen Sprachkenntnissen eine selbstbestimmte gesellschaftliche Teilhabe. Durch gesetzliche Vorgaben wie das Barrierefreiheitsstärkungsgesetz gewinnt die automatische Übersetzung in Leichte Sprache stark an Bedeutung. Für das Deutsche scheiterten bisherige Ansätze vor allem an drei Hürden: fehlenden Trainingsdaten, unzureichenden Bewertungsmetriken für Sprachkomplexität und mangelnder Regeleinhaltung generativer Modelle.
Diese Masterarbeit begegnet diesen Problemen mit einem modularen Framework in drei Schritten. Zunächst wird aus heterogenen Webquellen ein bereinigtes Parallelkorpus aus rund 860 konsistenten Artikelpaaren aufgebaut. Anschließend lernt ein Komplexitätsregressor auf BiLSTM-Basis über Text-MixUp stufenlose Übergänge der Sprachschwere. Die Metrik stimmt eng mit menschlichen Expertenurteilen überein und generalisiert stabil auf externe Datensätze. Im dritten Schritt wird ein Sequenz-zu-Sequenz-Modell (mBART-50) trainiert und mittels direkter Präferenzoptimierung (DPO) an das gelernte Komplexitätssignal angepasst. Dadurch halbiert das Modell die Satzlänge und senkt unzulässige Passiv- sowie Genitivstrukturen noch einmal deutlich.
In einer verblindeten Studie mit einer zertifizierten Fachkraft des Lebenshilfe Landesverbandes Schleswig-Holstein e.V. bestätigt sich eine kontinuierliche Qualitätssteigerung. Zugleich zeigt die Fehleranalyse, dass gängige Metriken bei Faktenfehlern und Halluzinationen an Grenzen stoßen. Eine verlässliche Faktenprüfung und sauber ausgerichtete Trainingsdaten bleiben daher zentrale Aufgaben für zukünftige Arbeiten.
Die Arbeit liefert damit den Nachweis, dass eine autonome Übersetzungspipeline für deutsche Leichte Sprache praxistauglich und methodisch realisierbar ist.