BerufsSchulKorpus (BerSchKo)

Das BerSchKo dokumentiert die longitudinale Entwicklung Schreibkompetenzen neu zugewanderter Jugendliche im InteA-Programm an einer hessischen Berufsschule über zwei Schuljahre hinweg. Es umfasst schriftliche Texte zu den Operatoren Instruieren, Berichten und Argumentieren, sowie umfangreiche Metadaten zu den Schüler und Schülerinnen.
BerSchKo entsteht im Rahmen der Kompetenzstelle Deutsch als Zweitsprache an der Justus-Liebig-Universität Gießen in Kooperation mit einer hessischen Berufsschule. Mitarbeiter:innen des Projekts sind und waren:
Prof. Dr. Jana Gamper (Projektleitung)
Yee Cheng Foo (Wissenschaftliche Mitarbeit, Korpuskonzeption, Datenaufbereitung, Qualitätssicherung, Dokumentation)
Dominik Kainz (Wissenschaftliche Mitarbeit, Datenaufbereitung, Dokumentation)
Lara Hilbert (Datenerhebung- und Aufbereitung und Transkription)
Lisa Schlothane (Datenerhebung- und Aufbereitung, Transkription und Segmentierung)
Malin Brinkmann (Datenaufbereitung, Transkription und Segmentierung)
Datenaufbereitung und Annotation
Die erhobenen Daten werden manuell transkribiert und segmentiert (basierend auf Analysis of Speech Units, Foster et al. 2000). Für die mehrstufige Mehrebenannotation wurde EXMARaLDA Partitur-Editor (Schmidt/Wörner 2014) verwendet.
Die Annotation umfasst:
- automatische Lemmatisierung (manuell korrigiert)
- automatisches POS-Tagging mit TreeTagger (Schmid 1995, manuell korrigiert anhand des Stuttgart-Tübingen-TagSets (STTS) (Schiller et al. 1999) und STTS 2.0 (Westpfahl et al. 2017))
Die XML-basierten EXMARaLDA-Dateien werden mit Hilfe einer Annatto-Pipeline (Schlauch et al. 2026) zu einem ANNIS-Korpus konvertiert.
Vorliegende Annotationsebenen sind
| Ebene | Hinweise |
| tok_part | tokenisierte Sprecher:innenspur |
| ctok_part | von Reparaturen bereinigte ctok_part-Spur |
| pos | mit Treetagger automatisch erzeugtes und manuell korrigiertes part-of-speech-Tagging |
| lemma | mit Treetagger automatisch erzeugte und manuell korrigierte Lemmatisierung |
| unit | segmentierte Äußerungseinheiten |
| subclause | abhängige Nebensätze |
| coord | koordinierte Äußerungseinheiten auf [unit]-Ebene |
| coordsc | koordinierte Äußerungseinheiten auf [subclause]-Ebene |
Korpusdaten und Korpusdesign
BerSchKo enthält 880 Texte von n = 139 InteA-SuS, von denen Texte über zwei Schuljahre hinweg zu acht Messzeitpunkten elizitiert wurden. Identische materialgestützte Aufgaben zu den Operatoren Instruieren und Berichten wurden eingesetzt, die an die Texthandlungstypen Nennen, Darstellen und Erklären nach Feilke/Rezat (2019) angepasst sind. Ziel ist es, Textprodukte an der Schnittstelle von schulischer und beruflicher Bildung zu erheben. Darüber hinaus wurden argumentative Texte aus der Modellprüfung des DSD-I-PROs erhoben.
Zudem wurden umfangreiche sprachbiografische Daten erhoben (u. a. Alter bei Erwerbsbeginn, schulbiographische Merkmale vor der Migration nach Deutschland, vorhandene Sprachkenntnisse sowie eine umfangreiche Erfassung von schriftbezogenen rezeptiven und produktiven Handlungen in den Herkunfts- und Zielsprachen), um den Einfluss individueller Vorerfahrungen auf die Entwicklung bildungssprachlicher Kompetenzen im Deutschen differenziert zu untersuchen (vg. Schleppegrell 2004).
Korpushandbuch
Die erste Version des Korpus und Korpushandbuchs folgt.
Literatur
Feilke, H. & Rezat, S. (2019). Operatoren 'to go'. Prozedurenorientierter Schreibunterricht. Praxis Deutsch 274, 4–13.
Foo, Y. C., & Gamper, J. (2025). Neuzugewanderte an beruflichen Schulen. Zur Rolle von Schreibkompetenzen im Kontext separater Beschulungsmodelle. New Immigrants in Vocational Schools. The Role of Writing Competencies in Separate School Integration Models. Sprache Im Beruf, 8(1), 53–72. https://doi.org/10.25162/sprib-2025-0004
Foster, P., Tonkyn, A., & Wigglesworth, G. (2000). Measuring spoken language: A unit for all reasons. Applied Linguistics, 21(3), 354–375. https://doi.org/10.1093/applin/21.3.354
Krause, T. (with Berlin, H.-U. Z., & Berlin, H.-U. Z.). (2019). ANNIS: A graph-based query system for deeply annotated text corpora. Humboldt-Universität zu Berlin. https://edoc.hu-berlin.de/handle/18452/20436
Schlauch, Julia; Braunewell, Aylin; Gamper, Jana; Klotz, Martin (2026). SeiKo: Ein Lernerkorpus neu zugewanderter Schüler:innen (Seiteneinsteiger:innen) in Vorbereitungsklassen (Version 1.0-preview). Zenodo. DOI: 10.5281/zenodo.21476831
Schmid, H. (1995). Improvements in Part-of-Speech Tagging with an Application to German. Proceedings of the ACL SIGDAT-Workshop. Dublin, Ireland.
Schmidt, T., & Wörner, K. (2014). EXMARaLDA. In Handbook on Corpus Phonology (pp. 402–419). Oxford University Press.