Inhaltspezifische Aktionen

BerufsSchulKorpus (BerSchKo)

 

English Version

Das BerSchKo dokumentiert die longitudinale Entwicklung Schreibkompetenzen neu zugewanderter Jugendliche im InteA-Programm an einer hessischen Berufsschule über zwei Schuljahre hinweg. Es umfasst schriftliche Texte zu den Operatoren Instruieren, Berichten und Argumentieren, sowie umfangreiche Metadaten zu den Schüler und Schülerinnen. 

 

BerSchKo entsteht im Rahmen der Kompetenzstelle Deutsch als Zweitsprache an der Justus-Liebig-Universität Gießen in Kooperation mit einer hessischen Berufsschule. Mitarbeiter:innen des Projekts sind und waren:

Prof. Dr. Jana Gamper (Projektleitung)
Yee Cheng Foo (Wissenschaftliche Mitarbeit, Korpuskonzeption, Datenaufbereitung, Qualitätssicherung, Dokumentation)
Dominik Kainz (Wissenschaftliche Mitarbeit, Datenaufbereitung, Dokumentation)
Lara Hilbert (Datenerhebung- und Aufbereitung und Transkription)
Lisa Schlothane (Datenerhebung- und Aufbereitung, Transkription und Segmentierung)
Malin Brinkmann (Datenaufbereitung, Transkription und Segmentierung)

 

Datenaufbereitung und Annotation

Die erhobenen Daten werden manuell transkribiert und segmentiert (basierend auf Analysis of Speech Units, Foster et al. 2000). Für die mehrstufige Mehrebenannotation wurde EXMARaLDA Partitur-Editor (Schmidt/Wörner 2014) verwendet.

Die Annotation umfasst:

  • automatische Lemmatisierung (manuell korrigiert)
  • automatisches POS-Tagging mit TreeTagger (Schmid 1995, manuell korrigiert anhand des Stuttgart-Tübingen-TagSets (STTS) (Schiller et al. 1999) und STTS 2.0 (Westpfahl et al. 2017))

Die XML-basierten EXMARaLDA-Dateien werden mit Hilfe einer Annatto-Pipeline (Schlauch et al. 2026) zu einem ANNIS-Korpus konvertiert.

Vorliegende Annotationsebenen sind

Ebene Hinweise
tok_part tokenisierte Sprecher:innenspur
ctok_part von Reparaturen bereinigte ctok_part-Spur
pos mit Treetagger automatisch erzeugtes und manuell korrigiertes part-of-speech-Tagging
lemma mit Treetagger automatisch erzeugte und manuell korrigierte Lemmatisierung
unit segmentierte Äußerungseinheiten
subclause abhängige Nebensätze
coord koordinierte Äußerungseinheiten auf [unit]-Ebene
coordsc koordinierte Äußerungseinheiten auf [subclause]-Ebene     

 

Korpusdaten und Korpusdesign

BerSchKo enthält 880 Texte von n = 139 InteA-SuS, von denen Texte über zwei Schuljahre hinweg zu acht Messzeitpunkten elizitiert wurden. Identische materialgestützte Aufgaben zu den Operatoren Instruieren und Berichten wurden eingesetzt, die an die Texthandlungstypen Nennen, Darstellen und Erklären nach Feilke/Rezat (2019) angepasst sind. Ziel ist es, Textprodukte an der Schnittstelle von schulischer und beruflicher Bildung zu erheben. Darüber hinaus wurden argumentative Texte aus der Modellprüfung des DSD-I-PROs erhoben. 

Zudem wurden umfangreiche sprachbiografische Daten erhoben (u. a. Alter bei Erwerbsbeginn, schulbiographische Merkmale vor der Migration nach Deutschland, vorhandene Sprachkenntnisse sowie eine umfangreiche Erfassung von schriftbezogenen rezeptiven und produktiven Handlungen in den Herkunfts- und Zielsprachen), um den Einfluss individueller Vorerfahrungen auf die Entwicklung bildungssprachlicher Kompetenzen im Deutschen differenziert zu untersuchen (vg. Schleppegrell 2004).

 

Korpushandbuch

Die erste Version des Korpus und Korpushandbuchs folgt.

 

Literatur

Feilke, H. & Rezat, S. (2019). Operatoren 'to go'. Prozedurenorientierter Schreibunterricht. Praxis Deutsch 274, 4–13.

Foo, Y. C., & Gamper, J. (2025). Neuzugewanderte an beruflichen Schulen. Zur Rolle von Schreibkompetenzen im Kontext separater Beschulungsmodelle. New Immigrants in Vocational Schools. The Role of Writing Competencies in Separate School Integration Models. Sprache Im Beruf, 8(1), 53–72. https://doi.org/10.25162/sprib-2025-0004

Foster, P., Tonkyn, A., & Wigglesworth, G. (2000). Measuring spoken language: A unit for all reasons. Applied Linguistics, 21(3), 354–375. https://doi.org/10.1093/applin/21.3.354

Krause, T. (with Berlin, H.-U. Z., & Berlin, H.-U. Z.). (2019). ANNIS: A graph-based query system for deeply annotated text corpora. Humboldt-Universität zu Berlin. https://edoc.hu-berlin.de/handle/18452/20436

Krause, T., & Klotz, M. (2026). Annatto (Version 1.2.0) [Computer software]. Humboldt-Universität zu Berlin. https://github.com/korpling/annatto/
 

Schlauch, Julia; Braunewell, Aylin; Gamper, Jana; Klotz, Martin (2026). SeiKo: Ein Lernerkorpus neu zugewanderter Schüler:innen (Seiteneinsteiger:innen) in Vorbereitungsklassen (Version 1.0-preview). Zenodo. DOI: 10.5281/zenodo.21476831

Schleppegrell, M. J. (2004). The language of schooling: A functional linguistics perspective. Lawrence Erlbaum.
 

Schmid, H. (1995). Improvements in Part-of-Speech Tagging with an Application to German. Proceedings of the ACL SIGDAT-Workshop. Dublin, Ireland.

Schmidt, T., & Wörner, K. (2014). EXMARaLDA. In Handbook on Corpus Phonology (pp. 402–419). Oxford University Press.