Skip to content

Commit 6e2d4a5

Browse files
committed
fixes #126: sprachliche Anpassung des Einleitungssatzes in corpus-analysis_intro
1 parent 568ba24 commit 6e2d4a5

1 file changed

Lines changed: 1 addition & 1 deletion

File tree

corpus_analysis/corpus-analysis_intro.md

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -21,7 +21,7 @@ Mit Ihren Rückmeldungen können wir unser interaktives Lehrbuch gezielt an Ihre
2121
:end-before: "<!-- END: Korpusanalyse. Von Häufigkeiten zu Diagrammen -->"
2222
```
2323

24-
Für die Ausführung einer digitalen Analyse, in diesem Fall der Analyse der Spanischen Grippe in einem Berliner Zeitungskorpus (1918-20) durch Worthäufigkeiten über Zeit, wird ein Korpus benötigt, das in Wörter (Token) aufgeteilt und mit Lemmata angereichert ist. Wir haben gezeigt, wie mittels OCR ein aus PDF-Dateien bestehendes Zeitungskorpus in ein Textkorpus konvertiert werden kann (siehe die Kapitel [„Korpusaufbau“](corpus-collection_intro) und [„OCR — Vom Bild zum Text“](ocr_intro)). Das Textkorpus wurde dann mit der Python-Bibliothek spaCy unter Anwendung von NLP-Methoden (Tokenisierung und Lemmatisierung) angereichert (siehe Kapitel [„Korpusverarbeitung – Von Strings zu Token“](corpus-processing_intro)). Das angereicherte Korpus liegt im Tabellenformat (CSV) vor. In jeder Zeile steht ein Wort und die Grundform des Wortes.
24+
Für die Ausführung einer digitalen Analyse, in diesem Fall der Analyse der Spanischen Grippe in einem Berliner Zeitungskorpus durch Worthäufigkeiten über den Zeitraum von 1918 bis 1920, wird ein Korpus benötigt, das in Wörter (Token) aufgeteilt und mit Lemmata angereichert ist. Wir haben gezeigt, wie mittels OCR ein aus PDF-Dateien bestehendes Zeitungskorpus in ein Textkorpus konvertiert werden kann (siehe die Kapitel [„Korpusaufbau“](corpus-collection_intro) und [„OCR — Vom Bild zum Text“](ocr_intro)). Das Textkorpus wurde dann mit der Python-Bibliothek spaCy unter Anwendung von NLP-Methoden (Tokenisierung und Lemmatisierung) angereichert (siehe Kapitel [„Korpusverarbeitung – Von Strings zu Token“](corpus-processing_intro)). Das angereicherte Korpus liegt im Tabellenformat (CSV) vor. In jeder Zeile steht ein Wort und die Grundform des Wortes.
2525

2626

2727
```{figure} ../assets/images/flow-chart_corpus-analysis.jpeg

0 commit comments

Comments
 (0)