1 |
DiaCollo für GEI-Digital - Ein experimentelles Projekt zur weiteren Erschließung digitalisierter historischer Schulbuchbestände ...
|
|
|
|
BASE
|
|
Show details
|
|
2 |
DiaCollo für GEI-Digital - Ein experimentelles Projekt zur weiteren Erschließung digitalisierter historischer Schulbuchbestände ...
|
|
|
|
BASE
|
|
Show details
|
|
3 |
DiaCollo für GEI-Digital - Ein experimentelles Projekt zur weiteren Erschließung digitalisierter historischer Schulbuchbestände ...
|
|
|
|
BASE
|
|
Show details
|
|
4 |
DiaCollo für GEI-Digital - Ein experimentelles Projekt zur weiteren Erschließung digitalisierter historischer Schulbuchbestände ...
|
|
|
|
BASE
|
|
Show details
|
|
7 |
Die Korpusplattform des „Digitalen Wörterbuchs der deutschen Sprache“ (DWDS)
|
|
|
|
In: ISSN: 0301-3294 ; EISSN: 1613-0626 ; Zeitschrift für Germanistische Linguistik ; https://hal.archives-ouvertes.fr/hal-01575661 ; Zeitschrift für Germanistische Linguistik, De Gruyter, 2017, Zeitschrift für Germanistische Linguistik, 45 (2), pp.327-344. ⟨10.1515/zgl-2017-0017⟩ ; https://www.degruyter.com/view/j/zfgl.2017.45.issue-2/zgl-2017-0017/zgl-2017-0017.xml (2017)
|
|
BASE
|
|
Show details
|
|
9 |
Canonicalizing the Deutsches Textarchiv
|
|
|
|
Abstract:
Virtually all conventional text-based natural language processing techniques - from traditional information retrieval systems to full-fledged parsers - require reference to a fixed lexicon accessed by surface form, typically trained from or constructed for synchronic input text adhering strictly to contemporary orthographic conventions. Unconventional input such as historical text which violates these conventions therefore presents difficulties for any such system due to lexical variants present in the input but missing from the application lexicon. To facilitate the extension of synchronically-oriented natural language processing techniques to historical text while minimizing the need for specialized lexical resources, one may first attempt an automatic canonicalization of the input text. This paper provides an informal overview of the various canonicalization techniques currently employed by the Deutsches Textarchiv project at the Berlin-Brandenburg Academy of Sciences and Humanities to prepare a corpus of historical German text for part-of-speech tagging, lemmatization, and integration into a robust online information retrieval system.
|
|
Keyword:
ddc:430; Deutsch; Korpus
|
|
URN:
urn:nbn:de:kobv:b4-opus-24433
|
|
URL: https://edoc.bbaw.de/frontdoor/index/index/docId/2165 https://nbn-resolving.org/urn:nbn:de:kobv:b4-opus-24433 https://edoc.bbaw.de/files/2165/Jurish.pdf
|
|
BASE
|
|
Hide details
|
|
12 |
Finite-state canonicalization techniques for historical German ; Endliche Techniken zur Kanonikalisierung historischen deutschen Textes
|
|
|
|
BASE
|
|
Show details
|
|
|
|