Pāriet uz galveno navigāciju Pāriet uz meklēšanu Pāriet uz galveno saturu

Towards named entity annotation of latvian national library corpus

  • Peteris Paikens*
  • , Ilze Auzina
  • , Ginta Garkaje
  • , Madara Paegle
  • *Šī darba korespondējošais autors
  • University of Latvia

Zinātniskās darbības rezultāts: Nodaļa grāmatā/enciklopēdijā/konferences krājumāKonferences zinātniskais rakstsPētniecībakoleģiāli recenzēts

9 Atsauces (Scopus)

Kopsavilkums

The paper describes a work in progress of building a catalogue of named entities-people, places and organizations-based on a recently digitized large (4.5 billion tokens) Latvian corpus. The authors propose an annotation standard for markup of named entities within Latvian corpus, according to which a representative set of documents (150 000 words) are manually annotated. This corpus is used for training and evaluation of an automated named entity recognition system based on Stanford CRF classifier, achieving an F-score of up to 81%. The named entities indexed within the Latvian National Library corpus and the annnotated documents are publicly available for linguistic and historical research online.

OriģinālvalodaAngļu
Rīkotāja publikācijas nosaukumsHuman Language Technologies - The Baltic Perspective. Proceedings of the Fifth International Conference Baltic HLT 2012
IzdevējsIOS Press BV
Lapas169-175
Lapu skaits7
ISBN (Drukātā versija)9781614991328
DOIs
Publikācijas statussPublicēts - 2012
Ārēji publicēts
Pasākums5th International Conference on Human Language Technologies - The Baltic Perspective, Baltic HLT 2012 - Tartu, Igaunija
Ilgums: 4 okt. 20125 okt. 2012

Publikāciju sērijas

NosaukumsFrontiers in Artificial Intelligence and Applications
Sējums247
ISSN (Drukātā versija)0922-6389
ISSN (Elektroniskā versija)1879-8314

Konference

Konference5th International Conference on Human Language Technologies - The Baltic Perspective, Baltic HLT 2012
Valsts/TeritorijaIgaunija
PilsētaTartu
Periods4/10/125/10/12

Nospiedums

Uzziniet vairāk par pētniecības tēmām “Towards named entity annotation of latvian national library corpus”. Kopā tie veido unikālu nospiedumu.

Citēt šo