Závěrečná práce: Lukáš Kohout: Identifikace pojmenovaných entit v textu
Bakalářská práce
Identifikace pojmenovaných entit v textu
Named Entity Recognition from Texts
Lukáš Kohout
Anotace
Cílem této práce je stanovit možnosti určování a klasifikace pojmenovaných entit v textu. Výstupem této práce je 15 regulárních výrazů identifikujících pojmenované entity v korpusu a více než 12 milionů pojmenovaných entit v korpusu identifikovaných.
Abstract
The aim of this thesis is to determine the possibilities of identification and classification of named entities in a text. The output of this thesis is 15 regular expressions identifying named entities in the corpus, and more than 12 million named entities identified in the corpus.
Zadání práce
Zorientujte se v problematice pojmenovaných entit (Named Entity, NE).
Zasaďte problematiku NE do širšího rámce analýzy textu v přirozeném
jazyce. Nastudujte problematiku vyhledávání v korpusech. Prostudujte
metody anotace a vyhodnocení (přesnost, pokrytí, shoda mezi
anotátory). Navrhněte postupy, pomocí kterých bude možné rozpoznat a
klasifikovat NE v souvislém textu. Může jít o jednotlivá slova, ale důraz je kladen na rozpoznání víceslovných entit. Výstupem
bude popis získávání NE z korpusu a vyhodnocení úspěšnosti tohoto
postupu. Výstupem také může být seznam NE.
Doporučená literatura:
Radek Sedláček: ajka tagset, 2006, nlp.fi.muni.cz/projekty/ajka/tags.pdf
Sketch Engine Trac: Corpus Querying and Grammar Writing for the Sketch
Engine, 2012, https://trac.sketchengine.co.uk/wiki/SkE/CorpusQuerying
K. L. Gwet: Computing inter-rater reliability and its variance in the
presence of high agreement. British Journal of Mathematical and
Statistical Psychology, 61, 29-48, 2008,
http://www.agreestat.com/research_papers/bjmsp2008_interrater.pdf
Práce zkontrolována:
22. 5. 2012 10:50, RNDr. Zuzana Nevěřilová, Ph.D., učo 3839
22. 5. 2012 10:50, RNDr. Zuzana Nevěřilová, Ph.D., učo 3839
Jazyk práce
Termín obhajoby
22. 6. 2012
Práce byla úspěšně obhájena
Vedoucí
Konzultant
Studijní program
Informatika
Práce na příbuzné téma
Seznam prací, které mají shodná klíčová slova.
-
Metody pro automatické získávání slovníkových definic
Mgr. Monika Močiariková -
Automatická tvorba definic z korpusu
Mgr. et Mgr. Marie Stará -
Frekvenční analýza českých floskulí na vybraných korpusech
Bc. Helena Palátová -
Mezijazyková homografa v českých textech
Mgr. Tomáš Neugebauer, učo 399209 -
Doplňování diakritiky do volného textu
Marie Martínková -
Automatická extrakcia definícií z textu
Mgr. Adam Gonda -
Hybridní substantiva v Českém národním korpusu
Mgr. Hana Strachoňová, Ph.D., učo 110155 -
Pravidelné a nepravidelné tvary sloves typu začít v Českém národním korpusu
Mgr. Zuzana Danielová
Název
Vložil
Vloženo
Práva
Složky
Soubory
Němčík, V.
8. 6. 2012




