Bakalářská práce

Automatická extrakce sémanticky příbuzných slov

Automatic extraction of semantically related words

Petr Haken, učo 139525
Anotace

Práce pojednává o principech automatického vyhledávání sémanticky blízkých slov, jako jsou synonyma a podobně, jejich získávání z textových korpusů. Popisuje existující metody, které jsou navrženy pro anglický jazyk, a porovnává jejich úspěšnost pro češtinu. Poté zde jsou navrženy a aplikovány nové metody. Práce dále popisuje potíže přirozeného jazyka, snižující jejich schopnosti. Všechny principy jsou zhodnoceny a popsány jejich silné a slabé stránky.

Abstract

This bachelor thesis deals with the principles of automatic searching of semantically related words such as synonyms and others and their retrieving from the text corpora. It describes existing methods, which are designed for English language, and compares their fruitfulness in Czech. Then, new methods are designed and applied as well. The work further describes the problems of natural language that …více

Zadání práce
Pro extrakci sémanticky příbuzných slov z rozsáhlých textových bází existuje velké množství metod. Cílem práce je porovnat úspěšnost těchto metod a zaměřit se zejména na možnosti automatické klasifikace vztahů mezi nalezenými slovy, tedy např. zda se jedná o slova stejného významu, opačného významu, obecnější pojem atd.

Výstupem práce bude mimo text práce zejména soubor slov, ve kterém budou určeny sémanticky příbuzná slova spolu s rozlišením typu vztahu. Na popsaném souboru slov budou porovnány existující techniky. Dalším výstupem bud návrh algoritmu (a jeho prototypová implementace) pro klasifikaci vztahů mezi slovy, pokrývající alespoň některé typy vztahů.

Práce zkontrolována:
11. 10. 2008 13:01, (IS automaticky)
Jazyk práce
čeština čeština
Termín obhajoby
3. 2. 2009
Práce byla úspěšně obhájena

Vedoucí

doc. Mgr. Pavel Rychlý, Ph.D., učo 3692
KSUZD FI MU

Oponent

prof. PhDr. Karel Pala, CSc.
abs FF MU

Literatura

  • KILGARRIFF, Adam; Pavel RYCHLÝ; Pavel SMRŽ a David TUGWELL. The Sketch Engine. In Proceedings of the Eleventh EURALEX International Congress. Lorient, France: Universite de Bretagne-Sud, 2004, s. 105-116. ISBN 2952245703.
  • RYCHLÝ, Pavel a Adam KILGARRIFF. An efficient algorithm for building a distributional thesaurus. In Proceedings of the 45th Annual Meeting of the Association for Computational Linguistics Companion Volume Proceedings of the Demo and Poster Sessions. Prague, Czech Republic: Association for Computational Linguistics, 2007, s. 41-44. ISBN 978-1-932432-86-2.
  • CURRAN, J.R. From Distributional to Semantic Similarity. University of Edinburgh, 2004.

Masarykova univerzita Fakulta informatiky
Studijní program
Aplikovaná informatika
  • Přidání souboru

    Soubor nebo složku lze nahrát pomocí tlačítka Přidat.
  • Další operace se soubory

    Podrobnosti lze zjistit označením příslušného řádku.
  • Pohled pro experty

    Pro častou práci je možné zvolit režim Více možností.
  • Vyhledávání souborů

    Vyhledávaný výraz můžete zadat přímo do adresního řádku.
  • Rychlý přístup k souborům

    Pomocí funkce Nedávné je možné se rychle vrátit k právě prohlíženým souborům. Oblíbené soubory je také možné označit Hvězdičkou.