2008
From Minds to Pixels and Back
SOJKA, PetrZákladní údaje
Originální název
From Minds to Pixels and Back
Název česky
Od myšlenky v hlavě na papír a zpět
Autoři
SOJKA, Petr (203 Česká republika, garant)
Vydání
první. Brno, xvi+209, habilitation thesis, 2008
Nakladatel
Masarykova univerzita
Další údaje
Jazyk
angličtina
Typ výsledku
Účelové publikace
Obor
10201 Computer sciences, information science, bioinformatics
Stát vydavatele
Česká republika
Utajení
není předmětem státního či obchodního tajemství
Kód RIV
RIV/00216224:14330/08:00024492
Organizační jednotka
Fakulta informatiky
Klíčová slova česky
soutěživé vzory; kontextově-citlivé vzory; strojové učení; jazykové inženýrství; dělení slov; segmentace [thajského textu]; desambiguace; digitizace; digitální knihovny; automatická klasifikace;
Klíčová slova anglicky
competing patterns;context-sensitive patterns;machine learning;natural language engineering;hyphenation; [Thai text] segmentation;disambiguation;part of speech tagging;digitization;digital libraries;navigation;hypertext;MSC;text classification
Štítky
Příznaky
Mezinárodní význam, Recenzováno
Změněno: 23. 6. 2009 13:52, doc. RNDr. Petr Sojka, Ph.D.
V originále
This cumulative work consists of my papers in the areas of electronic document preparation---from authors' minds to the pixels on paper or screen---and digitization---from the scanned papers back to the minds of scholars via the structured digital library. In the first part of this thesis, a short overview of the papers and topics tackled is given. The second part consist of a series of eight published papers that describe problems addressed: applications of competing patterns and related learning methods in areas of hyphenation, the hyphenation of compound words and, for example, the segmentation of Thai texts. A method of single-source publishing for various output media is developed and shown. The third part consist of a series of six papers and drafts with topics in the areas of digitization, optical character recognition, digital library preparation and the automated classification of digitized papers.
Česky
Tato souborná práce sestává z~prací v~oblastech elektronického publikování (zpracování dat na cestě z~autorovy hlavy až na bitmapu na papíře či na obrazovce monitoru) a digitalizace (zpracování dat opačným směrem). Úvodní část práce je úvodem do problematiky a komentářem k~předkládaným článkům. Druhá část obsahuje soubor osmi článků z oblastí aplikace soutěživých vzorů a metod strojového učení pro učení dělení slov, dělení složených slov či segmentace textu v thajštině. Jedna z~prací se věnuje publikování do více výstupních formátů z~jednoho zdroje. Třetí část obsahuje šest článků z~oblastí digitalizace odborných textů, rozpoznávání matematických textů, budování digitální knihovny odborných matematických publikací a automatické klasifikace matematických textů.
Návaznosti
1ET200190513, projekt VaV |
|