RYGL, Jan. Určování autorství anonymních textů na základě automaticky nalezených charakteristických znaků (Determining Authorship of Anonymous Texts Based on Automatically Discovered Characteristic Features). Brno: Fakulta informatiky Masarykovy univerzity, 2011, 67 pp.
Other formats:   BibTeX LaTeX RIS
Basic information
Original name Určování autorství anonymních textů na základě automaticky nalezených charakteristických znaků
Name in Czech Určování autorství anonymních textů na základě automaticky nalezených charakteristických znaků
Name (in English) Determining Authorship of Anonymous Texts Based on Automatically Discovered Characteristic Features
Authors RYGL, Jan (203 Czech Republic, guarantor, belonging to the institution).
Edition Brno, 67 pp. 2011.
Publisher Fakulta informatiky Masarykovy univerzity
Other information
Original language Czech
Type of outcome Special-purpose publication
Field of Study 10201 Computer sciences, information science, bioinformatics
Country of publisher Czech Republic
Confidentiality degree is not subject to a state or trade secret
WWW URL
RIV identification code RIV/00216224:14330/11:00073205
Organization unit Faculty of Informatics
Keywords (in Czech) anonymní dokument, charakteristický rys autora; přiřazování autorství;shlukování podle autorství; SVM; strojové učení
Keywords in English anonymous document; author's writeprint; authorship attribution; clustering; machine learning
Tags Reviewed
Changed by Changed by: RNDr. Pavel Šmerk, Ph.D., učo 3880. Changed: 2/4/2015 14:17.
Abstract
Magisterská diplomová práce. V práci vycházíme z řady osvědčených postupů pro určování autorství anonymních dokumentů a vytváříme nové. Již existující a používané techniky kombinujeme, optimalizujeme a inovujeme pro tři hlavní úlohy: Automatické přiřazení autora podle dané množiny autorských dokumentů, Verifikace autorství daného dokumentu vybraným autorem, Shlukování dokumentů podle autorství. Námi implementované algoritmy jsou testovány na češtině, systém je však navržen modulárně a pokud vypustíme či nahradíme několik jazykově závislých komponent, lze v tuto chvíli pracovat s dokumenty napsanými v libovolném jazyce. Vše je naprogramováno ve skriptovacím jazyce Python. Součástí systému jsou i nástroje pro předzpracování vstupních dat pro češtinu a jejich správu v databázi PostgreSQL. Dalším přínosem práce kromě vývoje systému pro řešení tří zmíněných úloh jsou empiricky podložená pozorování, jak se chovají nejpoužívanější algoritmy na určování autorství dokumentů na dokumentech v češtině. Dosud se většina měření prováděla na anglicky psaných textech (knihy, novinové články, zřídka e-maily) a chyběla možnost srovnání při vývoji aplikací pro češtinu a jí podobné jazyky.
Abstract (in English)
Master's thesis. The work is based on the most successful methods for determining authorship of anonymous documents. We combine, optimize and revise these methods and create new techniques for three main tasks: Automatic assignment of the authorship with the given set of documents, Verification of the authorship of the document by selected author, Clustering of documents according to their authorships. Our implemented algorithms are tested on the Czech documents, but system is modular and if we remove or replace some language-dependent components, we can process documents written in any language. Everything is coded in the Python. The system contains tools for preprocessing of Czech data and for management of stored documents in the PostgreSQL database. The thesis also makes empirical observations of performance of the most popular methods for determining authorship of Czech documents. Most measurements were performed on English texts (books, newspaper articles, rarely e-mails) and until now the statistics for Czech data were missing.
Links
LC536, research and development projectName: Centrum komputační lingvistiky
Investor: Ministry of Education, Youth and Sports of the CR, Centrum komputační lingvistiky
VF20102014003, research and development projectName: Analýza přirozeného jazyka v prostředí internetu (Acronym: APJI)
Investor: Ministry of the Interior of the CR
PrintDisplayed: 13/8/2024 10:00