Metody strojového učení ve zpracování přirozeného jazyka
Machine-Learning Methods in Natural Language Processing
View/ Open
Author
Advisor
Smrž, PavelReferee
Otrusina, LubomírGrade
CAltmetrics
Metadata
Show full item recordAbstract
Bakalářská práce se zajímá hodnocením sentimentu textu v českém jazyce za pomocí metod strojového učení, hlavně za použití naivního bayesovského klasifikátoru. Členění probíhá do dvou kategorií - pozitivní, negativní zprávy. Jako datové zdroje pro automatické vytvoření korpusu jsou použity zprávy ze sociální sítě Twitter, zbožového porovnávače Heuréka, filmové databáze ČSFD a restauračního portálu Scuk. Jsou porovnány z hlediska výkonnosti při hodnocení sentimentu. Následně je sestavena výsledná tréninková sada, která je použita při hodnocení zpráv z Twitteru v téměř reálném čase. Bachelor's thesis deals with sentiment analysis using machine learning methods, mainly naive bayes classifier. Input text can be classified as positive or negative message. There are used several data sources for create of automatic annotated corpus - social network Twitter, price comparator Heureka, movie database ČSFD and restaurant portal Scuk. These sources are compared in terms of performance in assessing the sentiment. Consequently, the final training dataset is created and used at almost real-time Twitter sentiment analysis.
Keywords
Strojové učení, naivní bayesovský klasifikátor, hodnocení sentimentu, dolování názorů, Twitter, Machine learning, naive Bayes classifier, sentiment analysis, opinion mining, TwitterLanguage
čeština (Czech)Study brunch
Informační technologieComposition of Committee
doc. Ing. František Zbořil, CSc. (předseda) prof. Ing. Martin Drahanský, Ph.D. (místopředseda) Ing. Vladimír Bartík, Ph.D. (člen) doc. Ing. Peter Chudý, Ph.D., MBA (člen) Ing. Josef Strnadel, Ph.D. (člen)Date of defence
2012-06-14Process of defence
Student nejprve prezentoval výsledky, kterých dosáhl v rámci své práce. Komise se pak seznámila s hodnocením vedoucího a posudkem oponenta práce. Student následně odpověděl na otázky oponenta a na další otázky přítomných. Komise se na základě posudku oponenta, hodnocení vedoucího, přednesené prezentace a odpovědí studenta na položené otázky rozhodla práci hodnotit stupněm C (dobře). Otázky u obhajoby: Proč jste ve své práci kategorizoval dokumenty jen do kategorií "pozitivní", "negativní" a nepřidal jste i kategorii "neutrální"? Datové sady jste vytvářel buď ručně, kde to není problém přidat, a nebo jste je uměle vytvářel z procentních bodů, kde by také nebyl problém tuto kategorii dodělat. V kapitole 5.1.1 o použití naivního Bayesova klasifikátoru píšete, že je možné zanedbat apriorní pravděpodobnost. Můžete komisi objasnit jak jste to myslel?Result of the defence
práce byla úspěšně obhájenaPersistent identifier
http://hdl.handle.net/11012/55221http://hdl.handle.net/11012/205172
Source
VODIČKA, J. Metody strojového učení ve zpracování přirozeného jazyka [online]. Brno: Vysoké učení technické v Brně. Fakulta informačních technologií. 2012.Collections
- 2012 [306]