Určování typů entit na základě extrakce informací z Wikipedie

Loading...
Thumbnail Image
Date
ORCID
Mark
C
Journal Title
Journal ISSN
Volume Title
Publisher
Vysoké učení technické v Brně. Fakulta informačních technologií
Abstract
Cílem této práce je identifikovat typy článků na Wikipedii (např. rozlišit články o osobách od článků o sportovních utkáních), přičemž tento systém by měl být použitelný pro libovolný typ extrahované entity. Vstupem pro tento systém je seznam několika vzorových článků patřících do hledané entity a seznam několika článků nepatřících do této entity. Na základě těchto seznamů budou vygenerovány příznaky, které lze použít k nalezení všech článků patřící do této entity. Tyto příznaky mohou být založeny jak na základě strukturovaných informací na Wikipedii (např. šablony, kategorie), tak i na základě analýzy přirozeného textu v první větě článku, kde bude nalezeno definiční podstatné jméno vystihující entitu daného článku. Tento systém podporuje extrakci česky a anglicky psaných článků a je rozšířitelný pro podporu dalších jazyků.
This paper presents a system for identifying entity types of articles on Wikipedia (e.g. people or sports events) that can be used for identifaction of any arbitrary entity. The~input files for this system are a list of several pages that belong to this entity and a list of several pages that do not belong to this entity. These lists will be used to generate features that can be used for generation of the list of all pages belonging to this entity. The fatures can be based on both structured information on Wikipedia such as templates and categories and non-structured informations found by the analysis of natural text in the first sentence of the article where a defining noun that represents what the article is about will be found. This system support pages written in Czech and English and can be extended to support other languages.
Description
Citation
RUSIŇÁK, P. Určování typů entit na základě extrakce informací z Wikipedie [online]. Brno: Vysoké učení technické v Brně. Fakulta informačních technologií. 2018.
Document type
Document version
Date of access to the full text
Language of document
cs
Study field
Informační technologie
Comittee
doc. Dr. Ing. Dušan Kolář (předseda) doc. Ing. Jaroslav Zendulka, CSc. (místopředseda) Ing. František Grézl, Ph.D. (člen) doc. Ing. Zdeněk Kotásek, CSc. (člen) Dr. Ing. Petr Peringer (člen)
Date of acceptance
2018-06-14
Defence
Student nejprve prezentoval výsledky, kterých dosáhl v rámci své práce. Komise se poté seznámila s hodnocením vedoucího a posudkem oponenta práce. Student následně odpověděl na otázky oponenta a na další otázky přítomných. Komise se na základě posudku oponenta, hodnocení vedoucího, přednesené prezentace a odpovědí studenta na položené otázky rozhodla práci hodnotit stupněm " C ". Otázky u obhajoby: V kapitole 8 "Výsledky" bych očekával podrobnější srovnání Vašeho systému s DBpedií. Můžete komisi ukázat výsledky tohoto srovnání na několika typech entit. Jaké články správně identifikoval Váš systém oproti DBpedii? Jaké články správně identifikovala DBpedie oproti Vašemu systému? Jaké jsou výhody Vašeho systému oproti DBpedii?
Result of defence
práce byla úspěšně obhájena
Document licence
Standardní licenční smlouva - přístup k plnému textu bez omezení
DOI
Collections
Citace PRO