Filtrování textů extrahovaných z PDF, OCR nebo webu

but.committeedoc. Dr. Ing. Jan Černocký (předseda) doc. Ing. Vladimír Janoušek, Ph.D. (místopředseda) Ing. Tomáš Martínek, Ph.D. (člen) Ing. Petr Matoušek, Ph.D., M.A. (člen) Dr. Ing. Petr Peringer (člen)cs
but.defenceStudent nejprve prezentoval výsledky, kterých dosáhl v rámci své práce. Komise se pak seznámila s hodnocením vedoucího a posudkem oponenta práce. Student následně odpověděl na otázky oponenta a na další otázky přítomných. Komise se na základě posudku oponenta, hodnocení vedoucího, přednesené prezentace a odpovědí studenta na položené otázky rozhodla práci hodnotit stupněm C.cs
but.jazykčeština (Czech)
but.programInformační technologiecs
but.resultpráce byla úspěšně obhájenacs
dc.contributor.advisorSzőke, Igorcs
dc.contributor.authorLehnert, Filipcs
dc.contributor.refereePlchot, Oldřichcs
dc.date.accessioned2020-05-13T22:56:15Z
dc.date.available2020-05-13T22:56:15Z
dc.date.created2013cs
dc.description.abstractPředmětem této práce je pomocí sadou skriptů zdokonalit převod různých typů dokumentů do čistě textové podoby. Převodem různých nástrojů dochází ke vzniku šumu a ne zcela korektním převodem znaků. Tyto skripty extrahovaný textový soubor vyčistí tak, aby výsledný text byl čitelný, dával smysl a neobsahoval zbytky různě vyskytujících se znaků z převodu grafů, tabulek, vzorců apod. Skript pracuje univerzálně a nevyžaduje vstup vzniklý pouze z nástrojů OCR nebo převodu z formátu PDF či webu.cs
dc.description.abstractThe objective of this thesis is to implement a set of scripts to improve the transfer of various types of documents into fully text. There appears noise and not entirely correct character conversion by converting various file formats. These scripts extracted text file cleans so that the resulting text is readable, make sense and does not contain any residues of various characters appearing by the transfer of graphs, tables, formulas, etc. The script works universally and does not require input solely by OCR tools or converting from PDF or web.en
dc.description.markCcs
dc.identifier.citationLEHNERT, F. Filtrování textů extrahovaných z PDF, OCR nebo webu [online]. Brno: Vysoké učení technické v Brně. Fakulta informačních technologií. 2013.cs
dc.identifier.other78445cs
dc.identifier.urihttp://hdl.handle.net/11012/187459
dc.language.isocscs
dc.publisherVysoké učení technické v Brně. Fakulta informačních technologiícs
dc.rightsStandardní licenční smlouva - přístup k plnému textu bez omezenícs
dc.subjectfiltrovatcs
dc.subjectextrahovatcs
dc.subjectPDFcs
dc.subjectOCRcs
dc.subjectčistý textcs
dc.subjectslovníkcs
dc.subjectgramatická pravidlacs
dc.subjectskriptycs
dc.subjectfiltrování datcs
dc.subjectpřevod datcs
dc.subjectfilteren
dc.subjectextracten
dc.subjectPDFen
dc.subjectOCRen
dc.subjectplain texten
dc.subjectdictionaryen
dc.subjectgrammar rulesen
dc.subjectscriptsen
dc.subjectfiltering dataen
dc.subjectdata conversionen
dc.titleFiltrování textů extrahovaných z PDF, OCR nebo webucs
dc.title.alternativeFiltering of Texts Extracted from PDF, OCR or Weben
dc.typeTextcs
dc.type.driverbachelorThesisen
dc.type.evskpbakalářská prácecs
dcterms.dateAccepted2013-06-10cs
dcterms.modified2020-05-09-23:39:53cs
eprints.affiliatedInstitution.facultyFakulta informačních technologiícs
sync.item.dbid78445en
sync.item.dbtypeZPen
sync.item.insts2021.11.10 14:03:12en
sync.item.modts2021.11.10 13:54:55en
thesis.disciplineInformační technologiecs
thesis.grantorVysoké učení technické v Brně. Fakulta informačních technologií. Ústav počítačové grafiky a multimédiícs
thesis.levelBakalářskýcs
thesis.nameBc.cs
Files
Original bundle
Now showing 1 - 2 of 2
Loading...
Thumbnail Image
Name:
final-thesis.pdf
Size:
2.11 MB
Format:
Adobe Portable Document Format
Description:
final-thesis.pdf
Loading...
Thumbnail Image
Name:
review_78445.html
Size:
1.45 KB
Format:
Hypertext Markup Language
Description:
review_78445.html
Collections