Extraktor informací o firmách z webových zdrojů
Extraction of company descriptors from web resources
Typ dokumentu
diplomová prácemaster thesis
Autor
Tomáš Stanovčák
Vedoucí práce
Kuchař Jaroslav
Oponent práce
Kordík Pavel
Studijní obor
Znalostní inženýrstvíStudijní program
InformatikaInstituce přidělující hodnost
katedra aplikované matematikyPráva
A university thesis is a work protected by the Copyright Act. Extracts, copies and transcripts of the thesis are allowed for personal use only and at one?s own expense. The use of thesis should be in compliance with the Copyright Act http://www.mkcr.cz/assets/autorske-pravo/01-3982006.pdf and the citation ethics http://knihovny.cvut.cz/vychova/vskp.htmlVysokoškolská závěrečná práce je dílo chráněné autorským zákonem. Je možné pořizovat z něj na své náklady a pro svoji osobní potřebu výpisy, opisy a rozmnoženiny. Jeho využití musí být v souladu s autorským zákonem http://www.mkcr.cz/assets/autorske-pravo/01-3982006.pdf a citační etikou http://knihovny.cvut.cz/vychova/vskp.html
Metadata
Zobrazit celý záznamAbstrakt
Předmětem této práce je získání a zpracování dat o firmách z jejich webových stránek. Po obeznámení se s přístupy extrakce a množinou dostupných firemních informací bude připraven datový soubor ve vhodném formátu, na kterém budou prováděny experimenty. Tato datová množina bude podrobena rozličným způsobům extrakce na principu pravidel i strojového učení. Výsledky experimentů budou vyhodnoceny a implementace jednotlivých přístupů zveřejněna jako knihovna pod volnou licencí. The subject of this thesis is to obtain and process company data from their websites. After getting acquainted with extraction approaches and available set of company information, dataset will be prepared in a format suitable for experiments. This dataset will undergo the extraction procedures based on both rule and machine learning principles. The results of the experiments will be evaluated and the implementation of the individual approaches will be publicly accessible as a library under a free licence.
Kolekce
- Diplomové práce - 18105 [164]