Extraktor informací o firmách z webových zdrojů
Extraction of company descriptors from web resources
Type of document
diplomová prácemaster thesis
Author
Tomáš Stanovčák
Supervisor
Kuchař Jaroslav
Opponent
Kordík Pavel
Field of study
Znalostní inženýrstvíStudy program
InformatikaInstitutions assigning rank
katedra aplikované matematikyRights
A university thesis is a work protected by the Copyright Act. Extracts, copies and transcripts of the thesis are allowed for personal use only and at one?s own expense. The use of thesis should be in compliance with the Copyright Act http://www.mkcr.cz/assets/autorske-pravo/01-3982006.pdf and the citation ethics http://knihovny.cvut.cz/vychova/vskp.htmlVysokoškolská závěrečná práce je dílo chráněné autorským zákonem. Je možné pořizovat z něj na své náklady a pro svoji osobní potřebu výpisy, opisy a rozmnoženiny. Jeho využití musí být v souladu s autorským zákonem http://www.mkcr.cz/assets/autorske-pravo/01-3982006.pdf a citační etikou http://knihovny.cvut.cz/vychova/vskp.html
Metadata
Show full item recordAbstract
Předmětem této práce je získání a zpracování dat o firmách z jejich webových stránek. Po obeznámení se s přístupy extrakce a množinou dostupných firemních informací bude připraven datový soubor ve vhodném formátu, na kterém budou prováděny experimenty. Tato datová množina bude podrobena rozličným způsobům extrakce na principu pravidel i strojového učení. Výsledky experimentů budou vyhodnoceny a implementace jednotlivých přístupů zveřejněna jako knihovna pod volnou licencí. The subject of this thesis is to obtain and process company data from their websites. After getting acquainted with extraction approaches and available set of company information, dataset will be prepared in a format suitable for experiments. This dataset will undergo the extraction procedures based on both rule and machine learning principles. The results of the experiments will be evaluated and the implementation of the individual approaches will be publicly accessible as a library under a free licence.
Collections
- Diplomové práce - 18105 [194]