Využití strojového učení a AI pro extrakci informací z webu
Machine learning and AI for web information extraction
Typ dokumentu
diplomová prácemaster thesis
Autor
Martin Macho
Vedoucí práce
Kuchař Jaroslav
Oponent práce
Klouda Karel
Studijní obor
Znalostní inženýrstvíStudijní program
Informatika 2010Instituce přidělující hodnost
katedra aplikované matematikyPráva
A university thesis is a work protected by the Copyright Act. Extracts, copies and transcripts of the thesis are allowed for personal use only and at one?s own expense. The use of thesis should be in compliance with the Copyright Act http://www.mkcr.cz/assets/autorske-pravo/01-3982006.pdf and the citation ethics http://knihovny.cvut.cz/vychova/vskp.htmlVysokoškolská závěrečná práce je dílo chráněné autorským zákonem. Je možné pořizovat z něj na své náklady a pro svoji osobní potřebu výpisy, opisy a rozmnoženiny. Jeho využití musí být v souladu s autorským zákonem http://www.mkcr.cz/assets/autorske-pravo/01-3982006.pdf a citační etikou http://knihovny.cvut.cz/vychova/vskp.html
Metadata
Zobrazit celý záznamAbstrakt
Tato diplomová práce se zabývá tématem extrakce strukturovaných dat z~webových stránek. Jejím cílem je vytvoření modelu pro automatizovanou extrakci informací z~produktových stránek internetových obchodů za pomoci strojového učení a datasetu vytvořeného v~rámci této práce. Teoretická část práce se věnuje úvodu do problematiky, popisuje web mining, nástroje pro extrakci informací z~webu a metody zpracování obrázků pomocí neuronových sítí. Implementační část popisuje získávání obrázků webových stránek, tvorbu datasetu a jeho využití k~natrénování modelu, který identifikuje klíčové prvky na produktové stránce a extrahuje je. This thesis deals with the topic of structured data extraction from websites. The aim of the thesis is to create a model for automated information extraction from the product pages of e-shops using machine learning and dataset created within this thesis. The theoretical part of the thesis deals with an introduction to the topic of automated data extraction, describes web mining, tools for information extraction from the website and methods of image processing using neural networks. The practical part focuses on the creation of the images of websites, the creation of a dataset and its use to train a model that identifies key elements on the product page and extracts them.
Kolekce
- Diplomové práce - 18105 [195]