Využití strojového učení a AI pro extrakci informací z webu

Martin Macho

Machine learning and AI for web information extraction

Typ dokumentu

diplomová práce
master thesis

Autor

Martin Macho

Vedoucí práce

Kuchař Jaroslav

Oponent práce

Klouda Karel

Studijní obor

Znalostní inženýrství

Studijní program

Informatika 2010

Instituce přidělující hodnost

katedra aplikované matematiky

Práva

A university thesis is a work protected by the Copyright Act. Extracts, copies and transcripts of the thesis are allowed for personal use only and at one?s own expense. The use of thesis should be in compliance with the Copyright Act http://www.mkcr.cz/assets/autorske-pravo/01-3982006.pdf and the citation ethics http://knihovny.cvut.cz/vychova/vskp.html
Vysokoškolská závěrečná práce je dílo chráněné autorským zákonem. Je možné pořizovat z něj na své náklady a pro svoji osobní potřebu výpisy, opisy a rozmnoženiny. Jeho využití musí být v souladu s autorským zákonem http://www.mkcr.cz/assets/autorske-pravo/01-3982006.pdf a citační etikou http://knihovny.cvut.cz/vychova/vskp.html

Metadata

Zobrazit celý záznam

Abstrakt

Tato diplomová práce se zabývá tématem extrakce strukturovaných dat z~webových stránek. Jejím cílem je vytvoření modelu pro automatizovanou extrakci informací z~produktových stránek internetových obchodů za pomoci strojového učení a datasetu vytvořeného v~rámci této práce. Teoretická část práce se věnuje úvodu do problematiky, popisuje web mining, nástroje pro extrakci informací z~webu a metody zpracování obrázků pomocí neuronových sítí. Implementační část popisuje získávání obrázků webových stránek, tvorbu datasetu a jeho využití k~natrénování modelu, který identifikuje klíčové prvky na produktové stránce a extrahuje je.

This thesis deals with the topic of structured data extraction from websites. The aim of the thesis is to create a model for automated information extraction from the product pages of e-shops using machine learning and dataset created within this thesis. The theoretical part of the thesis deals with an introduction to the topic of automated data extraction, describes web mining, tools for information extraction from the website and methods of image processing using neural networks. The practical part focuses on the creation of the images of websites, the creation of a dataset and its use to train a model that identifies key elements on the product page and extracts them.