ČVUT DSpace
  • Search DSpace
  • Čeština
  • Login
  • Čeština
  • Čeština
View Item 
  •   ČVUT DSpace
  • Czech Technical University in Prague
  • Faculty of Information Technology
  • Departments
  • Department of Applied Mathematics
  • Master Theses - 18105
  • View Item
  • Czech Technical University in Prague
  • Faculty of Information Technology
  • Departments
  • Department of Applied Mathematics
  • Master Theses - 18105
  • View Item
JavaScript is disabled for your browser. Some features of this site may not work without it.

Využití strojového učení a AI pro extrakci informací z webu

Machine learning and AI for web information extraction

Type of document
diplomová práce
master thesis
Author
Martin Macho
Supervisor
Kuchař Jaroslav
Opponent
Klouda Karel
Field of study
Znalostní inženýrství
Study program
Informatika 2010
Institutions assigning rank
katedra aplikované matematiky



Rights
A university thesis is a work protected by the Copyright Act. Extracts, copies and transcripts of the thesis are allowed for personal use only and at one?s own expense. The use of thesis should be in compliance with the Copyright Act http://www.mkcr.cz/assets/autorske-pravo/01-3982006.pdf and the citation ethics http://knihovny.cvut.cz/vychova/vskp.html
Vysokoškolská závěrečná práce je dílo chráněné autorským zákonem. Je možné pořizovat z něj na své náklady a pro svoji osobní potřebu výpisy, opisy a rozmnoženiny. Jeho využití musí být v souladu s autorským zákonem http://www.mkcr.cz/assets/autorske-pravo/01-3982006.pdf a citační etikou http://knihovny.cvut.cz/vychova/vskp.html
Metadata
Show full item record
Abstract
Tato diplomová práce se zabývá tématem extrakce strukturovaných dat z~webových stránek. Jejím cílem je vytvoření modelu pro automatizovanou extrakci informací z~produktových stránek internetových obchodů za pomoci strojového učení a datasetu vytvořeného v~rámci této práce. Teoretická část práce se věnuje úvodu do problematiky, popisuje web mining, nástroje pro extrakci informací z~webu a metody zpracování obrázků pomocí neuronových sítí. Implementační část popisuje získávání obrázků webových stránek, tvorbu datasetu a jeho využití k~natrénování modelu, který identifikuje klíčové prvky na produktové stránce a extrahuje je.
 
This thesis deals with the topic of structured data extraction from websites. The aim of the thesis is to create a model for automated information extraction from the product pages of e-shops using machine learning and dataset created within this thesis. The theoretical part of the thesis deals with an introduction to the topic of automated data extraction, describes web mining, tools for information extraction from the website and methods of image processing using neural networks. The practical part focuses on the creation of the images of websites, the creation of a dataset and its use to train a model that identifies key elements on the product page and extracts them.
 
URI
http://hdl.handle.net/10467/99541
View/Open
PLNY_TEXT (8.647Mb)
POSUDEK (48.79Kb)
POSUDEK (49.72Kb)
Collections
  • Diplomové práce - 18105 [111]

České vysoké učení technické v Praze copyright © 2016 

DSpace software copyright © 2002-2016  Duraspace

Contact Us | Send Feedback
Theme by 
@mire NV
 

 

Useful links

CTU in PragueCentral library of CTUAbout CTU Digital LibraryResourcesStudy and library skillsResearch support

Browse

All of DSpaceCommunities & CollectionsBy Issue DateAuthorsTitlesSubjectsThis CollectionBy Issue DateAuthorsTitlesSubjects

My Account

Login

České vysoké učení technické v Praze copyright © 2016 

DSpace software copyright © 2002-2016  Duraspace

Contact Us | Send Feedback
Theme by 
@mire NV