Zobrazit minimální záznam

Machine learning and AI for web information extraction



dc.contributor.advisorKuchař Jaroslav
dc.contributor.authorMartin Macho
dc.date.accessioned2022-02-05T00:41:47Z
dc.date.available2022-02-05T00:41:47Z
dc.date.issued2022-02-04
dc.identifierKOS-962290872605
dc.identifier.urihttp://hdl.handle.net/10467/99541
dc.description.abstractTato diplomová práce se zabývá tématem extrakce strukturovaných dat z~webových stránek. Jejím cílem je vytvoření modelu pro automatizovanou extrakci informací z~produktových stránek internetových obchodů za pomoci strojového učení a datasetu vytvořeného v~rámci této práce. Teoretická část práce se věnuje úvodu do problematiky, popisuje web mining, nástroje pro extrakci informací z~webu a metody zpracování obrázků pomocí neuronových sítí. Implementační část popisuje získávání obrázků webových stránek, tvorbu datasetu a jeho využití k~natrénování modelu, který identifikuje klíčové prvky na produktové stránce a extrahuje je.cze
dc.description.abstractThis thesis deals with the topic of structured data extraction from websites. The aim of the thesis is to create a model for automated information extraction from the product pages of e-shops using machine learning and dataset created within this thesis. The theoretical part of the thesis deals with an introduction to the topic of automated data extraction, describes web mining, tools for information extraction from the website and methods of image processing using neural networks. The practical part focuses on the creation of the images of websites, the creation of a dataset and its use to train a model that identifies key elements on the product page and extracts them.eng
dc.publisherČeské vysoké učení technické v Praze. Vypočetní a informační centrum.cze
dc.publisherCzech Technical University in Prague. Computing and Information Centre.eng
dc.rightsA university thesis is a work protected by the Copyright Act. Extracts, copies and transcripts of the thesis are allowed for personal use only and at one?s own expense. The use of thesis should be in compliance with the Copyright Act http://www.mkcr.cz/assets/autorske-pravo/01-3982006.pdf and the citation ethics http://knihovny.cvut.cz/vychova/vskp.htmleng
dc.rightsVysokoškolská závěrečná práce je dílo chráněné autorským zákonem. Je možné pořizovat z něj na své náklady a pro svoji osobní potřebu výpisy, opisy a rozmnoženiny. Jeho využití musí být v souladu s autorským zákonem http://www.mkcr.cz/assets/autorske-pravo/01-3982006.pdf a citační etikou http://knihovny.cvut.cz/vychova/vskp.htmlcze
dc.subjectExtrakce informacícze
dc.subjectdetekce a klasifikace objektůcze
dc.subjectFaster R-CNNcze
dc.subjectkonvoluční neuronové sítěcze
dc.subjectpočítačové viděnícze
dc.subjectdetectron2cze
dc.subjectInformation extractioneng
dc.subjectimage detection and classificationeng
dc.subjectFaster R-CNNeng
dc.subjectconvolutional neural networkseng
dc.subjectcomputer visioneng
dc.subjectdetectron2eng
dc.titleVyužití strojového učení a AI pro extrakci informací z webucze
dc.titleMachine learning and AI for web information extractioneng
dc.typediplomová prácecze
dc.typemaster thesiseng
dc.contributor.refereeKlouda Karel
theses.degree.disciplineZnalostní inženýrstvícze
theses.degree.grantorkatedra aplikované matematikycze
theses.degree.programmeInformatika 2010cze


Soubory tohoto záznamu




Tento záznam se objevuje v následujících kolekcích

Zobrazit minimální záznam