Show simple item record

Framework for Extraction of Wikipedia Articles Content



dc.contributor.advisorDojčinovski Milan
dc.contributor.authorOleksandr Husiev
dc.date.accessioned2021-12-02T23:51:16Z
dc.date.available2021-12-02T23:51:16Z
dc.date.issued2021-12-02
dc.identifierKOS-1088201569205
dc.identifier.urihttp://hdl.handle.net/10467/98707
dc.description.abstractTato diplomová práce se zabývá extrakcí obsahu Wikipedie pro DBpedia - crowd-sourced projekt. Hlavním cílem této práce bylo vyvinout rámec pro extrakci obsahu, struktury a anotací článků z Wikipedie. Výsledkem je framework, který zpracovává velké skládky XML na Wikipedii v několika populárních jazycích s možností dynamicky přidávat nové jazyky a vytváří čistý textový výstup, odkazy a strukturu stránky ve formátu N-Triples.cze
dc.description.abstractThis thesis describes the development process of the extraction of Wikipedia articles content for a DBpedia, a crowd-sourced community effort. The main goal of this thesis was to develop a framework for extraction of Wikipedia articles content, structure, and annotations. The result is a framework that processes large Wikipedia XML dumps in several popular languages, with the possibility to dynamically add new languages, and produces clean text output, links, and page structure in N-Triples format.eng
dc.publisherČeské vysoké učení technické v Praze. Vypočetní a informační centrum.cze
dc.publisherCzech Technical University in Prague. Computing and Information Centre.eng
dc.rightsA university thesis is a work protected by the Copyright Act. Extracts, copies and transcripts of the thesis are allowed for personal use only and at one?s own expense. The use of thesis should be in compliance with the Copyright Act http://www.mkcr.cz/assets/autorske-pravo/01-3982006.pdf and the citation ethics http://knihovny.cvut.cz/vychova/vskp.htmleng
dc.rightsVysokoškolská závěrečná práce je dílo chráněné autorským zákonem. Je možné pořizovat z něj na své náklady a pro svoji osobní potřebu výpisy, opisy a rozmnoženiny. Jeho využití musí být v souladu s autorským zákonem http://www.mkcr.cz/assets/autorske-pravo/01-3982006.pdf a citační etikou http://knihovny.cvut.cz/vychova/vskp.htmlcze
dc.subjectNIFcze
dc.subjectRDFcze
dc.subjectpropojená datacze
dc.subjectweb škrábánícze
dc.subjectNIFeng
dc.subjectRDFeng
dc.subjectlinked dataeng
dc.subjectweb scrapingeng
dc.subjectknowledge grapheng
dc.titleFramework pro extrakci obsahu článků z Wikipediecze
dc.titleFramework for Extraction of Wikipedia Articles Contenteng
dc.typediplomová prácecze
dc.typemaster thesiseng
dc.contributor.refereeSmítková Janků Ladislava
theses.degree.disciplineWebové a softwarové inženýrstvícze
theses.degree.grantorkatedra softwarového inženýrstvícze
theses.degree.programmeInformatika 2010cze


Files in this item




This item appears in the following Collection(s)

Show simple item record