Zobrazit minimální záznam

Enrichment of the DBpedia NIF dataset



dc.contributor.advisorDojčinovski Milan
dc.contributor.authorPragalbha Lakshmanan
dc.date.accessioned2019-06-11T14:51:13Z
dc.date.available2019-06-11T14:51:13Z
dc.date.issued2019-06-09
dc.identifierKOS-890511064705
dc.identifier.urihttp://hdl.handle.net/10467/82691
dc.description.abstractDBpedia je komunitní úsilí založené na davu, jehož cílem je získávat informace z ˇclánk°u Wikipedie a poskytovat tyto informace ve strojovˇe ˇcitelném formátu. Datový soubor DBpedia NIF poskytuje obsah všech ˇclánk°u Wikipedie ve 128 jazycích. Koneˇcným cílem práce je obohatit datovou sadu o další informace, jejichž hlavní výzvou je velikost datové sady. Implementace spoˇcívá v pˇredbˇežném zpracování souboru dat oddˇelením obsahu jednotlivých ˇclánk°u Wikipedie do samostatných soubor°u, protože soubor dat NIF obsahuje obsah všech ˇclánk°u v jednom obrovském souboru. Pˇredbˇežné zpracování textu napomáhá k využití datové sady pro školení r°uzných úloh zpracování pˇrirozeného jazyka. Po provedení následuje provedení NLP úkol°u, a to rozdˇelení vˇet, Tokenizace, ˇcást znaˇckování ˇreˇci. Nakonec pˇrisp ˇet do komunity DBpedia pˇridáním dalších odkaz°u na ˇclánky wikipedia. Koneˇcnˇe, vyhodnocení výsledk°u a kontrola správnosti výsledk°u statisticky.cze
dc.description.abstractDBpedia is a crowd-sourced community effort which aims at extracting information from Wikipedia articles and providing this information in a machine-readable format. DBpedia NIF dataset provides the content of all Wikipedia articles in 128 languages. The ultimate goal of the thesis is to enrich the dataset with additional information where the main challenge is the size of the dataset. The implementation comprises of pre-processing the dataset by segregating the contents of individual Wikipedia articles into separate files, as the NIF dataset comprises the contents of all the articles in one huge file. The text pre-processing helps in order to use the dataset for training different Natural language processing tasks. The implementation is followed by performing NLP tasks namely sentence splitting, Tokenization, Part of speech tagging. Eventually contribute to the DBpedia community by adding additional links to the wikipedia articles. Finally, evaluating the results and checking the correctness of the results statistically.eng
dc.publisherČeské vysoké učení technické v Praze. Vypočetní a informační centrum.cze
dc.publisherCzech Technical University in Prague. Computing and Information Centre.eng
dc.rightsA university thesis is a work protected by the Copyright Act. Extracts, copies and transcripts of the thesis are allowed for personal use only and at one?s own expense. The use of thesis should be in compliance with the Copyright Act http://www.mkcr.cz/assets/autorske-pravo/01-3982006.pdf and the citation ethics http://knihovny.cvut.cz/vychova/vskp.htmleng
dc.rightsVysokoškolská závěrečná práce je dílo chráněné autorským zákonem. Je možné pořizovat z něj na své náklady a pro svoji osobní potřebu výpisy, opisy a rozmnoženiny. Jeho využití musí být v souladu s autorským zákonem http://www.mkcr.cz/assets/autorske-pravo/01-3982006.pdf a citační etikou http://knihovny.cvut.cz/vychova/vskp.htmlcze
dc.subjectDBpediacze
dc.subjectdatový soubor NIFcze
dc.subjectobohacení datové sadycze
dc.subjectpˇredzpracovánítextucze
dc.subjectúlohy NLPcze
dc.subjectdalší odkazycze
dc.subjectDBpediaeng
dc.subjectNIF dataseteng
dc.subjectenrich dataseteng
dc.subjecttext pre-processingeng
dc.subjectNLP taskseng
dc.subjectadditional linkseng
dc.titleObohacení datové sady DBpedia NIFcze
dc.titleEnrichment of the DBpedia NIF dataseteng
dc.typediplomová prácecze
dc.typemaster thesiseng
dc.contributor.refereeKlímek Jakub
theses.degree.disciplineWeb and Software Engineeringcze
theses.degree.grantorkatedra softwarového inženýrstvícze
theses.degree.programmeInformatics (in English)cze


Soubory tohoto záznamu




Tento záznam se objevuje v následujících kolekcích

Zobrazit minimální záznam