Obohacení datové sady DBpedia NIF
Enrichment of the DBpedia NIF dataset
dc.contributor.advisor | Dojčinovski Milan | |
dc.contributor.author | Pragalbha Lakshmanan | |
dc.date.accessioned | 2019-06-11T14:51:13Z | |
dc.date.available | 2019-06-11T14:51:13Z | |
dc.date.issued | 2019-06-09 | |
dc.identifier | KOS-890511064705 | |
dc.identifier.uri | http://hdl.handle.net/10467/82691 | |
dc.description.abstract | DBpedia je komunitní úsilí založené na davu, jehož cílem je získávat informace z ˇclánk°u Wikipedie a poskytovat tyto informace ve strojovˇe ˇcitelném formátu. Datový soubor DBpedia NIF poskytuje obsah všech ˇclánk°u Wikipedie ve 128 jazycích. Koneˇcným cílem práce je obohatit datovou sadu o další informace, jejichž hlavní výzvou je velikost datové sady. Implementace spoˇcívá v pˇredbˇežném zpracování souboru dat oddˇelením obsahu jednotlivých ˇclánk°u Wikipedie do samostatných soubor°u, protože soubor dat NIF obsahuje obsah všech ˇclánk°u v jednom obrovském souboru. Pˇredbˇežné zpracování textu napomáhá k využití datové sady pro školení r°uzných úloh zpracování pˇrirozeného jazyka. Po provedení následuje provedení NLP úkol°u, a to rozdˇelení vˇet, Tokenizace, ˇcást znaˇckování ˇreˇci. Nakonec pˇrisp ˇet do komunity DBpedia pˇridáním dalších odkaz°u na ˇclánky wikipedia. Koneˇcnˇe, vyhodnocení výsledk°u a kontrola správnosti výsledk°u statisticky. | cze |
dc.description.abstract | DBpedia is a crowd-sourced community effort which aims at extracting information from Wikipedia articles and providing this information in a machine-readable format. DBpedia NIF dataset provides the content of all Wikipedia articles in 128 languages. The ultimate goal of the thesis is to enrich the dataset with additional information where the main challenge is the size of the dataset. The implementation comprises of pre-processing the dataset by segregating the contents of individual Wikipedia articles into separate files, as the NIF dataset comprises the contents of all the articles in one huge file. The text pre-processing helps in order to use the dataset for training different Natural language processing tasks. The implementation is followed by performing NLP tasks namely sentence splitting, Tokenization, Part of speech tagging. Eventually contribute to the DBpedia community by adding additional links to the wikipedia articles. Finally, evaluating the results and checking the correctness of the results statistically. | eng |
dc.publisher | České vysoké učení technické v Praze. Vypočetní a informační centrum. | cze |
dc.publisher | Czech Technical University in Prague. Computing and Information Centre. | eng |
dc.rights | A university thesis is a work protected by the Copyright Act. Extracts, copies and transcripts of the thesis are allowed for personal use only and at one?s own expense. The use of thesis should be in compliance with the Copyright Act http://www.mkcr.cz/assets/autorske-pravo/01-3982006.pdf and the citation ethics http://knihovny.cvut.cz/vychova/vskp.html | eng |
dc.rights | Vysokoškolská závěrečná práce je dílo chráněné autorským zákonem. Je možné pořizovat z něj na své náklady a pro svoji osobní potřebu výpisy, opisy a rozmnoženiny. Jeho využití musí být v souladu s autorským zákonem http://www.mkcr.cz/assets/autorske-pravo/01-3982006.pdf a citační etikou http://knihovny.cvut.cz/vychova/vskp.html | cze |
dc.subject | DBpedia | cze |
dc.subject | datový soubor NIF | cze |
dc.subject | obohacení datové sady | cze |
dc.subject | pˇredzpracovánítextu | cze |
dc.subject | úlohy NLP | cze |
dc.subject | další odkazy | cze |
dc.subject | DBpedia | eng |
dc.subject | NIF dataset | eng |
dc.subject | enrich dataset | eng |
dc.subject | text pre-processing | eng |
dc.subject | NLP tasks | eng |
dc.subject | additional links | eng |
dc.title | Obohacení datové sady DBpedia NIF | cze |
dc.title | Enrichment of the DBpedia NIF dataset | eng |
dc.type | diplomová práce | cze |
dc.type | master thesis | eng |
dc.contributor.referee | Klímek Jakub | |
theses.degree.discipline | Web and Software Engineering | cze |
theses.degree.grantor | katedra softwarového inženýrství | cze |
theses.degree.programme | Informatics (in English) | cze |
Soubory tohoto záznamu
Tento záznam se objevuje v následujících kolekcích
-
Diplomové práce - 18102 [1005]