Lip Reading using Deep Neural Networks
Odezírání ze rtů pomocí hlubokých neuronových sítí
Authors
Supervisors
Reviewers
Editors
Other contributors
Journal Title
Journal ISSN
Volume Title
Publisher
České vysoké učení technické v Praze
Czech Technical University in Prague
Czech Technical University in Prague
Date of defense
2018-06-19
Abstract
Problém odezírání ze rtů, tedy umění odhadu vysloveného slova, popř. celé věty, pouze z vizuální informace, je vzhledem k vysoké různorodosti artikulace lidí, počtu jazyků a slov v každém z nich, velmi složitá, ale zajímavá úloha. V této Bakalářské práci analyzuji doposud známé způsoby odezírání ze rtů, zjišťuji jejich přesnosti a mou snahou je ověření zda je použití metod umělé inteligence, konkrétně hlubokých neuronových sítí, vhodným kandidátem pro řešení tohoto problému. V praktické části se zaměřuji na prezentaci výsledků a to jednak v podobě přesnosti mnou vytrénované neuronové sítě na testovacích datech, jednak vytvořením webové aplikace pro zjištění, jak náročné by bylo takový nástroj využít v praxi pro rozpoznávání řeči v reálném čase metodou odezírání ze rtů.
The problem of lip reading, which means a skill of guessing one's uttered word or whole sentence only out of a visual information, is a very hard - yet interesting task, due to variety of people, their languages and articulations. In this bachelor thesis I analyze the known methods of lip reading, I find their accuracy and my aim is to verify whether the use of artificial intelligence methods, namely Deep Neural Network, is a suitable candidate for solving this problem. In the practical part, I focus on presenting the results both in terms of the accuracy of the trained neural network on test data and by creating and publishing a web application to find out how difficult it would really be to use such a tool for a real-time speech recognition using the lip reading method.
The problem of lip reading, which means a skill of guessing one's uttered word or whole sentence only out of a visual information, is a very hard - yet interesting task, due to variety of people, their languages and articulations. In this bachelor thesis I analyze the known methods of lip reading, I find their accuracy and my aim is to verify whether the use of artificial intelligence methods, namely Deep Neural Network, is a suitable candidate for solving this problem. In the practical part, I focus on presenting the results both in terms of the accuracy of the trained neural network on test data and by creating and publishing a web application to find out how difficult it would really be to use such a tool for a real-time speech recognition using the lip reading method.
Description
Citation
Permanent link
Rights/License
A university thesis is a work protected by the Copyright Act of the Czech Republic. Extracts, copies and transcripts of the thesis are allowed for personal use only and at one`s own expense. The use of thesis should be in compliance with the Copyright Act.
Vysokoškolská závěrečná práce je dílo chráněné autorským zákonem. Je možné pořizovat z něj na své náklady a pro svoji osobní potřebu výpisy, opisy a rozmnoženiny. Jeho využití musí být v souladu s autorským zákonem v platném znění.
Vysokoškolská závěrečná práce je dílo chráněné autorským zákonem. Je možné pořizovat z něj na své náklady a pro svoji osobní potřebu výpisy, opisy a rozmnoženiny. Jeho využití musí být v souladu s autorským zákonem v platném znění.