Otimizações de armazenamento distribuído para aprendizagem profunda

dc.contributor.advisorPaulo, João Tiago Medeirospor
dc.contributor.advisorMacedo, Ricardo Gonçalvespor
dc.contributor.advisorBrito, Cláudia Vanessa Martins depor
dc.contributor.authorMoreira, Maria Beatriz Cardoso Gonçalves Barbosa epor
dc.date.accessioned2024-09-12T16:03:17Z
dc.date.available2024-09-12T16:03:17Z
dc.date.issued2024-02-19
dc.date.submitted2024-02
dc.description.abstractIn today’s world the utilization of Deep Learning (DL) is intrinsically integrated in the activity of several enterprises and industries. It allows us to extract knowledge from data, detect patterns and make pre dictions, increasing the competitivity and quality of the services provided. However, the DL frameworks (e.g., TensorFlow, PyTorch, Apache MxNet) require not only considerable of computational power, but also efficient data storage, since they need to deal with large amounts of data. In particular, in each iteration of the DL model train different batches of the training dataset are accessed to be processed and incorporated in the model. The retrieval of this data can be a bottleneck to the performance of the system, since the datasets are getting increasingly bigger, reaching sizes in the order of TBs. In the case of multi-node DL this becomes increasingly critical since there are many compute nodes training models, possibly with the same dataset, resulting in more requests directed to the shared file system competing with each other. If data could be stored nearer to the computational nodes and those nodes shared the data with one another, it would reduce the I/O pressure in the shared storage system and potentially reduce the time taken by these accesses and, consequently, the training time. This thesis presents DistMonarch, a DL framework agnostic system that takes advantage of the storage system hierarchy by copying data to levels closer to each compute node and allows the nodes to share data with each other, in a transparent manner. Results show that using this system reduces accesses to the shared file system by up to 90% and training time of some models and configurations by up to 48%.por
dc.description.abstractNo mundo atual a utilização de Aprendizagem Profunda (AP) está intrinsecamente integrada na ativi dade de diversas empresas e instituições. Esta permite extrair conhecimento de dados, detetar padrões e efetuar previsões, aumentando assim a competitividade e qualidade dos serviços prestados. No en tanto, as ferramentas de AP (p. ex., TensorFlow, PyTorch, Apache MxNet) requerem não só um grande poder de computação, mas também de armazenamento, uma vez que necessitam de lidar com grandes quantidades de dados. Nomeadamente, em cada iteração do treino de um modelo de AP são acedidas diferentes amostras de dados do conjunto de dados de treino para serem processadas e incorporadas no modelo. A obtenção desses dados pode ser um gargalo no desempenho do sistema, uma vez que os conjuntos de dados são cada vez maiores, chegando a tamanhos na ordem dos TBs. No caso de abordagens AP multi-nodo isto é ainda mais crítico, uma vez que temos vários nodos de computação a treinar possivelmente com o mesmo conjunto de dados, resultando em mais pedidos feitos ao sistema de ficheiros partilhado a concorrer entre si. Se os dados pudessem ser guardados mais perto dos nodos computacionais e os dados fossem partilhados entre eles isso permitiria reduzir a pressão de E/S no sistema de armazenamento partilhado e potencialmente reduzir os tempos dos acessos e, por conseguinte, do treino. Esta tese apresenta o DistMonarch, um sistema agnóstico à ferramenta de AP que aproveita a hie rarquia do sistema de armazenamento existente em infraestruturas de computação avançada, copiando dados para níveis mais próximos de cada nodo de computação e permite que os vários nodos partilhem esses dados entre si de forma transparente. Os resultados mostram que a utilização deste sistema per mite reduzir os acessos ao sistema de ficheiros partilhado até 90% e tempo de treino de alguns modelos e configurações até 48%.por
dc.identifier.tid203668332por
dc.identifier.urihttps://hdl.handle.net/1822/93042
dc.language.isoporpor
dc.rightsopenAccesspor
dc.rights.urihttp://creativecommons.org/licenses/by-nc-sa/4.0/por
dc.subjectI/O Optimizationpor
dc.subjectMulti-node deep learningpor
dc.subjectOtimização de E/Spor
dc.subjectAprendizagem profunda multi-nodopor
dc.subject.fosEngenharia e Tecnologiapor
dc.titleOtimizações de armazenamento distribuído para aprendizagem profundapor
dc.typemasterThesiseng
dspace.entity.typePublicationen
sdum.degree.grade18 valorespor
sdum.uoeiEscola de Engenhariapor
thesis.degree.grantorUniversidade do Minhopor
thesis.degree.nameMestrado em Engenharia Informáticapor

Ficheiros

Pacote original

A mostrar 1 - 1 de 1
A carregar...
Nome:
Maria Beatriz Cardoso Goncalves Barbosa e Moreira.pdf
Tamanho:
3.96 MB
Formato:
Adobe Portable Document Format
Descrição:
Dissertação de mestrado