Otimizações de armazenamento distribuído para aprendizagem profunda
| dc.contributor.advisor | Paulo, João Tiago Medeiros | por |
| dc.contributor.advisor | Macedo, Ricardo Gonçalves | por |
| dc.contributor.advisor | Brito, Cláudia Vanessa Martins de | por |
| dc.contributor.author | Moreira, Maria Beatriz Cardoso Gonçalves Barbosa e | por |
| dc.date.accessioned | 2024-09-12T16:03:17Z | |
| dc.date.available | 2024-09-12T16:03:17Z | |
| dc.date.issued | 2024-02-19 | |
| dc.date.submitted | 2024-02 | |
| dc.description.abstract | In today’s world the utilization of Deep Learning (DL) is intrinsically integrated in the activity of several enterprises and industries. It allows us to extract knowledge from data, detect patterns and make pre dictions, increasing the competitivity and quality of the services provided. However, the DL frameworks (e.g., TensorFlow, PyTorch, Apache MxNet) require not only considerable of computational power, but also efficient data storage, since they need to deal with large amounts of data. In particular, in each iteration of the DL model train different batches of the training dataset are accessed to be processed and incorporated in the model. The retrieval of this data can be a bottleneck to the performance of the system, since the datasets are getting increasingly bigger, reaching sizes in the order of TBs. In the case of multi-node DL this becomes increasingly critical since there are many compute nodes training models, possibly with the same dataset, resulting in more requests directed to the shared file system competing with each other. If data could be stored nearer to the computational nodes and those nodes shared the data with one another, it would reduce the I/O pressure in the shared storage system and potentially reduce the time taken by these accesses and, consequently, the training time. This thesis presents DistMonarch, a DL framework agnostic system that takes advantage of the storage system hierarchy by copying data to levels closer to each compute node and allows the nodes to share data with each other, in a transparent manner. Results show that using this system reduces accesses to the shared file system by up to 90% and training time of some models and configurations by up to 48%. | por |
| dc.description.abstract | No mundo atual a utilização de Aprendizagem Profunda (AP) está intrinsecamente integrada na ativi dade de diversas empresas e instituições. Esta permite extrair conhecimento de dados, detetar padrões e efetuar previsões, aumentando assim a competitividade e qualidade dos serviços prestados. No en tanto, as ferramentas de AP (p. ex., TensorFlow, PyTorch, Apache MxNet) requerem não só um grande poder de computação, mas também de armazenamento, uma vez que necessitam de lidar com grandes quantidades de dados. Nomeadamente, em cada iteração do treino de um modelo de AP são acedidas diferentes amostras de dados do conjunto de dados de treino para serem processadas e incorporadas no modelo. A obtenção desses dados pode ser um gargalo no desempenho do sistema, uma vez que os conjuntos de dados são cada vez maiores, chegando a tamanhos na ordem dos TBs. No caso de abordagens AP multi-nodo isto é ainda mais crítico, uma vez que temos vários nodos de computação a treinar possivelmente com o mesmo conjunto de dados, resultando em mais pedidos feitos ao sistema de ficheiros partilhado a concorrer entre si. Se os dados pudessem ser guardados mais perto dos nodos computacionais e os dados fossem partilhados entre eles isso permitiria reduzir a pressão de E/S no sistema de armazenamento partilhado e potencialmente reduzir os tempos dos acessos e, por conseguinte, do treino. Esta tese apresenta o DistMonarch, um sistema agnóstico à ferramenta de AP que aproveita a hie rarquia do sistema de armazenamento existente em infraestruturas de computação avançada, copiando dados para níveis mais próximos de cada nodo de computação e permite que os vários nodos partilhem esses dados entre si de forma transparente. Os resultados mostram que a utilização deste sistema per mite reduzir os acessos ao sistema de ficheiros partilhado até 90% e tempo de treino de alguns modelos e configurações até 48%. | por |
| dc.identifier.tid | 203668332 | por |
| dc.identifier.uri | https://hdl.handle.net/1822/93042 | |
| dc.language.iso | por | por |
| dc.rights | openAccess | por |
| dc.rights.uri | http://creativecommons.org/licenses/by-nc-sa/4.0/ | por |
| dc.subject | I/O Optimization | por |
| dc.subject | Multi-node deep learning | por |
| dc.subject | Otimização de E/S | por |
| dc.subject | Aprendizagem profunda multi-nodo | por |
| dc.subject.fos | Engenharia e Tecnologia | por |
| dc.title | Otimizações de armazenamento distribuído para aprendizagem profunda | por |
| dc.type | masterThesis | eng |
| dspace.entity.type | Publication | en |
| sdum.degree.grade | 18 valores | por |
| sdum.uoei | Escola de Engenharia | por |
| thesis.degree.grantor | Universidade do Minho | por |
| thesis.degree.name | Mestrado em Engenharia Informática | por |
Ficheiros
Pacote original
1 - 1 de 1
A carregar...
- Nome:
- Maria Beatriz Cardoso Goncalves Barbosa e Moreira.pdf
- Tamanho:
- 3.96 MB
- Formato:
- Adobe Portable Document Format
- Descrição:
- Dissertação de mestrado