Developing an automated machine and deep learning framework for protein classification

dc.commentsEE/2025/3622por
dc.contributor.advisorRocha, Miguelpor
dc.contributor.advisorPereira, Ricardo Nuno Correiapor
dc.contributor.authorSousa, Guilherme Lobopor
dc.date.accessioned2025-07-30T15:42:31Z
dc.date.available2025-07-30T15:42:31Z
dc.date.issued2024-11-29
dc.date.submitted2024-10
dc.description.abstractResearchers are increasingly concerned with the challenge of providing nutritious, high-quality food to meet the growing global population. In this context, applying machine learning (ML) and deep learning (DL) models to classify and identify key protein properties, such as antioxidants and allergens, holds significant potential. This approach can improve food formulation, safety, and sustainability, contributing to healthier products that meet nutritional needs. This project, in collaboration with OmniumAI, a spin-off from the University of Minho, focused on advancing the development of OmniA, an automated machine learning (AutoML) platform. In the Proteins sub-package, new protein descriptors were added to the feature extraction module, and three encoding methods were updated (Non-linear fisher, Evolutionary scale modeling, and Protbert) to handle sequences of up to 600 amino acids through padding and truncation. In the Generics sub-package, four DL models were implemented: Autoencoder and 1D convolutional neural networks (CNN1D), for tabular data; recurrent neural networks (RNNs), and CNN1D-RNNs for matrix data. Cross-validation support was added and both sub-packages now include presets at three complexity levels, which progressively increase the computational resources utilized. Benchmarking was conducted on specific antioxidant and allergen datasets to validate OmniA’s development. In the antioxidant study, OmniA’s top pipeline (based on pre-trained ESM2 model, with a tabular predictor) achieved balanced results (accuracy and F1-scores around 0.7). While not the top-performing approaches, it provided strong reliability through robust methods that maintained the integrity of the test set. For the allergenic study, OmniA’s pipeline (similar configuration) outperformed other approaches with excellent results (accuracy and F1-score of 0.94). In conclusion, OmniA strikes a balance between predictive capacity and computational efficiency across both case studies. The platform is flexible, automatic, and user-friendly, even for individuals without deep expertise, while remaining competitive with traditional approaches.por
dc.description.abstractOs investigadores estão preocupados com o desafio de fornecer alimentos nutritivos e de alta qualidade para satisfazer a crescente população mundial. Neste contexto, a aplicação de modelos de aprendizagem de máquina e de aprendizagem profunda para classificar propriedades proteicas, como antioxidante e alergénica, tem um potencial significativo. Esta abordagem pode melhorar a formulação, segurança e sustentabilidade dos alimentos, contribuindo para produtos que satisfaçam as necessidades nutricionais. Este projeto, em colaboração com a OmniumAI, uma spin-off da Universidade do Minho, focou-se no desenvolvimento da OmniA, uma plataforma de aprendizagem máquina automática. No sub-pacote de proteínas, foram adicionados novos descritores proteicos ao módulo de extração de caraterísticas, e três métodos de codificação foram actualizados para lidar com sequências de até 600 aminoácidos através de preenchimento e truncagem. No sub-pacote de genéricos, foram implementados quatro modelos de aprendizagem profunda (Autoencoder, CNN1D para dados tabulares, RNN e CNN1D-RNN para dados matriciais), juntamente com suporte para validação cruzada. Ambos os sub-pacotes incluem agora predefinições em três níveis de complexidade: leve, médio e pesado. Para validar o desenvolvimento, foi efectuada uma avaliação comparativa com comparativa em conjuntos de dados específicos de proteinas antioxidantes e alergénicas para validar o desenvolvimento da OmniA. No estudo de antioxidantes, a melhor pipeline da OmniA (baseada no modelo ESM2 pré-treinado, com um modelo tabular predictor) obteve resultados equilibrados (accuracy e F1-score de 0,7). Embora não seja a abordagem com melhor desempenho, proporcionou uma forte fiabilidade através de métodos robustos que mantiveram a integridade do conjunto de testes. Para o estudo em proteinas alergénicas, a pipeline do OmniA (configuração semelhante) superou as outras abordagens com excelentes resultados (accuracye F1-score de 0,94). . Em suma, a OmniA consegue um equilíbrio entre a capacidade preditiva e eficiência computacional. A plataforma é flexível e automática , mantendo-se competitiva em relação às abordagens tradicionais.por
dc.identifier.tid203970519por
dc.identifier.urihttps://hdl.handle.net/1822/96814
dc.language.isoengpor
dc.rightsopenAccesspor
dc.rights.urihttp://creativecommons.org/licenses/by-nc-nd/4.0/por
dc.subjectAutomated machine learningpor
dc.subjectOmniApor
dc.subjectProteinspor
dc.subjectAprendizagem máquina automatizadapor
dc.subjectProteinaspor
dc.subject.fosEngenharia e Tecnologia::Outras Engenharias e Tecnologiaspor
dc.titleDeveloping an automated machine and deep learning framework for protein classificationpor
dc.typemasterThesiseng
dspace.entity.typePublicationen
sdum.degree.grade18 valorespor
sdum.uoeiEscola de Engenhariapor
thesis.degree.grantorUniversidade do Minhopor
thesis.degree.nameMestrado em Bioinformáticapor

Ficheiros

Pacote original

A mostrar 1 - 1 de 1
A carregar...
Nome:
Guilherme Lobo Sousa.pdf
Tamanho:
5.37 MB
Formato:
Adobe Portable Document Format
Descrição:
Dissertação de mestrado