Exploring adversarial attacks and defenses

dc.contributor.advisorFernandes, António Ramirespor
dc.contributor.authorBranco, Tiago Manuel Sampaiopor
dc.date.accessioned2024-12-12T15:08:08Z
dc.date.available2024-12-12T15:08:08Z
dc.date.issued2024-05-20
dc.date.submitted2024-02
dc.description.abstractDeep Learning classifiers are capable of an outstanding performance. Yet, they are vulnera ble to adversarial attacks, i.e. it is possible to craft a slightly modified version of a correctly classified image that, although its contents are still clearly recognisable to a human being, the classifier outputs an incorrect classification. In this thesis we evaluate the effectiveness of adversarial attacks, namely their trans ferability to other models, and some proposed defenses. Transferability occurs when an adversarial sample is crafted with a model, and it succeeds in achieving a misclassification in another model. To make this study as comprehensive as possible, we explore several attack methods, namely: Fast Gradient Sign Method (FGSM), Deepfool, Jacobian Saliency Map Attack (JSMA), Carlini, Projected Gradient Descent (PGD) and Few Pixels. To evaluate the impact of the model’s architecture in the transferability rate we use sev eral common architectures: VGG16, three ResNet with different depths, and a small Con volution Neural Network. Two common datasets were used for evaluation: CIFAR-10 and German Traffic Sign Recognition Benchmark (GTSRB). Different attack methods use different approaches and parameters to craft adversarial samples. Hence, it is not trivial to control the degree of perturbation. To be able to achieve the same level of perturbation with every method we resorted to an image comparison metric: Structural Similarity Index Measure (SSIM). For each method we performed a search within its parameter space to find the parameters that on average attain a specific level of perturbation. To evaluate the impact of the level of perturbation on transferability rates, we evaluate two different values for the SSIM metric. Our results show that while it is possible to craft an adversarial sample in a particular model, the transferability rates vary considerably from method to method. Regarding defensive methods we explored Adversarial Training and Defensive Distilla tion. The results show that the ability to prevent an adversarial attack, or robustness, varies significantly depending on the conditions that the attack is performed and on the defensive methods used. Furthermore, there is a trade-off between robustness and accuracy, with defensive models having lower accuracy than non-defended models.por
dc.description.abstractModelos classificativos de Deep Learning são capazes de performances extraordinárias, su perando mesmo a capacidade humana, no entanto são vulneráveis a ataques adversariais, por exemplo é possível criar uma versão modificada de uma imagem bem classificada, que apesar do ser facilmente reconhecível por um ser humano, o modelo classifica incorrectamente. Nesta tese avaliamos a transferabilidade dos ataques adversariais, e algumas propostas de defesa. A transferabilidade occorre quando um adversarial gerado por um modelo é capaz de fazer outro modelo o classificar incorrectamente. Para fazer este estudo o mais compreensivo possível, explorámos vários tipos de métodos de ataques, nomeadamente: FGSM, Deepfool, JSMA, Carlini, PGD and Few Pixels. Para avaliar o impacto da arquitectura do modelo na taxa de transferabilidade, usamos várias arquitecturas conhecidas: VGG16, 3 ResNet com diferentes números de camadas, e uma rede pequena de 3 camadas convolucionais. Usamos 2 datasets conhecidos para esta avaliação: CIFAR-10 e GTSRB. Diferentes métodos de ataques usam abordagens e parâmetros diferentes para gerar exemplos adversariais. Por isso, não é trivial controlar o grau de perturbação gerada pelos exemplos adversariais. Para sermos capazes de alcançar o mesmo nível de perturbação com todos os métodos recorremos a uma métrica de comparação de imagem: SSIM. Para cada método fizemos uma procura no domínio dos parâmetros para encontrar os valores que em média geram um nível específico de perturbação. Para avaliar o impacto do nível de perturbação na taxa de transferabilidade, avaliámos 2 valores diferentes para a métrica SSIM. Os nossos resultados mostram que enquanto é possível gerar um exemplo adversarial num modelo particular, a taxa de transferabilidade varia consideravelmente de método para método. Em relação às defesas exploramos Adversarial Training e Defensive Distillation. Os resultados mostram que a capacidade de prevenir um ataque adversarial varia significativamente dependendo das condições em que o ataque é feito e nos próprios métodos.por
dc.identifier.tid203669436por
dc.identifier.urihttps://hdl.handle.net/1822/93917
dc.language.isoengpor
dc.rightsopenAccesspor
dc.rights.urihttp://creativecommons.org/licenses/by/4.0/por
dc.subjectAdversarial attackspor
dc.subjectFGSMpor
dc.subjectDeepFoolpor
dc.subjectJSMApor
dc.subjectPGDpor
dc.subjectCarlinipor
dc.subjectAdversarial trainingpor
dc.subjectDefensive distillationpor
dc.subjectSSIMpor
dc.subjectCIFAR-10por
dc.subjectGTSRBpor
dc.subjectAtaques adversariaispor
dc.subjectTreino adversarialpor
dc.subjectDefesa via destilaçãopor
dc.subject.fosEngenharia e Tecnologiapor
dc.titleExploring adversarial attacks and defensespor
dc.typemasterThesiseng
dspace.entity.typePublicationen
sdum.degree.grade19 valorespor
sdum.uoeiEscola de Engenhariapor
thesis.degree.grantorUniversidade do Minhopor
thesis.degree.nameMestrado em Engenharia Informáticapor

Ficheiros

Pacote original

A mostrar 1 - 1 de 1
A carregar...
Nome:
Tiago Manuel Sampaio Branco.pdf
Tamanho:
9.99 MB
Formato:
Adobe Portable Document Format
Descrição:
Dissertação de mestrado