Exploring adversarial attacks and defenses
| dc.contributor.advisor | Fernandes, António Ramires | por |
| dc.contributor.author | Branco, Tiago Manuel Sampaio | por |
| dc.date.accessioned | 2024-12-12T15:08:08Z | |
| dc.date.available | 2024-12-12T15:08:08Z | |
| dc.date.issued | 2024-05-20 | |
| dc.date.submitted | 2024-02 | |
| dc.description.abstract | Deep Learning classifiers are capable of an outstanding performance. Yet, they are vulnera ble to adversarial attacks, i.e. it is possible to craft a slightly modified version of a correctly classified image that, although its contents are still clearly recognisable to a human being, the classifier outputs an incorrect classification. In this thesis we evaluate the effectiveness of adversarial attacks, namely their trans ferability to other models, and some proposed defenses. Transferability occurs when an adversarial sample is crafted with a model, and it succeeds in achieving a misclassification in another model. To make this study as comprehensive as possible, we explore several attack methods, namely: Fast Gradient Sign Method (FGSM), Deepfool, Jacobian Saliency Map Attack (JSMA), Carlini, Projected Gradient Descent (PGD) and Few Pixels. To evaluate the impact of the model’s architecture in the transferability rate we use sev eral common architectures: VGG16, three ResNet with different depths, and a small Con volution Neural Network. Two common datasets were used for evaluation: CIFAR-10 and German Traffic Sign Recognition Benchmark (GTSRB). Different attack methods use different approaches and parameters to craft adversarial samples. Hence, it is not trivial to control the degree of perturbation. To be able to achieve the same level of perturbation with every method we resorted to an image comparison metric: Structural Similarity Index Measure (SSIM). For each method we performed a search within its parameter space to find the parameters that on average attain a specific level of perturbation. To evaluate the impact of the level of perturbation on transferability rates, we evaluate two different values for the SSIM metric. Our results show that while it is possible to craft an adversarial sample in a particular model, the transferability rates vary considerably from method to method. Regarding defensive methods we explored Adversarial Training and Defensive Distilla tion. The results show that the ability to prevent an adversarial attack, or robustness, varies significantly depending on the conditions that the attack is performed and on the defensive methods used. Furthermore, there is a trade-off between robustness and accuracy, with defensive models having lower accuracy than non-defended models. | por |
| dc.description.abstract | Modelos classificativos de Deep Learning são capazes de performances extraordinárias, su perando mesmo a capacidade humana, no entanto são vulneráveis a ataques adversariais, por exemplo é possível criar uma versão modificada de uma imagem bem classificada, que apesar do ser facilmente reconhecível por um ser humano, o modelo classifica incorrectamente. Nesta tese avaliamos a transferabilidade dos ataques adversariais, e algumas propostas de defesa. A transferabilidade occorre quando um adversarial gerado por um modelo é capaz de fazer outro modelo o classificar incorrectamente. Para fazer este estudo o mais compreensivo possível, explorámos vários tipos de métodos de ataques, nomeadamente: FGSM, Deepfool, JSMA, Carlini, PGD and Few Pixels. Para avaliar o impacto da arquitectura do modelo na taxa de transferabilidade, usamos várias arquitecturas conhecidas: VGG16, 3 ResNet com diferentes números de camadas, e uma rede pequena de 3 camadas convolucionais. Usamos 2 datasets conhecidos para esta avaliação: CIFAR-10 e GTSRB. Diferentes métodos de ataques usam abordagens e parâmetros diferentes para gerar exemplos adversariais. Por isso, não é trivial controlar o grau de perturbação gerada pelos exemplos adversariais. Para sermos capazes de alcançar o mesmo nível de perturbação com todos os métodos recorremos a uma métrica de comparação de imagem: SSIM. Para cada método fizemos uma procura no domínio dos parâmetros para encontrar os valores que em média geram um nível específico de perturbação. Para avaliar o impacto do nível de perturbação na taxa de transferabilidade, avaliámos 2 valores diferentes para a métrica SSIM. Os nossos resultados mostram que enquanto é possível gerar um exemplo adversarial num modelo particular, a taxa de transferabilidade varia consideravelmente de método para método. Em relação às defesas exploramos Adversarial Training e Defensive Distillation. Os resultados mostram que a capacidade de prevenir um ataque adversarial varia significativamente dependendo das condições em que o ataque é feito e nos próprios métodos. | por |
| dc.identifier.tid | 203669436 | por |
| dc.identifier.uri | https://hdl.handle.net/1822/93917 | |
| dc.language.iso | eng | por |
| dc.rights | openAccess | por |
| dc.rights.uri | http://creativecommons.org/licenses/by/4.0/ | por |
| dc.subject | Adversarial attacks | por |
| dc.subject | FGSM | por |
| dc.subject | DeepFool | por |
| dc.subject | JSMA | por |
| dc.subject | PGD | por |
| dc.subject | Carlini | por |
| dc.subject | Adversarial training | por |
| dc.subject | Defensive distillation | por |
| dc.subject | SSIM | por |
| dc.subject | CIFAR-10 | por |
| dc.subject | GTSRB | por |
| dc.subject | Ataques adversariais | por |
| dc.subject | Treino adversarial | por |
| dc.subject | Defesa via destilação | por |
| dc.subject.fos | Engenharia e Tecnologia | por |
| dc.title | Exploring adversarial attacks and defenses | por |
| dc.type | masterThesis | eng |
| dspace.entity.type | Publication | en |
| sdum.degree.grade | 19 valores | por |
| sdum.uoei | Escola de Engenharia | por |
| thesis.degree.grantor | Universidade do Minho | por |
| thesis.degree.name | Mestrado em Engenharia Informática | por |
Ficheiros
Pacote original
1 - 1 de 1
A carregar...
- Nome:
- Tiago Manuel Sampaio Branco.pdf
- Tamanho:
- 9.99 MB
- Formato:
- Adobe Portable Document Format
- Descrição:
- Dissertação de mestrado