Quantum reinforcement learning: foundations, algorithms, applications
| dc.contributor.advisor | Santos, Luís Paulo | por |
| dc.contributor.author | Sequeira, André Manuel Resende | por |
| dc.date.accessioned | 2025-06-03T14:03:52Z | |
| dc.date.available | 2025-06-03T14:03:52Z | |
| dc.date.issued | 2025-03-24 | |
| dc.date.submitted | 2025 | |
| dc.description.abstract | Os rápidos avanços na computação quântica abriram novas possibilidades para o aprimoramento da aprendizagem por reforço (RL), especialmente através de circuitos quânticos parametrizados (PQCs) como aproximadores de funções em algoritmos híbridos quântico-clássicos. Esta dissertação aborda desafios e oportunidades no uso de PQCs para RL, explorando o seu design, treino e potencial para alcançar vantagem quântica. A primeira parte investiga a expressividade e capacidade de treino de políticas baseadas em PQCs. Técnicas como reintrodução de dados e escalamento de entradas/saídas demonstram que os PQCs podem ter desempenho equivalente ou superior ao de redes neurais clássicas, frequentemente com menos parâmetros. No entanto, a capacidade de treino é limitada pelo fenómeno de Barren Plateau (BP), onde gradientes nulos dificultam a otimização. Esta dissertação identifica condições para mitigar BPs, garantindo treino em circuitos de profundidade logarítmica com medições locais. Com base nisso, a segunda parte explora técnicas de otimização para RL baseado em PQCs. Uma comparação entre gradientes naturais quânticos (QNG), com matriz de Fisher quântica (QFIM), e métodos com matriz de Fisher clássica (CFIM) revela compromissos entre otimizações no espaço de estados e de políticas. Embora QNGs ofereçam maior estabilidade, seus benefícios face à CFIM dependem do contexto. Para equilibrar treino eficiente e intratabilidade clássica, a terceira parte propõe políticas de PQCs baseadas em circuitos com geradores comutativos. Estes evitam o fenómeno de BP enquanto permanecem difíceis de simular classicamente, representando um caminho promissor para alcançar vantagem quântica. A parte final integra técnicas tolerantes a falhas com métodos baseados em PQCs, propondo uma estrutura para alcançar vantagem quântica provável em ambientes parcialmente observáveis, com demonstração de aceleração quadrática na complexidade amostral para atualizações de crenças via inferência Bayesiana quântica. Esta dissertação contribui para a compreensão do RL baseado em PQCs, oferecendo perspetivas sobre o seu design, treino e otimização, destacando o potencial da computação quântica para revolucionar o RL e viabilizar agentes quântico-aprimorados escaláveis. | por |
| dc.description.abstract | The rapid advancements in quantum computing have opened new avenues for enhancing reinforcement learning (RL), particularly through the use of parameterized quantum circuits (PQCs) as function approximators in hybrid quantum-classical algorithms. This dissertation addresses critical challenges and opportunities in leveraging PQCs for RL, exploring their design, trainability, and potential for achieving quantum advantage. The first part of this work investigates the expressivity and trainability of PQC-based policies. By introducing techniques such as data reuploading, input scaling, and output scaling, we demonstrate that PQCs can achieve performance on par with or superior to classical neural networks, often with fewer trainable parameters. However, PQC trainability is hindered by the Barren Plateau (BP) phenomenon, where vanishing gradients impede optimization. This dissertation identifies conditions under which BPs can be mitigated, ensuring trainability in logarithmic-depth circuits with local measurements. Building on these findings, the second part explores optimization techniques for PQC-based RL agents. A critical comparison of quantum natural gradients (QNG), leveraging the quantum Fisher information matrix (QFIM), and classical Fisher information matrix (CFIM)-based updates reveals tradeoffs in state-space versus policy-space optimizations. While QNG provides stability and informed updates, its benefits over CFIM-based methods are context-dependent. To address the balance between trainability and classical intractability, the third part proposes PQC-based policies derived from commuting-generator circuits. These circuits are designed to be efficiently trainable, avoiding the BP phenomenon, while remaining classically hard to simulate. These present a promising route toward achieving quantum advantage in RL. Finally, a fault-tolerant quantum framework was proposed to achieve provable quantum advantage in partially observable environments, supported by a demonstrated quadratic speedup in belief updates using quantum Bayesian inference. This dissertation contributes to the foundational understanding of PQC-based RL, offering insights into their design, trainability, and optimization. The results highlight the potential of quantum computing to revolutionize RL, paving the way for scalable and advantageous quantum-enhanced agents. | por |
| dc.description.sponsorship | This work is partially financed by National Funds through the Portuguese funding agency, FCT - Fundação para a Ciência e a Tecnologia, within project UIDB/50014/2020 (DOI 10.54499/UIDB/50014/2020), and financed by National Funds through FCT - Fundação para a Ciência e a Tecnologia, I.P. (Portuguese Foundation for Science and Technology) within the project IBEX, with reference PTDC/CCI-COM/4280/2021 (DOI 10.54499/PTDC/CCI-COM/4280/2021). | por |
| dc.identifier.tid | 101765045 | por |
| dc.identifier.uri | https://hdl.handle.net/1822/95999 | |
| dc.language.iso | eng | por |
| dc.relation | info:eu-repo/grantAgreement/FCT/6817 - DCRRNI ID/UIDB%2F50014%2F2020/PT | por |
| dc.relation | info:eu-repo/grantAgreement/FCT/3599-PPCDT/PTDC%2FCCI-COM%2F4280%2F2021/PT | por |
| dc.rights | openAccess | por |
| dc.rights.uri | http://creativecommons.org/licenses/by-nc-sa/4.0/ | por |
| dc.subject | Aprendizagem por Reforço Quântica | por |
| dc.subject | Atualização Quântica de Convicções Barren Plateaus | por |
| dc.subject | Gradientes Naturais Quânticos | por |
| dc.subject | Instantâneos Polinomiais Quânticos | por |
| dc.subject | Barren Plateaus | por |
| dc.subject | Instantaneous Quantum Polynomial | por |
| dc.subject | Quantum Natural Gradients | por |
| dc.subject | Quantum Policy Gradients | por |
| dc.subject | Quantum Reinforcement Learning | por |
| dc.subject.fos | Engenharia e Tecnologia::Engenharia Eletrotécnica, Eletrónica e Informática | por |
| dc.title | Quantum reinforcement learning: foundations, algorithms, applications | por |
| dc.type | doctoralThesis | eng |
| dspace.entity.type | Publication | en |
| sdum.degree.grade | Muito bom | por |
| sdum.uoei | Escola de Engenharia | por |
| thesis.degree.grantor | Universidade do Minho | por |
| thesis.degree.name | Doutoramento em Informática | por |
Ficheiros
Pacote original
1 - 1 de 1
A carregar...
- Nome:
- Andre Manuel Resende Sequeira.pdf
- Tamanho:
- 55.43 MB
- Formato:
- Adobe Portable Document Format
- Descrição:
- Tese de doutoramento