Diplomová práce

Deep Risk-Constrained Reinforcement Learning with Safety Critics

Bc. Martin Gendiar
Anotace

Táto diplomová práca sa zaoberá skúmaním zlepšovania bezpečnosti v rámci hlbokého spätnoväzobného učenia, najmä vo vysoko rizikových prostrediach. Hlavným prínosom tohto výskumu je vývoj a integrácia nového bezpečnostného kritika v rámci algoritmu proximal policy optimization. Táto inovácia má za cieľ vyvážiť maximalizáciu odmeny s minimalizáciou rizika, čím zabezpečuje bezpečnejšie rozhodovacie procesy …více

Abstract

This thesis addresses the need for enhanced safety in deep reinforcement learning frameworks, particularly in high-risk environments. The central contribution of this research is the development and integration of a novel safety critic within the proximal policy optimization framework. This innovation aims to balance reward maximization with risk minimization, ensuring safer decision-making processes …více

Zadání práce
The primary objective of this thesis is to explore and enhance the safety and efficiency of deep reinforcement learning algorithms, particularly in environments where risky decisions can lead to significant negative consequences. More precisely, the thesis will integrate a stand-alone 'Safety Critic' into the classical Proximal Policy Optimization (PPO) actor-critic network, so as to enhance the safety of the agent's behavior. The expected contents of the thesis are as follows:
  • The description of the safe reinforcement learning problem, as well as a brief survey of the related literature.
  • Description of previously known components of the proposed approach (PPO etc.)
  • Proposal, discussion, and experimental evaluation of several approaches to the safety critic's design and its integration to the PPO loop.
  • The evaluation will focus on environments with continuous dynamics.
Práce zkontrolována:
24. 5. 2024 19:18, doc. RNDr. Petr Novotný, Ph.D., učo 172743
Jazyk práce
angličtina angličtina
Termín obhajoby
18. 6. 2024
Práce byla úspěšně obhájena

Vedoucí

doc. RNDr. Petr Novotný, Ph.D., učo 172743
KTP FI MU

Oponent

doc. RNDr. Tomáš Brázdil, Ph.D., MBA, učo 4074
KSUZD FI MU

Masarykova univerzita Fakulta informatiky
Plán
Strojové učení a umělá inteligence
  • Přidání souboru

    Soubor nebo složku lze nahrát pomocí tlačítka Přidat.
  • Další operace se soubory

    Podrobnosti lze zjistit označením příslušného řádku.
  • Pohled pro experty

    Pro častou práci je možné zvolit režim Více možností.
  • Vyhledávání souborů

    Vyhledávaný výraz můžete zadat přímo do adresního řádku.
  • Rychlý přístup k souborům

    Pomocí funkce Nedávné je možné se rychle vrátit k právě prohlíženým souborům. Oblíbené soubory je také možné označit Hvězdičkou.