Programma di Machine And Reinforcement Learning In Control Applications:
Introduzione all’apprendimento per rinforzo (2 ore)
- contestualizzazione rispetto a tecniche di machine learning.
Metodi non associativi di apprendimento (4 ore)
- n-bandit problem;
- tecniche di upper confidence bound e preference updates.
Introduzione a processi decisionali Markoviani (6 ore)
- definizione di funzione valore e funzione qualità;
- equazioni di Bellman.
Programmazione dinamica (6 ore)
- value iteration;
- policy iteration;
- generalized policy iteration.
Tecniche di apprendimento tabellari (18 ore)
- metodi Monte Carlo;
- metodi alle differenze temporali (SARSA, Q-learning)
- tracce di eleggibilità
Utilizzo congiunto di tecniche di pianificazione e di apprendimento (6 ore)
- algoritmo Dyna;
- pianificazione al tempo di decisione.
Tecniche di apprendimento basate su approssimazione funzionale (10 ore)
- approssimatori funzionali lineari;
- approssimatori funzionali non lineari;
- algoritmi di stochastic gradient descent e ai minimi quadrati.
Algoritmo di tipo policy gradient (4 ore)
- algoritmi di tipo actor/critic.
Analisi di sistemi parzialmente osservabili (4 ore)
- partially observable Markov decision processes.
Al termine di ciascun blocco teorico verrà effettuata un’esercitazione per illustrare gli algoritmi proposti.