Programma di Machine And Reinforcement Learning In Control Applications:

Introduzione all’apprendimento per rinforzo (2 ore) - contestualizzazione rispetto a tecniche di machine learning. Metodi non associativi di apprendimento (4 ore) - n-bandit problem; - tecniche di upper confidence bound e preference updates. Introduzione a processi decisionali Markoviani (6 ore) - definizione di funzione valore e funzione qualità; - equazioni di Bellman. Programmazione dinamica (6 ore) - value iteration; - policy iteration; - generalized policy iteration. Tecniche di apprendimento tabellari (18 ore) - metodi Monte Carlo; - metodi alle differenze temporali (SARSA, Q-learning) - tracce di eleggibilità Utilizzo congiunto di tecniche di pianificazione e di apprendimento (6 ore) - algoritmo Dyna; - pianificazione al tempo di decisione. Tecniche di apprendimento basate su approssimazione funzionale (10 ore) - approssimatori funzionali lineari; - approssimatori funzionali non lineari; - algoritmi di stochastic gradient descent e ai minimi quadrati. Algoritmo di tipo policy gradient (4 ore) - algoritmi di tipo actor/critic. Analisi di sistemi parzialmente osservabili (4 ore) - partially observable Markov decision processes. Al termine di ciascun blocco teorico verrà effettuata un’esercitazione per illustrare gli algoritmi proposti.