Description du cours
À la fin de ce cours, les étudiants seront en mesure de comprendre comment l’incertitude et l’évolution de l’information influencent la prise de décision. Ils apprendront à concevoir des politiques décisionnelles capables d’apprendre et de s’adapter à leur environnement en utilisant des observations issues de données réelles ou de simulations. Ils sauront modéliser des décisions séquentielles sous incertitude à l’aide du cadre des processus de décision markoviens (MDP) et de la programmation stochastique, et utiliser des méthodes d’apprentissage pour approximer les fonctions de valeur ou de politique décisionnelle et en améliorer la performance. Ils développeront les compétences nécessaires pour implémenter les algorithmes de solution les plus utilisés et pour évaluer empiriquement la performance des politiques décisionnelles obtenues à l’aide d’expériences numériques.
Les principaux thèmes abordés incluent la modélisation des décisions séquentielles et des processus de décision markoviens (MDP), ainsi que différentes approches de conception de politiques décisionnelles : la recherche de politiques (Policy Function et Cost Function Approximations) et les politiques d’anticipation (Value Function et Direct Lookahead Approximations) et leur lien avec la programmation stochastique. Les méthodes d’optimisation stochastique et d’apprentissage en ligne sont traitées sous l’angle des techniques de mise à jour par gradient (SPSA, mini-lots, par exemple) ainsi que des approches sans gradient fondées sur l’exploration adaptative (indice de Gittins, Knowledge Gradient). L’étude de la programmation dynamique approchée et de l’apprentissage par renforcement s’articule autour de l’itération approchée de la valeur et de la politique décisionnelle, de l’apprentissage temporel (TD), du Q-learning, du SARSA, des méthodes Policy Gradient et Actor–Critic, des algorithmes de rollout et de la recherche arborescente Monte Carlo. L’analyse de la programmation stochastique à deux étapes, considérée comme une politique décisionnelle d’anticipation directe, inclut les principales techniques de résolution : décomposition en L (Benders), couverture progressive (Progressive Hedging) et approximation de la moyenne par échantillonnage (SAA). Les applications couvrent la logistique, la gestion des ressources, l’énergie et la planification financière.
Stratégie pédagogique
- Formule classique : 13 séances hebdomadaires de 3 heures chacune
- Trois rapports à livrer pendant le déroulement du cours permettront de vérifier l’avancement des connaissances des étudiants. L’expertise développée au cours de la session sera vérifiée au moyen d’un examen final
- Plusieurs séances seront organisées sous forme d’ateliers afin d'accompagner les étudiants dans la rédaction de leurs rapports écrits
- Le site web du cours est mis à jour chaque semaine avec du nouveau matériel et des références. Le matériel consiste en plusieurs chapitres de livres et d'articles scientifiques. La plupart des ressources seront en anglais : il est attendu que les étudiants aient de très bonnes compétences en anglais