Curso de actualización que introduce el Aprendizaje por Refuerzo (Reinforcement Learning, RL), el paradigma en el que un agente computacional aprende a tomar decisiones óptimas a partir de la interacción con su entorno y de un sistema de recompensas. Combina fundamentos teóricos con implementación práctica en Python.
Se estudian los Procesos de Decisión de Markov (MDP), las políticas estocásticas y determinísticas, las funciones de valor y la ecuación de Bellman; los métodos de predicción por Monte Carlo y por diferencias temporales; el problema de exploración versus explotación; y los algoritmos de control SARSA y Q-Learning, comparados en GridWorld y CartPole. La última unidad presenta el RL profundo con Deep Q-Networks, los métodos de gradiente de política REINFORCE y PPO y las arquitecturas actor-crítico.
El curso repasa aplicaciones en robótica, finanzas, logística, videojuegos y sistemas de recomendación —de AlphaGo a los recomendadores—, junto con los desafíos actuales de seguridad, interpretabilidad y transferencia de conocimiento. Se trabaja con Gymnasium y Stable Baselines3.
Graduados o profesionales del campo de la ciencia de datos, la estadística, la economía, la ingeniería, la computación o áreas afines.