La ecuación de Bellman es una relación recursiva utilizada en programación dinámica y aprendizaje por refuerzo para expresar el valor de un estado o acción en términos de recompensa inmediata y valor futuro esperado. Proporciona la base para métodos como la iteración de valores y Q-learning. Al descomponer la optimización a largo plazo en subproblemas más pequeños, apoya la toma de decisiones sobre secuencias de acciones.
In reinforcement learning, the following identity satisfied by the optimal Q-function: \\\\\\[Q(s, a) = r(s, a) + \\\\\\\E\_\s'\\|s,a\ \\\_\a'\ Q(s', a')\\\\\\] Reinforcement learning algorithms apply this identity to create Q-learning using the following update rule: \\\\\\[Q(s,a) \\\Q(s,a) + \\\ \\\\\[r(s,a) + \\\\\\\\\_\\\\\a_1\\ Q(s',a') - Q(s,a) \\\\\] \\\\\\] Beyond reinforcement learning, the Bellman equation has applications to dynamic programming. See the Wikipedia entry for Bellman equation.