Definición
Algoritmo de programación dinámica que aplica repetidamente el operador de optimalidad de Bellman a estimaciones del valor por estado, realizando backups sobre los estados hasta que la función de valor converge al óptimo bajo propiedades de contracción.
Principio
Principio
Aprovechar la propiedad de contracción del operador de optimalidad de Bellman en MDPs con descuento: la aplicación iterativa del backup V_{k+1}=T[V_k] converge al punto fijo único V* y proporciona una política óptima mediante extracción glotona.
Demostración
Demostración
Para un MDP finito con factor de descuento gamma∈(0,1), inicializar V0 arbitrariamente e iterar V_{k+1}(s)=max_a{ R(s,a)+gamma sum_{s'} P(s'|s,a) V_k(s') } hasta que sup_s |V_{k+1}(s)-V_k(s)| < tolerancia, luego derivar una política glotona.
Aplicación incorrecta
Aplicación incorrecta
Aplicar iteración de valor ingenua con aproximación de funciones inapropiada o en problemas no descontados sin garantizar contracción; ejecutarla en espacios de estado demasiado grandes sin aproximación conduce a tiempos y memoria impracticables.
Consecuencia
Consecuencia
Bajo supuestos estándar iteración de valor converge a la función de valor óptima y proporciona una política óptima mediante selección glotona; es una referencia canónica para planificación y algoritmos de aprendizaje por refuerzo.
Inversión
Inversión
La iteración de política alterna evaluación explícita de la política con mejora de la política y puede converger en menos iteraciones que iteración de valor, a costa de evaluaciones más costosas por iteración.
Límite
Límite
Garantizado para MDPs con descuento o situaciones donde el operador de Bellman sea un contractor; precaución en espacios de estado continuos, observabilidad parcial o regímenes de aproximación de funciones donde las garantías teóricas se debilitan.
Tensión semántica
Tensión semántica
Tensión con iteración de política y Q-learning: iteración de valor realiza backups completos sobre valores y converge bajo contracción, mientras que iteración de política se centra en evaluación/mejora y Q-learning apunta a valores de acción desde transiciones muestreadas.
Síntesis
Síntesis
Iteración De Valor = cálculo iterativo del punto fijo aplicando backups de Bellman hasta converger a V*, luego extraer una política óptima glotonamente; práctico cuando hay modelos de estado exactos y se cumplen condiciones de contracción.