Definición
Algoritmo de programación dinámica que aplica repetidamente el operador de optimalidad de Bellman a estimaciones del valor por estado, realizando backups sobre los estados hasta que la función de valor converge al óptimo bajo propiedades de contracción.

Principio

Principio
Aprovechar la propiedad de contracción del operador de optimalidad de Bellman en MDPs con descuento: la aplicación iterativa del backup V_{k+1}=T[V_k] converge al punto fijo único V* y proporciona una política óptima mediante extracción glotona.

Demostración

Demostración
Para un MDP finito con factor de descuento gamma∈(0,1), inicializar V0 arbitrariamente e iterar V_{k+1}(s)=max_a{ R(s,a)+gamma sum_{s'} P(s'|s,a) V_k(s') } hasta que sup_s |V_{k+1}(s)-V_k(s)| < tolerancia, luego derivar una política glotona.

Aplicación incorrecta

Aplicación incorrecta
Aplicar iteración de valor ingenua con aproximación de funciones inapropiada o en problemas no descontados sin garantizar contracción; ejecutarla en espacios de estado demasiado grandes sin aproximación conduce a tiempos y memoria impracticables.

Consecuencia

Consecuencia
Bajo supuestos estándar iteración de valor converge a la función de valor óptima y proporciona una política óptima mediante selección glotona; es una referencia canónica para planificación y algoritmos de aprendizaje por refuerzo.

Inversión

Inversión
La iteración de política alterna evaluación explícita de la política con mejora de la política y puede converger en menos iteraciones que iteración de valor, a costa de evaluaciones más costosas por iteración.

Límite

Límite
Garantizado para MDPs con descuento o situaciones donde el operador de Bellman sea un contractor; precaución en espacios de estado continuos, observabilidad parcial o regímenes de aproximación de funciones donde las garantías teóricas se debilitan.

Tensión semántica

Tensión semántica
Tensión con iteración de política y Q-learning: iteración de valor realiza backups completos sobre valores y converge bajo contracción, mientras que iteración de política se centra en evaluación/mejora y Q-learning apunta a valores de acción desde transiciones muestreadas.

Síntesis

Síntesis
Iteración De Valor = cálculo iterativo del punto fijo aplicando backups de Bellman hasta converger a V*, luego extraer una política óptima glotonamente; práctico cuando hay modelos de estado exactos y se cumplen condiciones de contracción.