Definition
Ein Algorithmus der dynamischen Programmierung, der wiederholt den Bellman-Optimalitätsoperator auf Zustandswertschätzungen anwendet und Backups über Zustände ausführt, bis die Wertfunktion unter Kontraktionseigenschaften konvergiert.
Prinzip
Prinzip
Die Kontraktionseigenschaft des Bellman-Optimalitätsoperators für diskontierte MDPs ausnutzen: iterative Anwendung des Backups V_{k+1}=T[V_k] konvergiert zur eindeutigen Fixpunktlösung V* und liefert durch gierige Extraktion eine optimale Politik.
Demonstration
Demonstration
Für ein finales MDP mit Diskontfaktor gamma∈(0,1) initialisiere V0 beliebig und iteriere V_{k+1}(s)=max_a{ R(s,a)+gamma sum_{s'} P(s'|s,a) V_k(s') } bis sup_s |V_{k+1}(s)-V_k(s)| < Toleranz, dann erstelle eine gierige Politik.
Fehlanwendung
Fehlanwendung
Naives Value Iteration mit ungeeigneter Funktionsapproximation oder auf undiskontierten Problemen ohne Kontraktionsgarantie anwenden; in zu großen Zustandsräumen ohne Approximation führt dies zu unpraktikabler Laufzeit und Speicherbedarf.
Konsequenz
Konsequenz
Unter Standardannahmen konvergiert Value Iteration zur optimalen Wertfunktion und liefert eine optimale Politik durch gierige Auswahl; es ist eine kanonische Basis für Planung und Reinforcement-Learning-Algorithmen.
Umkehrung
Umkehrung
Policy Iteration wechselt zwischen expliziter Politikevaluation und Politikverbesserung und kann in weniger Iterationen konvergieren, erfordert jedoch pro Iteration teurere Auswertungsschritte.
Abgrenzung
Abgrenzung
Garantiert für diskontierte MDPs oder Situationen, in denen der Bellman-Operator ein Kontraktor ist; Vorsicht bei kontinuierlichen Zustandsräumen, partieller Beobachtbarkeit oder Funktionsapproximation, wo theoretische Garantien schwächer werden.
Semantische Spannung
Semantische Spannung
Spannung zu Policy Iteration und Q-Learning: Value Iteration führt vollständige Backups über Werte aus und konvergiert unter Kontraktion, während Policy Iteration auf Evaluation/Verbesserung setzt und Q-Learning Aktionswerte aus Stichproben schätzt.
Synthese
Synthese
Wertiteration = iterative Fixpunktberechnung mittels Bellman-Backups bis Konvergenz zu V*, dann gierige Politikextraktion; praxistauglich, wenn exakte Zustandsmodelle vorliegen und Kontraktionsbedingungen erfüllt sind.