Linear Function Approximation policy evaluation
Monte Carlo: converges to minimal MSE
|| Q’MC - Qp||p= minw || Q’w - Qp||p ÷ e
TD(0) converges close to MSE
|| Q’TD - Qp||p= e /(1-g) [TV]
DP may diverge
There exists counter examples [B,TV]
השקופית הקודמת
השקופית הבאה
חזור אל השקופית הראשונה
הצג גירסה גרפית