世界モデルが長い未来を予測し、良い行動を選ぶまで
この記事でつなぐもの 世界モデルが次の状態を予測できても、それだけではAgentは行動できません。 長い未来を想像する -> その未来の良さを評価する -> action候補を比べる -> 方策そのものを学ぶ この記事は、05 Long Horizon、06 Reward / Value、07 Planning、08 Imagination RLを一つの流れとして扱います。 1. 1stepで当たっても、遠い未来では崩れる 学習中は正解stateを入力にできます。しかしrolloutでは、自分の予測を次の入力へ戻します。 正解state -> 予測1st...
出典: Zenn AI(配信元の紹介文より引用)
このニュースの全文は、配信元でお読みいただけます。 Zenn AIで元記事を読む →
