自己ラベルと学習アルゴリズム ― 多数決で擬似正解を作り GRPO/ADPO で重みを更新する【プロンプトで読み解くAIエージェント #11
連載「プロンプトで読み解くAIエージェント」第11回(第9章)。 実在する3つのAIエージェントOSSを、実コード・実プロンプトを原典から引用しながら読み解き、 最終的に「自分でAIエージェントを作れる」状態を目指す連載です。 本記事は 第2部の最終章。第7章で動機を、第8章で共進化と報酬設計を見ました。本章で学習ループそのものを開けます。 この章の前提(第7章・第8章のおさらい) 第2部に入ってからの3章を、本章の入口で1段ずつ重ねておきます。 第7章: Agent0(aiming-lab/Agent0 @ 30e1882)は「動くアプリケーション」ではなく、強化学習で モ...
出典: Zenn AI(配信元の紹介文より引用)
このニュースの全文は、配信元でお読みいただけます。 Zenn AIで元記事を読む →


