Amazon Nova Forge を用いたマルチターン強化... ノート

Amazon Nova Forge を用いたマルチターン強化学習のためのカスタム報酬関数

マルチターンの強化学習では、カスタム報酬関数がモデルが実際に何を学習するかを決定します。この記事では、Amazon Nova Forge 用の複合マルチターンの報酬を設計する方法、モデル生成コードを安全に実行する方法、そして報酬を静かに崩壊させる落とし穴を捉えるために各コンポーネントを計測する方法を示します。
CdXz5zHNQW_zxyswOYjqS.png