AWS Machine Learning Blog 日本語 フォロー Amazon Nova Forge を用いたマルチターン強化学習のためのカスタム報酬関数 マルチターンの強化学習では、カスタム報酬関数がモデルが実際に何を学習するかを決定します。この記事では、Amazon Nova Forge 用の複合マルチターンの報酬を設計する方法、モデル生成コードを安全に実行する方法、そして報酬を静かに崩壊させる落とし穴を捉えるために各コンポーネントを計測する方法を示します。 Custom reward functions for multi-turn reinforcement learning with Amazon Nova Forge aws.amazon.com AWS Machine Learning Blog 日本語 RSS thenote.app