AWS Machine Learning Blog 中文 关注 用于多轮强化学习的自定义奖励函数与 Amazon Nova Forge 在多轮强化学习中,自定义奖励函数决定了模型实际学习的内容。本文展示如何为 Amazon Nova Forge 设计复合多轮奖励,在其中安全执行模型生成的代码,并对每个组件进行仪器化,以捕捉那些悄然导致奖励失效的陷阱。 Custom reward functions for multi-turn reinforcement learning with Amazon Nova Forge aws.amazon.com AWS Machine Learning Blog 中文 RSS thenote.app