AWS Machine Learning Blog 한국어 팔로우 Amazon Nova Forge를 이용한 다중 턴 강화 학습을 위한 사용자 정의 보상 함수 멀티턴 강화 학습에서 사용자의 맞춤형 보상 함수는 모델이 실제로 무엇을 학습할지 결정합니다. 이 게시물은 Amazon Nova Forge를 위한 복합 멀티턴 보상을 설계하는 방법, 그 안에서 모델이 생성한 코드를 안전하게 실행하는 방법, 그리고 보상을 조용히 무너뜨리는 함정을 포착하기 위해 각 구성 요소를 계측하는 방법을 보여줍니다. Custom reward functions for multi-turn reinforcement learning with Amazon Nova Forge aws.amazon.com AWS Machine Learning Blog 한국어 RSS thenote.app