Analytics Vidhya на русском
Подписаться
DeepSeek R1 и GRPO: Продвинутое обучение с подкреплением для больших языковых моделей
Я внимательно слежу за тем, как быстро развивается мир больших языковых моделей (LLM), и одна область, которая меня действительно вдохновляет, — это развитие изощренных методов оптимизации политики. Недавно мне особенно запомнился DeepSeek-R1, который использует GRPO для достижения выдающихся результатов в обучении с подкреплением. Это как взгляд в будущее: по мере того, как системы ИИ становятся все более способными [...]