The Airbnb Tech Blog | Medium на русском
Подписаться
Разработка на основе оценки: уроки оценки GenAI в масштабе
Airbnb подчеркивает важность оценки как критически важной инженерной дисциплины для создания надежных генеративных ИИ-продуктов. Традиционные предположения о тестировании программного обеспечения ставятся под сомнение из-за недетерминированной и субъективной природы вывода больших языковых моделей (LLM), что часто требует использования ИИ для оценки ИИ. Команды разработчиков продуктов в Airbnb создают функции на базе LLM, опираясь на команду инфраструктуры, предоставляющую инструменты и лучшие практики. Фундаментальный принцип заключается в понимании того, что оценка должна планироваться с самого начала, чтобы избежать ложной уверенности и необнаруженных регрессий. "Одно правило" заключается в ручном просмотре данных и формировании интуиции успеха путем изучения выходных данных прототипов. Эта привычка перерастает в разработку, управляемую оценкой (eval-driven development), где выявляются, кодируются и постоянно тестируются сценарии сбоев. Ключевые принципы разработки, управляемой оценкой, включают определение целей, использование реальных ошибок для формирования метрик, применение небольших, четких наборов оценщиков, назначение лица, принимающего решения, и постоянное сотрудничество. Три метода оценки формируют слои: программные проверки на очевидные сбои, LLM-как-судья для оценки нюансов качества и человеческая оценка для крайних случаев и валидации. Программные проверки используют детерминированные тесты на основе кода, в то время как LLM-как-судья использует более мощные LLM по заданным критериям, требуя калибровки для обеспечения надежности. Человеческая оценка служит золотым стандартом для определения истинности и принятия решений в ответственных ситуациях. Для агентных систем оценка распространяется на несколько уровней, анализируя пути рассуждений и вызовы инструментов, а не только конечный результат. Практический пример демонстрирует исследование первоначальных сбоев, создание многоуровневых оценок с помощью программных проверок и откалиброванных виртуальных судей, а также масштабирование с помощью мониторинга в производственной среде. Ключевые выводы подчеркивают важность анализа данных, избегания общих метрик, начала с малого, калибровки судей, использования многоуровневой защиты и отражения оценок в производственной среде. В конечном итоге, успешная разработка ИИ-продуктов зависит от того, что оценка является командным видом спорта, который формирует определение успеха продукта.