От недель до дня: как мы сдела... Заметка

От недель до дня: как мы сделали оценку LLM достаточно быстрой для итераций

Развертывание системы производственной языковой модели требует быстрой итерации улучшений, что затруднительно из-за недетерминированной природы моделей и процессов оценки. Airbnb справилась с этими проблемами, построив надежную инфраструктуру LLM на четырех уровнях, сосредоточившись на инженерных улучшениях и интеграции. Основной принцип заключается в том, что проблемы возникают на стыках между компонентами, и всестороннее сквозное тестирование имеет решающее значение.Уровень 1 фокусируется на диагностическом определении шума в оценке, различая неопределенность данных и суждений, чтобы понять вариации производительности. Шум в оценках LLM может возникать из-за того, что оценщики по-разному оценивают входные данные или изменяются эталонные данные, сгенерированные LLM, что затрудняет выявление реальных улучшений модели. Разделение эпистемической неопределенности (ограничения модели/оценщика) и алеаторической неопределенности (неоднозначность задачи) является ключом к точной диагностике.Уровень 2 создает детерминированную основу оценки путем стабилизации входных данных для оценщиков. Это достигается с помощью кэша для каждого образца для эталонных данных и оценок оценщиков, гарантируя, что идентичные входные данные дают кэшированные результаты, делая оценку воспроизводимой и эффективной. Это детерминированное измерение необходимо для диагностических возможностей Уровня 1.Уровень 3 обеспечивает ограниченное, сфокусированное изменение модели с помощью микроадаптеров. Это небольшие патчи LoRA, обученные на конкретных ошибках, позволяющие быстро, в течение часа, обучать и развертывать исправления в стиле "горячего исправления". Три правила жизненного цикла — слияние совместно срабатывающих патчей, переобучение при накоплении и выгрузка неиспользуемых патчей — предотвращают деградацию стека адаптеров.Уровень 4 обеспечивает сквозную проверку на стыках системы. Несмотря на то, что отдельные компоненты кажутся исправными, их взаимодействие может привести к неожиданному поведению. Этот уровень включает в себя прогон репрезентативных входных данных через весь производственный путь для измерения общего качества и задержки, гарантируя, что ошибки на стыках будут выявлены до развертывания. Эти четыре уровня образуют стек зависимостей, где эффективность каждого уровня зависит от других.
CdXz5zHNQW_y2WUihSDGZ.png