VentureBeat на русском
Подписаться
Предприятия, использующие несколько моделей ИИ, недооценивают частоту сбоев в 2,25 раза.
Новое исследование показывает, что объединение нескольких моделей ИИ для компенсации их недостатков математически ошибочно. Это явление получило название "потолок совместных отказов". Эта ошибка означает, что производительность ограничивается не тем, как часто модели не соглашаются, а процентом запросов, по которым все модели терпят неудачу одновременно. Предприятия строят дорогостоящую инфраструктуру маршрутизации, гоняясь за несуществующими улучшениями производительности, игнорируя этот потолок. Архитектуры оркестрации, такие как маршрутизаторы, каскады и "Смесь агентов" (MoA), влекут за собой скрытые расходы, включая задержку и обслуживание. Опора на низкую "парную корреляцию ошибок" при выборе моделей может снизить производительность, если модели не одинаково способны, поскольку более слабые модели могут перевесить более сильные. Эксперты советуют объединять только модели сопоставимого качества или придерживаться одной лучшей модели, если качество не может быть сопоставлено. Хотя архитектуры MoA показывают многообещающие результаты при объединении разнообразных моделей сопоставимого качества, парная корреляция не может предсказать абсолютную точность системы. Основная проблема заключается в частоте совместных отказов, представляющей собой скрытые, сложные крайние случаи, когда все модели терпят неудачу вместе, независимо от интеллекта маршрутизации. Стандартные метрики корреляции значительно недооценивают эту частоту совместных отказов, обусловленную "общими атомами" или общими точками отказа между моделями. Формат задачи также влияет на совместные отказы, причем задачи генерации с открытым финалом расширяют хвост "все неправильно". Разработчики могут преодолеть это, преобразовав генерацию в проверку или ограниченный выбор. Бесплатная предразвертываемая проверка здравого смысла с использованием границы Клоппера-Пирсона может предсказать абсолютный потолок производительности, используя небольшой набор данных для коррекции оптимистичных предположений о точности. Эта проверка помогает предприятиям определить, будет ли многомодельная оркестрация действительно выгодной без дополнительных затрат на запросы. Для задач с окончательной проверкой использование одной лучшей модели часто превосходит объединение нескольких моделей, если только не существуют чрезвычайно сильные сигналы маршрутизации на уровне запросов.