VentureBeat на русском
Подписаться
Снижение затрат на инференс RAG в 6 раз начинается с решения, что никогда не достигнет LLM.
Большинство систем генерации с дополненной выборкой (RAG) для критически важных классификаций ошибочно направляют каждый неоднозначный случай напрямую к большой языковой модели (LLM), что приводит к провалу при аудите и проверке. Автор выступает за другую философию проектирования, подчеркивая аудируемость, стоимость и согласованность для регулируемых корпоративных сред, где неправильные ответы имеют значительные последствия. Полностью основанный на LLM конвейер влечет за собой невидимые затраты: трудности в аудите решений, высокие затраты на вывод и задержки в масштабе, а также непоследовательную производительность в случаях, которые должны быть детерминированными.Каскадная архитектура решает эти проблемы, рассматривая LLM как путь эскалации, а не как первую линию. Первый этап является детерминированным, разрешая четкие случаи с помощью правил и точных совпадений, обрабатывая большую часть объема без вызовов LLM, обеспечивая полную объяснимость. Второй этап использует слой выборки для случаев, не разрешенных первым этапом, извлекая конкретные доказательства, такие как предыдущие решения или контекстные документы, причем качество выборки имеет первостепенное значение. Третий этап — это вызов LLM, зарезервированный только для действительно неоднозначных случаев, которые не удалось разрешить на первом и втором этапах. Такой подход значительно снижает затраты на вывод и повышает согласованность в детерминированных случаях.Для этапа LLM критически важен асимметричный промпт с учетом рисков, признающий, что стоимость различных типов ошибок неодинакова. Это означает инструктирование модели эскалировать неопределенность, предоставление откалиброванных примеров с последствиями и запрос оценки уверенности наряду с классификацией. Оценка уверенности действует как вторая точка каскада, направляя случаи с низкой уверенностью к проверке человеком.Оценка такой системы требует специальных корректировок: качество выборки должно измеряться независимо от окончательной точности классификации, а набор для оценки должен чрезмерно выбирать случаи третьего этапа. Оценка LLM как судьи эффективна, если промпт судьи включает ту же асимметричную рамку рисков. Наконец, обратная связь от подтвержденных результатов обратно в корпус выборки необходима для постоянного улучшения обработки неоднозначных случаев. Более широкий урок заключается в том, что в критически важных областях ценная инженерная работа заключается в определении того, какие части решения никогда не должны включать модель.