Schneier on Security на русском
Подписаться
Атаки на большие языковые модели во время проверки и во время использования
Агенты на базе больших языковых моделей (LLM) набирают популярность, но создают новые уязвимости в безопасности, в частности, ошибки TOCTOU (Time-of-check to time-of-use). Уязвимости TOCTOU связаны с проверкой состояния с последующим изменением перед использованием, что приводит к эксплуатируемым проблемам. Данное исследование представляет собой первое исследование, специально посвященное уязвимостям TOCTOU в агентах LLM. Авторы представляют TOCTOU-Bench, эталонный набор из 66 реалистичных пользовательских задач, разработанный для обнаружения уязвимостей TOCTOU. Они адаптировали методы обнаружения и смягчения последствий из области системной безопасности для применения в данном контексте. Эти контрмеры включают переписывание подсказок, мониторинг целостности состояния и стратегии слияния инструментов. Автоматизированные методы обнаружения достигают точности обнаружения до 25% в рабочих процессах агентов. Стратегии смягчения последствий значительно снижают генерацию уязвимых планов и окно атаки. Комбинация всех трех методов уменьшила частоту возникновения уязвимостей TOCTOU в выполненных траекториях. Исследование подчеркивает уникальные проблемы обеспечения безопасности рабочих процессов агентов от атак TOCTOU. Данная работа направлена на открытие новых направлений для исследований в области безопасности ИИ и системной безопасности.