Сдерживание инъекций промптов ... Заметка

Сдерживание инъекций промптов как структурное свойство, а не как детектор (интерактивное, реальный код, без LLM)

Этот проект устраняет уязвимость безопасности, при которой ИИ-агенты принимают команды от других агентов без должной проверки. В недавней статье было показано, как три агента, неспособные различить, кто с ними общается, создали самовоспроизводящийся вредоносный код. Для борьбы с этим был разработан легкий слой безопасности на JavaScript, весом всего 33 КБ, работающий полностью в веб-браузере. Этот слой работает офлайн, без серверов или API-ключей, обеспечивая стабильные результаты на разных машинах. Пользователи могут взаимодействовать с предварительно одобренным агентом и пытаться отправлять ему вредоносные команды различными способами.Наиболее интересный вектор атаки — это не тот, который блокируется, а скорее опция «отправить как обычно». В этом сценарии команды принимаются агентом, но не могут быть выполнены, поскольку команды от других агентов встроены в поля данных в кавычках, что делает их неинтерпретируемыми как инструкции. Атака, которую невозможно выполнить, фактически нейтрализуется без необходимости обнаружения. Проект подчеркивает, что в нем не используется большая языковая модель, поскольку эти решения не требуют ее.Оба общающихся агента находятся на одной странице, что означает, что сеть не является основным объектом наблюдения. Эта демонстрация специально тестирует слой изоляции в изоляции, а не передовой ИИ-модель в реальных условиях. Создатель заинтересован в обратной связи от любого, кто успешно обойдет защиту, ценя обнаруженную уязвимость выше поверхностной изобретательности.