DZone.com Feed на русском
Подписаться
План безопасности памяти ИИ
Передовые большие языковые модели могут быть значительно подвержены манипуляциям через RAG-системы. Внедрение всего пяти вредоносных документов в большой корпус позволило исследователям почти всегда контролировать вывод LLM. Эта атака, известная как PoisonedRAG, обходит прямой доступ к коду модели или ретривера. Злоумышленники просто вводят отравленный документ, который индексируется. Последующее исследование, CorruptRAG, продемонстрировало, что один отравленный документ может достичь высокого уровня успеха. Это делает угрозу более реалистичной, поскольку заражение нескольких документов более правдоподобно, чем многих. Даже небольшой процент, например, 0,04% отравленного корпуса, может привести к более чем 98% успешности атаки. Эти атаки отравления могут привести к сбоям в работе системы в значительной части случаев. Результаты подчеркивают, что простое добавление RAG для повышения точности не является безрисковым предприятием. Надежные меры безопасности имеют решающее значение для корпоративных RAG-систем.