Ataques de Inyección Indirecta... Nota

Ataques de Inyección Indirecta de Indicaciones contra Asistentes de Modelos Lingüísticos Grandes

El artículo de investigación "¡La invitación es todo lo que necesitas!" explora ataques de promptware prácticos y peligrosos contra asistentes impulsados por LLM (modelos de lenguaje grande). Promptware se refiere a prompts maliciosos diseñados para comprometer la seguridad de aplicaciones que utilizan LLMs. El estudio investiga los riesgos que el promptware plantea a los usuarios de asistentes impulsados por Gemini, incluyendo la web, dispositivos móviles y Google Assistant. Se desarrolló un nuevo marco de Análisis de Amenazas y Evaluación de Riesgos (TARA) para evaluar estos riesgos para los usuarios finales. La investigación introduce los Ataques de Promptware Dirigidos, una nueva variante que utiliza la inyección indirecta de prompts a través de interacciones comunes del usuario como correos electrónicos e invitaciones de calendario. Se demostraron catorce escenarios de ataque en cinco clases de amenazas: envenenamiento de contexto a corto plazo, envenenamiento de memoria permanente, uso indebido de herramientas, invocación automática de agentes e invocación automática de aplicaciones. Estos ataques pueden conducir a diversas consecuencias digitales y físicas, como spam, phishing, desinformación, exfiltración de datos y control de dispositivos de automatización del hogar. El artículo revela la capacidad del promptware para el movimiento lateral en el dispositivo, permitiendo acciones maliciosas más allá de la aplicación LLM. El marco TARA indicó que el 73% de las amenazas analizadas representaban un riesgo Alto-Crítico para los usuarios finales. Los investigadores discutieron mitigaciones, demostrando que estas podrían reducir los riesgos a Muy Bajo-Medio. Google ha implementado mitigaciones dedicadas basadas en los hallazgos divulgados por los investigadores.