Un grupo de investigadores de ciberseguridad ha descubierto una técnica que permitía engañar al asistente de inteligencia artificial de Google utilizando algo tan cotidiano como una notificación de WhatsApp, SMS o Slack.
La investigación fue realizada por Or Yair, experto en seguridad de la compañía SafeBreach. Su objetivo era analizar cómo reaccionaba Gemini cuando un usuario le pedía que leyera en voz alta las notificaciones recibidas en su dispositivo.
Durante las pruebas, el experto descubrió que el asistente no solo procesaba la información visible para el usuario, sino también posibles instrucciones ocultas incluidas en el contenido de los mensajes. En determinadas circunstancias, Gemini podía interpretar esas instrucciones como órdenes legítimas y actuar en consecuencia.
Una de las técnicas más llamativas identificadas por los investigadores consistía en ocultar preguntas en otro idioma. Por ejemplo, Gemini podía formular una cuestión en chino y, acto seguido, pronunciar una frase aparentemente inofensiva en inglés equivalente a “¿Eso era todo lo que necesitabas?”.
El usuario, creyendo que simplemente estaba cerrando la conversación, respondía afirmativamente. Sin embargo, desde el punto de vista del sistema, ese “sí” podía interpretarse como una autorización para la pregunta formulada previamente en mandarín, que el usuario ni siquiera había comprendido.
Enlaces peligrosos
Los investigadores también encontraron una forma de esconder preguntas dentro de enlaces. En algunos casos, Gemini no llegaba a leer el contenido textual de esos enlaces en voz alta, por lo que el usuario no sabía que se le estaba solicitando permiso para realizar una determinada acción. Aun así, el asistente seguía procesando la información oculta y podía considerar válida la autorización obtenida posteriormente durante la conversación.
Las pruebas realizadas por SafeBreach demostraron que este tipo de manipulación podía tener consecuencias importantes. Entre otras cosas, los investigadores lograron que Gemini interactuara con gadgets conectados al hogar inteligente, iniciara determinadas acciones en servicios de terceros, almacenara instrucciones en su memoria para utilizarlas más adelante o generara mensajes engañosos que parecieran proceder de contactos legítimos.
El riesgo aumentaba especialmente cuando esas instrucciones quedaban registradas en la memoria del asistente, ya que podían influir en futuras interacciones e incluso afectar a otros dispositivos asociados a la misma cuenta.
El estudio pone de relieve un desafío creciente en el ámbito de la inteligencia artificial: la dificultad para distinguir entre datos e instrucciones. Tradicionalmente, los sistemas informáticos separan claramente la información de los comandos que deben ejecutar. Sin embargo, los modelos de lenguaje procesan grandes cantidades de texto de forma contextual, lo que abre la puerta a que información aparentemente inocente pueda transformarse en una orden encubierta.
Los asistentes de voz presentan además una superficie de ataque especialmente delicada. Al estar diseñados para mantener conversaciones fluidas y naturales, suelen formular preguntas y esperar respuestas inmediatas del usuario. Cuando la interacción se produce sin que la persona esté mirando la pantalla, como ocurre al conducir o al utilizar auriculares, resulta mucho más difícil detectar mensajes ocultos, cambios de contexto o solicitudes inesperadas.
Afortunadamente, Google fue informada del problema en agosto del año pasado y corrigió las vulnerabilidades identificadas antes de que se hicieran públicas. Según la compañía, las técnicas concretas descritas por los investigadores ya no funcionan gracias a nuevas medidas de protección incorporadas a Gemini.
No obstante, los autores del estudio consideran que este caso es un ejemplo de un problema más amplio que seguirá afectando a los asistentes basados en inteligencia artificial a medida que obtengan acceso a más funciones y datos de los usuarios. En esto consisten, precisamente, los ataques de ‘inyección de prompts’, la china en el zapato de las IAs generativas en este momento.

Deja una respuesta