Grok extrae datos de usuarios mediante instrucciones maliciosas cifradas

Investigadores de Adversa demostraron que Grok puede eludir sus controles de seguridad al descifrar instrucciones ocultas en una página web y enviar datos personales del usuario a un servidor controlado por un atacante.

Noticias
Grok extrae datos de usuarios mediante instrucciones maliciosas cifradas

El 20 de agosto de 2026, investigadores de la firma de seguridad Adversa revelaron un ataque contra Grok que utiliza instrucciones maliciosas cifradas para eludir los controles de seguridad del modelo. La técnica puede hacer que el asistente extraiga el nombre, la ubicación y el historial de chats de un usuario, y los envíe a un servidor controlado por un atacante.

El ataque se basa en una técnica que Adversa denomina Cryptographic Context Injection. En lugar de incluir una instrucción dañina en texto plano, el atacante publica en una página web un contenido cifrado, junto con indicaciones para descifrarlo y la clave necesaria. Cuando el usuario pide a Grok que resuma la página, el modelo procesa el contenido cifrado y sigue las instrucciones que aparecen después del descifrado.

En la demostración, Grok recibe la orden de construir lo que aparenta ser una clave de descifrado. Sin embargo, el valor generado contiene datos del usuario, entre ellos su nombre, ubicación e historial de conversaciones. Esa información se incorpora como parámetro a una URL que apunta al sitio del atacante. Cuando Grok abre el enlace, los datos quedan registrados en los servidores bajo control del atacante.

Según el informe, el ataque no muestra una advertencia ni solicita confirmación antes de ejecutar la acción. Al cierre de la publicación, el comportamiento continuaba produciéndose pese a que Adversa había informado de ello a xAI en junio.

Rony Utevsky, investigador de Adversa, señaló que el problema está relacionado con la forma en que funcionan los mecanismos de protección estáticos. Estos controles clasifican el contenido como texto, pero no ejecutan código ni descifran información durante la inspección. Por ello, pueden identificar una solicitud para procesar datos con PBKDF2 y AES-256-GCM como una operación ordinaria, sin determinar qué instrucciones contiene el resultado.

La hipótesis principal de Adversa es que los filtros de Grok revisan el texto que entra y sale del modelo, pero no el resultado de la ejecución de código realizada por sus propias herramientas. Una vez descifrado, el contenido llega al modelo como una salida de herramienta y puede ser tratado como una instrucción interna, fuera del alcance de los controles que analizaron el contenido original.

Adversa aplicó una técnica similar en un ataque de jailbreak contra Gemini, el modelo de Google. En ese caso, el contenido cifrado se transformaba en un supuesto traceback con una regla que indicaba al modelo que debía leer y seguir los mensajes de error si el código fallaba. El resultado permitió introducir instrucciones que hicieron que Gemini incumpliera sus reglas de seguridad. La firma afirmó que el método produjo un ejemplo de contenido restringido relacionado con la fabricación de un arma incendiaria y también permitió reproducir instrucciones internas del sistema.

La empresa de seguridad no comunicó ese caso a Google porque los jailbreaks no están incluidos en el programa de divulgación de vulnerabilidades de la compañía. En las últimas semanas, Gemini se habría vuelto más resistente al ataque, aunque Adversa indicó que no puede atribuir el cambio a una causa concreta: podría deberse a actualizaciones de los filtros, a cambios en la versión del modelo o a ambos factores.

El caso de Grok se suma a otro ataque divulgado esa misma semana contra Microsoft 365 Copilot para empresas, en el que una entrada secreta provocaba que el asistente extrajera una contraseña presente en la bandeja de entrada del usuario. Para Adversa, ambos incidentes reflejan una limitación más amplia de los modelos de lenguaje: las inyecciones de instrucciones pueden trasladarse desde el texto de entrada hacia las salidas de herramientas, los resultados de ejecución y otros estados intermedios que el modelo considera parte de su propio contexto.

La información procede de Ars Technica: Grok exfiltrates user data when malicious instructions are encrypted.

Fuente: Ars Technica

Compartir

WhatsApp X Telegram Email