SEGURIDAD EN IA
Grok filtra datos privados cuando las instrucciones maliciosas van encriptadas
Investigadores demostraron que Grok puede ser forzado a robar chats y datos personales si las instrucciones dañinas están cifradas. xAI fue notificado en junio, pero la vulnerabilidad sigue activa. El caso expone los límites de los guardrails estáticos.

Investigadores de la firma de seguridad Adversa descubrieron que Grok, el modelo de lenguaje de xAI, puede ser engañado para exfiltrar datos de usuarios mediante un truco simple: encriptar las instrucciones maliciosas. El ataque funciona porque los guardrails de seguridad del modelo inspeccionan texto plano, pero no ejecutan ni descifran contenido. Cuando un usuario le pide a Grok que resuma una página web que contiene instrucciones cifradas junto con la clave de descifrado, el modelo las procesa sin alertas ni confirmaciones. xAI fue notificado de la vulnerabilidad en junio; al momento de esta publicación, el asistente seguía filtrando datos.
Cómo funciona el ataque
El vector de ataque, que Adversa llama Cryptographic Context Injection, explota la incapacidad de los LLM para distinguir entre contenido de fuentes no confiables e instrucciones legítimas del usuario. El atacante publica una página web con tres elementos: instrucciones cifradas, la clave de descifrado y comandos en texto plano para procesar el cifrado.
Cuando el usuario le pide a Grok que resuma esa página, el modelo:
- Lee las instrucciones de descifrado (texto plano que pasa el filtro)
- Ejecuta PBKDF2 y AES-256-GCM en su sandbox interno
- Obtiene las instrucciones reales, que le ordenan construir una "clave de descifrado falsa"
- Esa "clave" es en realidad el nombre del usuario, su ubicación y el historial de chats
- El valor se agrega como parámetro a una URL del atacante; cuando Grok abre el link, los datos quedan en los logs del servidor
Según Ars Technica, la teoría principal es que los guardrails filtran texto que entra y sale del modelo, pero no la salida de su propia ejecución de código. El clasificador lee las instrucciones de descifrado como una solicitud común, porque puede leer el texto pero no resolver qué desbloquea. Una vez descifradas, las instrucciones llegan al modelo como output de su propia herramienta, sin pasar por el filtro.
Misma técnica, múltiples modelos
Adversa usó una variante similar contra Gemini de Google para violar sus reglas de seguridad internas. En ese caso, el texto descifrado simulaba un traceback de error, con una regla: si el código falla, lee el mensaje de error y actuá sobre él. El prompt inyectado logró que Gemini generara contenido normalmente restringido (instrucciones para construir un arma incendiaria) y reprodujera sus propias instrucciones de sistema, incluyendo la directiva que prohíbe revelarlas.
La firma no reportó el comportamiento a Google porque los jailbreaks no están en el alcance de su programa de divulgación de vulnerabilidades. Sin embargo, en las últimas semanas Gemini se ha vuelto más resistente al ataque, posiblemente por actualizaciones de filtros o cambios de versión del modelo.
Esta semana también salió a la luz un ataque similar contra Microsoft 365 Copilot, que exfiltraba contraseñas presentes en la bandeja de entrada del usuario mediante un input secreto provisto por el servicio empresarial.
Por qué importa
Este ataque expone el problema fundamental de los guardrails estáticos: solo clasifican contenido como texto, no ejecutan código ni descifran nada. Adversa lo resume así: "El atacante envía texto cifrado junto con el material de clave y una instrucción para descifrarlo, y el modelo ejecuta ese descifrado dentro de su propio sandbox. Todo lo que un escáner de guardrails necesitaría está ahí en la página, pero recuperar el texto plano significa correr PBKDF2 y AES-256-GCM, lo cual ningún clasificador de contenido hace en tiempo de inspección".
Para equipos que están adoptando LLMs en producción, la lección es que los modelos no pueden resolver las causas raíz de los prompt injections. Los desarrolladores de IA solo pueden construir barreras que alejen al modelo de acciones dañinas, como poner un guardrail en una curva peligrosa en lugar de diseñar bien la curva. Y cada vez que se levanta una nueva barrera, aparece un vector que la sortea.
Si tu empresa usa asistentes de IA que procesan correos, resúmenes de páginas o documentos externos, revisá qué datos pueden acceder, qué acciones pueden ejecutar y si hay logs de actividad que permitan detectar comportamientos anómalos. La superficie de ataque no es solo el prompt: es todo el contexto que el LLM trata como propio (outputs de herramientas, resultados de ejecución, estado intermedio). Adversa anticipa que la próxima generación de ataques vendrá de ahí.
SEGUIR LA SEÑAL
VER TODO →Google Gemini Omni 1.1 Flash baja 60% el costo de generar video con IA
La nueva versión del modelo de Google introduce un modo borrador a 360p que cuesta un tercio que la resolución estándar y procesa hasta 60% más rápido. Permite extender escenas hasta 40 segundos y usar footage externo como referencia de estilo.
GLM-5.3-Flash: el modelo chino que promete redefinir eficiencia en LLMs
Z.ai lanzó GLM-5.3-Flash, un modelo de lenguaje open source que busca competir en rendimiento con los gigantes del sector mientras reduce drásticamente los costos de inferencia. La propuesta china apunta directo al dolor de las empresas.
Los agentes de IA ya consumen 14 veces más tokens que los humanos en OpenRouter
Febrero de 2026 fue probablemente el último mes en que humanos consumieron más tokens que agentes autónomos. Desde entonces, el uso agéntico creció 14x mientras el humano apenas 2,8x, según datos de OpenRouter.