La seguridad de la IA suele apoyarse en guardrails que revisan el texto de un prompt antes de que el modelo actúe. Sin embargo, una investigación reciente describe una técnica capaz de debilitar ese control: la inyección de contexto criptográfico. En esencia, el ataque busca que instrucciones potencialmente peligrosas “desaparezcan” del radar durante la fase de verificación y reaparezcan más tarde, cuando ya es tarde para que los filtros actúen.
Los investigadores, a partir de sus pruebas, señalan que el éxito del método puede variar según la interfaz y la evolución del modelo, aunque el riesgo sigue siendo relevante. Además, incluyen recomendaciones para defensores.
Qué es la inyección de contexto criptográfico
La clave del enfoque es el modo en que los sistemas de seguridad suelen clasificar los prompts: analizan el contenido del texto que reciben, pero no “ejecutan” el mensaje como si fuera código. Con la inyección de contexto criptográfico, el atacante evita que esa revisión detecte el contenido nocivo, porque el texto que llega a los guardrails aparece como cifrado.
En su planteamiento, el cifrado incluye no solo datos, sino también un mecanismo para recuperar el contenido real. Ese proceso se ejecuta dentro del entorno de ejecución del modelo (una especie de sandbox o contexto controlado). De este modo, el modelo “recupera” el prompt en el contexto de confianza y, al mismo tiempo, los guardrails pueden no marcarlo como problemático.
Los investigadores advierten un punto importante: el payload cifrado hereda credibilidad. Es decir, aunque el mismo texto malicioso, pegado directamente en el prompt, sería probablemente bloqueado, al llegar como parte de un flujo cifrado puede esquivar la detección inicial.
Por qué los guardrails pueden fallar ante cifrado
En muchos despliegues, los guardrails funcionan como filtros previos. Si el sistema no puede interpretar el cifrado como algo dañino —porque no lo descifra durante la clasificación— el ataque puede avanzar. Después, cuando el descifrado ocurre dentro del entorno de ejecución, el contenido recuperado se procesa como si formara parte legítima de la entrada.
Este patrón explica el “salto de fase” del atacante: primero el contenido elude el análisis por aparecer cifrado; luego, tras el descifrado, el modelo opera con instrucciones que ya no pasan por el mismo control.
Como resultado, el contenido “recuperado” puede dirigir al sistema hacia acciones no deseadas, desde respuestas restringidas hasta intentos de manipulación de herramientas disponibles en un agente.
Formas de entrega: directa y ataques tipo “watering hole”
Según el informe, la inyección de contexto criptográfico puede llegar al objetivo de dos maneras: de forma directa o de manera indirecta a través de páginas maliciosas.
Entrega directa
En un escenario directo, el atacante envía el mensaje cifrado al chat. Si el interfaz y el entorno de ejecución permiten que el modelo descifre y use ese contenido, el filtro inicial puede no detener la progresión del ataque.
Entrega indirecta mediante watering hole
En el enfoque indirecto, el atacante prepara una página web que contiene, además de su apariencia pública, un objeto cifrado (por ejemplo, en formato JSON). También incluye instrucciones para que el entorno del agente descifre ese contenido.
Luego, el sistema encargado de interactuar con el sitio —por ejemplo, un agente que resume texto o extrae datos— ingiere el cifrado y activa la cadena de descifrado. A partir de ahí, el contenido recuperado puede incluir instrucciones para acciones posteriores.
Este diseño es especialmente preocupante porque el usuario podría no ver ninguna señal clara del intento de manipulación: el ataque se oculta dentro de un paso que el agente realiza “automáticamente” al procesar una página externa.
Ejemplo de riesgo: exfiltración con un caso tipo “Grok”
El informe describe un ejemplo orientado a un chat web con capacidad de navegación agentica (un sistema que puede analizar páginas y ejecutar pasos adicionales). En el caso descrito, el ataque se plantea como una exfiltración de datos de “cero clic”, es decir, iniciada sin que el usuario deba realizar una acción adicional evidente, más allá de ser persuadido mediante ingeniería social para que el sistema revise una página preparada.
La página incluye un objeto cifrado y una instrucción para descifrarlo usando el entorno de ejecución con Python. Una vez recuperado, el prompt descifrado puede ordenar al agente que obtenga información asociada a la sesión privada del usuario (por ejemplo, contexto de sesión) y la incruste dentro de una URL controlada por el atacante.
Después, esa URL se carga de manera autónoma por el propio sistema, lo que permite que los datos del usuario se transmitan al destino del atacante. En la explicación de los investigadores, la plataforma permite que instrucciones y datos extraídos de una página no confiable influyan en la invocación de una herramienta con conectividad a internet.
En términos prácticos, el problema no es solo el cifrado, sino la combinación: contenido descifrado + acción privilegiada saliente, sin confirmación visible para el usuario.
Ejemplo de riesgo: bypass en modo de conversación tipo “Gemini”
Otro ejemplo del informe se centra en una interfaz pública de chat en un modo de razonamiento (mencionado en el artículo). Aquí, el mecanismo descrito es más directo: un único prompt indica al sistema que ejecute un script de Python para descifrar el texto suministrado.
Tras una serie de “trucos” descritos por los investigadores, el contenido recuperado puede redactarse para producir información restringida, pero presentándola como si fuera un material que el modelo “debería” devolver de forma segura, por ejemplo cifrándolo de nuevo “para protegerlo”. El objetivo es que la salida pueda pasar los filtros de salida al aparecer como datos cifrados.
Los autores señalan que la técnica llegó a generar un ejemplo de contenido restringido que normalmente sería suprimido por las salvaguardas. Se menciona como ejemplo el tipo de instrucciones asociadas a la fabricación de armas incendiarias, aunque el detalle exacto no se reproduce en el informe resumido.
En conjunto, estos resultados refuerzan la idea de que la inyección de contexto criptográfico no depende solo de evadir el filtro de entrada, sino también de afectar el filtro de salida, al encadenar cifrado en ambos extremos.
Evolución del ataque y estado de la investigación
Los investigadores reportan que informaron a xAI el 3 de junio de 2026 y que intentaron coordinar una divulgación adicional el 4 y el 10 de agosto. En el momento en que se redactó el informe, indican no haber recibido respuesta.
Además, aclaran que no pudieron hacer divulgación a Google porque, según su programa de divulgación de vulnerabilidades, los jailbreaks quedan fuera del alcance. Aun así, observan que la eficacia del ataque contra Gemini disminuyó hacia agosto.
Sobre el motivo del descenso, no ofrecen una causa definitiva. Proponen que podrían influir cambios en filtros, actualizaciones del modelo o ambas cosas. El punto importante para defensores es que el riesgo no desaparece automáticamente: puede reducirse, pero potencialmente vuelve a ser viable si el sistema cambia o si un atacante adapta la técnica.
Qué deberían hacer los defensores
El informe subraya que el potencial impacto debe tomarse con seriedad. Aunque se trata de una investigación técnica, sus implicaciones son prácticas: cualquier sistema que combine capacidad de ejecutar código, procesar contenido no confiable y usar herramientas externas puede convertirse en un objetivo.
Entre las orientaciones de prevención señaladas por los investigadores, el artículo apunta a la necesidad de tratar el cifrado y el descifrado dentro del flujo de seguridad como parte del problema, no como algo “neutral”. Si el contenido descifrado alimenta decisiones, herramientas o acciones, entonces los guardrails deben considerar esa ruta completa del flujo.
También conviene revisar la arquitectura de agentes: cuando un agente toma contenido de páginas externas y luego ejecuta acciones privilegiadas con salida a internet, debe existir control adicional (por ejemplo, confirmaciones, límites estrictos de uso de herramientas, o validación reforzada del contenido antes de disparar acciones).
Conclusión: una amenaza que combina cifrado y acciones
La inyección de contexto criptográfico muestra cómo un enfoque aparentemente “seguro” como el cifrado puede usarse para mover instrucciones peligrosas fuera del alcance de los filtros y recuperarlas después en un entorno confiable. Su capacidad para integrarse tanto en chats directos como en escenarios de agentes que procesan sitios externos eleva el riesgo.
Aunque el éxito puede variar con actualizaciones de seguridad, la lección principal permanece: la protección no debe limitarse a revisar el texto visible al inicio, sino a comprender el flujo completo —desde el descifrado hasta la ejecución y, especialmente, cualquier acción que produzca datos hacia el exterior.
Fuente: https://www.securityweek.com/encrypted-prompts-bypass-ai-safety-guardrails-in-grok-and-gemini/
