Las vulnerabilidades en agentes no siempre requieren “engañar” a un modelo para que haga algo indebido. En varios casos, el problema estuvo en el harness: el código que actúa como puente entre el agente y el mundo real, es decir, lo que valida, decide y finalmente ejecuta dentro de un entorno de integración continua (CI). Esa superficie terminó siendo suficiente para alcanzar resultados peligrosos en repositorios de agentes de terceros.
Según un informe de Novee Security, una issue creada desde una cuenta sin privilegios de repositorio pudo llegar a la ejecución en runners que soportaban repositorios de agentes, y en otros escenarios incluso comprometer el flujo de ejecución del siguiente agente. En este artículo repasamos qué se encontró, qué se corrigió y qué deberías revisar en tus workflows para reducir el riesgo.
Por qué el “harness” es el punto crítico
El hallazgo central es que muchas cadenas de ataque se comportan igual incluso con capas aparentemente “seguras”. En palabras del ingeniero fundador de Novee, el harness es el componente entre el modelo y la realidad: ahí es donde un valor puede marcarse como seguro en un momento y, después, ejecutarse con más autoridad en otro punto del flujo.
Este patrón explica por qué dos fallos distintos —en herramientas distintas— pueden terminar con resultados similares: ejecución en el host de una plataforma headless antes de que el entorno de sandbox comience, o filtraciones asociadas a una parte del proceso que lee “instrucciones” generadas previamente.
Gemini CLI: inyección de comandos que salta el sandbox
El caso más severo señalado para Gemini CLI es CVE-2026-12537, con una valoración CVSS 4 de 10.0. El problema se describe como una inyección de comandos del sistema en el lanzador del contenedor. El camino hacia el fallo no dependía de convencer al modelo con un “prompt”, sino de la carga de un archivo con contenido manipulado.
En concreto, un atacante podía usar un archivo .gemini/.env especialmente construido para alcanzar ejecución de código en el host de una plataforma CI headless antes de que iniciara el sandbox.
- Qué hacer: actualizar Gemini CLI a 0.39.1.
- Qué hacer: actualizar run-gemini-cli a 0.1.22.
El informe indica que el arreglo queda cubierto en esas versiones. Además, se menciona que el advisory de Google detalla correcciones que también aplican a acciones de GitHub relacionadas con Gemini CLI.
Claude Code: exfiltración al convertir contadores públicos en canal
En el caso de Claude Code, el problema se registró como CVE-2026-54316. En lugar de centrarse en un salto de sandbox por inyección directa, el riesgo estuvo en una forma de exfiltración en la que un contador de descargas público de Hugging Face terminó funcionando como un canal.
Según Novee, se podía filtrar una clave de API carácter por carácter. El fallo afectó a múltiples versiones: el reporte afirma que cualquier release desde 0.2.54 hasta 2.1.163 estuvo expuesto. La corrección llegó en la versión 2.1.163.
- Qué hacer: actualizar Claude Code a 2.1.163.
El proveedor señaló que para explotar el problema era necesario introducir contenido no confiable dentro de un contexto de Claude Code. También se indica que la validación de comandos y el comportamiento del validador —en particular con texto entrecomillado— jugaron un papel en el encadenamiento.
El problema sin CVE en Codex: instrucciones de un paso que contaminan el siguiente
No todos los hallazgos se plasman como CVE con una versión concreta para instalar. Para Codex, el “finding” descrito por Novee no produjo un número de producto ni un identificador CVE. Aun así, el impacto se relacionó con la estructura del flujo en el repositorio openai/codex.
De acuerdo con el reporte, el repositorio ejecutaba dos pasadas de Codex dentro de un mismo job que compartía un checkout. En ese esquema, la primera pasada podía escribir un archivo como AGENTS.md, y el segundo pase lo cargaba como parte de sus instrucciones. Además, el informe describe que el fallo de validación de JSON entre pasadas era lo que terminaba disparando la ejecución del segundo pase.
Frente a esto, se reporta que el flujo actual de OpenAI separa las pasadas en distintos jobs y utiliza ejecución con opciones como drop-sudo y un sandbox de solo lectura. También se afirma que la guía actual incluye recomendaciones sobre tratar archivos de instrucciones a nivel de repositorio como superficie de entrada no confiable.
O sea: más que “arreglar Codex”, el cambio documentado y operativo se enfoca en arreglar el workflow para que las instrucciones generadas no comprometan pasos posteriores privilegiados.
Qué significa esto para tu CI: revisa workflows que cualquiera pueda disparar
El consejo operativo del informe es directo: además de aplicar parches a Gemini CLI y Claude Code, conviene auditar cualquier workflow que un usuario externo pueda disparar. El motivo es que el caso base comienza con una issue desde una cuenta sin privilegios de repositorio, lo que sugiere que la configuración de CI puede ser el eslabón débil.
En el mismo enfoque de seguridad, se recomienda revisar la ruta exacta por la que una tarea del agente llega a ejecutar comandos en un runner y, en particular, cómo se maneja cualquier contenido “de entrada” que el agente pueda leer o transformar.
Explotación confirmada: no se reporta uso en catálogos conocidos
El reporte menciona que CISA registra tanto Gemini como Claude Code con explotación listada como none. Además, The Hacker News verificó el 7 de agosto que ninguno figura en el catálogo de Known Exploited Vulnerabilities.
También se menciona un repositorio público que se describe como un laboratorio de reproducción para la falla de Claude Code, activo desde el 18 de junio. Aun así, el material revisado no muestra que estas cadenas se hayan usado contra un objetivo en los términos documentados.
Recomendaciones prácticas para reducir riesgo
Si operas repositorios con agentes de código o tareas similares en CI, estos pasos te ayudarán a reducir la probabilidad de que las vulnerabilidades en agentes terminen en incidentes:
- Actualiza Gemini CLI a 0.39.1 y run-gemini-cli a 0.1.22.
- Actualiza Claude Code a 2.1.163 (todas las versiones entre 0.2.54 y 2.1.163 se consideran afectadas por el informe).
- Audita workflows que puedan ser activados por usuarios externos: revisa permisos, contenido no confiable y qué pasos ocurren después.
- Revisa la separación entre etapas: el problema reportado en Codex apunta a que compartir estado entre pasadas dentro del mismo job puede amplificar daños.
- Trata archivos de instrucciones como no confiables cuando el flujo los genere o los lea durante la ejecución del agente.
Conclusión
El mensaje más importante de este caso es que las vulnerabilidades en agentes suelen aparecer donde menos se mira: en el código que conecta el modelo con el sistema operativo, el runner y las acciones de CI. Gemini CLI y Claude Code ya tienen correcciones publicadas, mientras que para el hallazgo asociado a Codex el enfoque se centra en ajustar el workflow para evitar contaminación entre pasos.
Si dependes de agentes para automatizar desarrollo y tienes workflows que pueden activarse desde entradas no confiables, ahora es un buen momento para actualizar herramientas y revisar el diseño de tu canal de CI.
Fuente: https://thehackernews.com/2026/08/claude-code-and-gemini-cli-flaws-let.html
