TL; DR
Una prueba de penetración demuestra de lo que es capaz un atacante. Con la IA, el sistema que probaste el trimestre pasado ya no existe. Los modelos se actualizan, las indicaciones se editan, las herramientas se conectan y nada de esto afecta a tu código. Las pruebas de penetración con IA se centran en el comportamiento, no en las rutas de código: qué se puede lograr que haga el modelo, qué llamadas se pueden realizar al agente y qué consecuencias tiene. El alcance actual coincide con el Top 10 de OWASP para aplicaciones LLM y el Top 10 de OWASP para aplicaciones de agentes de 2026.
La carga útil es una oración y nada en la solicitud parece estar mal formado. No hay parámetros para realizar pruebas de fuzzing cuando el ataque llega dentro de un ticket de soporte, un comentario de código o un documento recuperado, por lo que la inyección indirecta de mensajes es la técnica escalable: nadie tiene que tocar tu interfaz. Una vez que el modelo contiene herramientas, el daño se produce a través de las herramientas que tiene permitido usar. El abuso de herramientas, la excesiva autonomía y la exfiltración de datos a través de las propias integraciones del agente son los hallazgos que importan, no si las respuestas son correctas.
Un intento fallido no prueba nada. Los sistemas de IA son probabilísticos, por lo que un resultado útil es una tasa, no un evento: este ataque tuvo éxito en 12 de 100 intentos. Además, el objetivo es más amplio que el modelo. Ya se han documentado ataques que afectan a los recursos circundantes: Unicode oculto en archivos de reglas que provoca que un asistente genere una salida con puerta trasera, envenenamiento de herramientas en servidores MCP y ejecución remota completa de código a través de un puente MCP, accedido más de 437 000 veces. La única cadencia que refleja la realidad es volver a realizar pruebas con cada cambio de modelo, mensaje, herramienta y servidor.
Las pruebas son secundarias. Lo primero es ver: IA-SPM crea el inventario y la lista de materiales de IA, para que sepas qué agentes tienen qué herramientas y qué servidores MCP no han sido aprobados por nadie; Seguridad AI El sistema evalúa esos activos comparándolos con el OWASP Top 10 para aplicaciones LLM e indica el archivo y la línea exactos, y el embudo de priorización reduce miles de hallazgos a aquellos que están en uso, son accesibles, explotables, privilegiados y críticos para el negocio; xy-dast Continúa probando la interfaz web y la API en la que aún se ejecuta la aplicación de IA. La misma inteligencia se aplica a los resultados obtenidos de los escáneres que ya posee., por lo que esto extiende tu pila en lugar de reemplazarla.
¿Qué es el pentesting con IA?
Las pruebas de penetración de IA son pruebas adversarias de sistemas de IA: enviar entradas diseñadas a un modelo, un agente o un servidor MCP para demostrar lo que un atacante puede hacer que haga. Mientras que una prueba de penetración clásica se centra en las rutas de código y las configuraciones, las pruebas de penetración de IA se centran en el comportamiento: instrucciones secuestradas, herramientas mal utilizadas, contexto filtrado y acciones que el sistema nunca debería haber realizado. Esa es la versión corta de lo que son las pruebas de penetración de IA. Existe como una disciplina separada por una razón incómoda pero simple. Su informe anual de pruebas de penetración describe una aplicación que ya no existe porque el modelo que la sustenta cambió tres veces desde la evaluación inicial, y ni una sola línea de su código cambió.
¿Por qué una prueba de penetración clásica no abarca la IA?
Quien pregunta por primera vez qué es el pentesting con IA suele empezar por aquí, con la brecha. Una prueba tradicional presupone un comportamiento determinista. Se envía la misma solicitud, se obtiene la misma respuesta y el resultado se reproduce o no. La IA rompe esa suposición en tres puntos.
- El sistema es probabilístico. La misma instrucción puede tener éxito al cuarto intento y fallar en los tres primeros. Una sola prueba negativa no demuestra nada, por lo que las pruebas de penetración en sistemas de IA se basan en la cobertura y la repetición, más que en una única vulnerabilidad.
- La superficie de ataque es el lenguaje, no solo las interfaces. No hay ningún parámetro para realizar pruebas de fuzzing cuando la carga útil es una frase dentro de un ticket de soporte, un comentario de código o un documento recuperado. Nada en la solicitud parece estar mal formado.
- El radio de explosión es la superficie de la herramienta. Un agente con las herramientas adecuadas puede enviar correos electrónicos, consultar bases de datos, llamar a API internas y escribir archivos. Probar la penetración en agentes de IA implica evaluar qué se puede lograr que haga el modelo con esas herramientas, no si sus respuestas son educadas.
¿Qué pruebas realiza realmente la IA de penetración?
El alcance se ha definido en torno a un conjunto reconocible de objetivos, alineados con la Los 10 mejores candidatos para el Máster en Derecho de OWASP y conectar Las 10 principales vulnerabilidades de OWASP para aplicaciones ámbicas en 2026.
- Inyección directa inmediata. ¿Puede un usuario anular el mensaje del sistema y tomar el control del comportamiento del modelo?
- Inyección instantánea indirecta. ¿Puede un atacante insertar instrucciones en el contenido que recupera el sistema, de modo que nadie tenga que interactuar con él?
- Extracción de avisos del sistema. ¿El modelo revela sus propias instrucciones, sus guardrails ¿O la lógica empresarial integrada en ellos?
- Eludir la barrera de seguridad y escapar de la cárcel. ¿Cuántos intentos y qué codificaciones logran burlar la capa de seguridad y políticas?
- Abuso de herramientas. ¿Es posible inducir al modelo a llamar a una herramienta con argumentos elegidos por el atacante, por ejemplo, enviando datos a un destinatario arbitrario a través de su propia herramienta de correo electrónico?
- Autonomía excesiva. ¿Cuál es la acción más amplia que puede realizar el agente y hay alguna que requiera la intervención humana antes de su ejecución?
- Rutas de exfiltración de datos. ¿Pueden el contexto, los datos de Secretos o los datos personales llegar a un canal de salida, un registro o una herramienta de terceros?
- Envenenamiento por recuperación. ¿El contenido contaminado en el almacenamiento vectorial altera el comportamiento posterior y persiste dicho efecto?
- Exposición del servidor MCP. ¿Qué expone cada servidor conectado, valida los argumentos y quién más puede acceder a él?
- Manejo de salida inseguro. ¿El flujo de salida del modelo se envía sin validar a una consola, un navegador, una consulta o una plantilla?
Esa lista es la razón por la que las pruebas de penetración de IA producen un tipo diferente de informe. El resultado valioso no es un CVELa respuesta práctica a qué es el pentesting con IA es una secuencia reproducible: esta entrada, a través de esta ruta, produjo esta acción no autorizada, con esta evidencia.
Pruebas de penetración con IA en comparación con lo que ya ejecutas
| Prueba de penetración clásica / DAST | pruebas de penetración con IA | |
|---|---|---|
| Objetivo | Puntos finales, parámetros, configuración | Comportamiento del modelo, agente decisiones, llamadas a herramientas |
| carga útil | Solicitudes mal formuladas o maliciosas | Lenguaje natural y contenido que recupera el sistema |
| Resultado | Determinista y reproducible | Probabilístico, necesita repetición para establecer una tasa |
| Evidencia | Solicitud, respuesta, CWE | Inmediato, seguimiento, la acción que tomó el sistema |
| Cadencia | Por lanzamiento o por año | Por modelo, solicitud, herramienta o cambio de configuración |
Las pruebas de penetración de IA y las pruebas clásicas de tiempo de ejecución son complementarias, no competitivas. Una aplicación de IA sigue funcionando sobre una pila web con autenticación, API e infraestructura, y esa superficie necesita pruebas de tiempo de ejecución exactamente igual que antes. Xygeni DAST lo cubre: xy-dast Simula técnicas de ataque reales contra aplicaciones web y API en ejecución, pruebas subyacentes login con autenticación basada en formulario, token, encabezado o script, se ejecuta desde un único comando CLI en cualquier pipelineEl sistema de puertas se basa en un umbral y devuelve la carga útil del ataque, junto con la solicitud y respuesta completas, como evidencia en cada hallazgo. Estos hallazgos pasan luego por un embudo de priorización que los filtra para identificar lo que está expuesto a internet, es explotable sin credenciales y está vinculado a algo de interés para la empresa.
Lo que DAST no hace es discutir con un modelo de lenguaje. Esa es la brecha que llena la IA en las pruebas de penetración.
Antes de la primera carga útil
Hay dos cosas que hacen que una prueba de penetración de IA sea útil en lugar de meramente teatral, y ambas se producen antes de la primera carga útil.
- Una lista de objetivos. No puedes probar la IA que no has encontrado. Xygeni AI Security descubre todos los activos de IA en el SDLC, incluyendo los modelos, agentes, servidores de agentes, conjuntos de datos, servidores MCP, archivos de habilidades, indicaciones y guardrails Nadie declaró nada, leyendo el código de la aplicación, las dependencias declaradas y los archivos de configuración que dejan las herramientas de IA. Mapea las relaciones entre ellos, lo que convierte una lista de activos en una ruta de ataque que vale la pena probar.
- Una lista reducida. Xygeni detecta las debilidades que hacen probable un exploit antes de que alguien lo intente: inyección de prompts y fuga de prompts del sistema, instrucciones maliciosas e inyección de herramientas en reglas y archivos de habilidades, configuración insegura de MCP, agencia excesiva y faltante guardrailsSecretos en archivos de IA y dependencias de IA vulnerables o suplantadas. Los hallazgos se corresponden con el Top 10 de OWASP para aplicaciones LLM e indican el archivo y la línea exactos, y el embudo de priorización reduce miles de hallazgos a un puñado de aquellos que están en uso, son accesibles, explotables, privilegiados y críticos para el negocio.
Si se ejecuta en ese orden, una prueba de penetración deja de ser una simple búsqueda de información. Se llega sabiendo qué agente tiene qué herramientas, qué servidor no fue aprobado y qué sistema acepta información no confiable.
Cómo realizar una prueba de penetración de IA que produzca algo útil.
Siete hábitos distinguen una prueba de penetración de IA útil de una simple demostración, y los equipos que se inician en las pruebas de penetración de aplicaciones de IA tienden a omitir los dos primeros.
- Primero el inventario Modelos, agentes, servidores MCP, conjuntos de datos, indicaciones. Probar una superficie desconocida produce un resultado desconocido.
- Defina qué significa no autorizado Anota las acciones que el sistema nunca debe realizar. Sin esa lista, cada hallazgo es una cuestión de opinión.
- Prueba la ruta de recuperación, no solo el cuadro de chat. La inyección indirecta es la técnica que se adapta a diferentes tamaños y nunca afecta a la interfaz de usuario.
- Mida las tasas, no los eventos. Informe que un ataque tuvo éxito en 12 de 100 intentos, porque ese es el número con el que un ingeniero puede actuar y que una junta directiva puede comprender.
- Pruebe también la capa de configuración. Realizar pruebas de penetración en la IA sin leer su configuración es solo la mitad de una prueba, y un ejercicio de endurecimiento inmediato.cisSe desperdicia si un archivo de reglas lo sobrescribe silenciosamente.
- Volver a realizar la prueba tras el cambio. Una nueva versión del modelo, una nueva herramienta, un nuevo servidor MCP o una solicitud editada, todo ello invalida el último resultado.
- Retroalimentación de los resultados a la postura Un hallazgo que reside en un PDF no cambia nada. Un hallazgo correlacionado con el recurso que lo produjo sí cambia las prioridades.
Preguntas Frecuentes
- ¿Qué es el pentesting con IA, en una sola frase? Pruebas adversarias que demuestran lo que un atacante puede hacer que hagan realmente sus modelos, agentes y servidores MCP.
- ¿Es lo mismo realizar pruebas de penetración con IA que realizar ejercicios de "red teaming" con IA? Ambos se superponen en gran medida. El red teaming es más amplio y suele incluir escenarios de seguridad, sesgo y abuso; las pruebas de penetración con IA tienden a centrarse en resultados de seguridad como la inyección, la exposición de datos y las acciones no autorizadas.
- ¿En qué se diferencia el pentesting de IA del pentesting de una aplicación web? La carga útil es el lenguaje, el resultado es probabilístico y el daño se produce a través de las herramientas que el modelo tiene permitido usar, en lugar de a través de una ruta de código vulnerable.
- ¿Con qué frecuencia deberían realizarse las pruebas de penetración de IA? En cada cambio que afecte al comportamiento: versión del modelo, mensaje, interfaz de la herramienta, servidor MCP conectado o corpus de recuperación. Una cadencia anual describe un sistema que ya no existe.
- ¿Seguimos necesitando DAST si realizamos pruebas de penetración con IA? Sí. La aplicación, sus API y su infraestructura siguen siendo un objetivo. Las pruebas de penetración con IA añaden una capa; no reemplazan la subyacente.
- ¿Qué deberíamos probar primero? El agente con la superficie de herramientas más amplia y cualquier ruta por donde el contenido externo a la organización llegue a una solicitud.
Empieza por lo que puedes ver.
La respuesta a qué es el pentesting con IA se reduce a una pregunta: ¿es explotable y quién podría hacerlo? Para obtener una respuesta útil, primero hay que saber qué existe, ya que una simulación de ataque contra un inventario incompleto mide la visibilidad, no la exposición.
Xygeni descubre la IA en tu SDLC, evalúa lo que es realmente explotable y aplica la política en el punto final del desarrollador donde se ejecuta la mayor parte. Vea a qué están conectados sus agentes en xygeni.







