TL; DR
Una prova de penetració demostra el que pot fer un atacant. Amb la IA, el sistema que vau provar el trimestre passat ja no existeix. Els models reben noves versions, s'editen les indicacions, es connecten les eines i res d'això toca ni una línia del vostre codi. Les proves pentesting d'IA es centren en el comportament en lloc de les rutes de codi: què es pot persuadir el model a fer, què es pot fer que l'agent cridi i què surt de l'edifici com a resultat. L'abast ara es correspon amb el Top 10 d'OWASP per a aplicacions LLM i el Top 10 d'OWASP per a aplicacions agentiques 2026.
La càrrega útil és una frase i res de la sol·licitud sembla mal format. No hi ha cap paràmetre per difuminar quan l'atac arriba dins d'un tiquet de suport, un comentari de codi o un document recuperat, i és per això que la injecció indirecta de prompts és la tècnica que escala: ningú ha de tocar el front-end. Un cop el model conté eines, el dany arriba a través de les eines que té permís per utilitzar. L'abús d'eines, l'excés d'agència i l'exfiltració de dades a través de les pròpies integracions de l'agent són les troballes que importen, no si les respostes es llegeixen bé.
Un intent fallit no demostra res. Els sistemes d'IA són probabilístics, de manera que un resultat útil és una taxa, no un esdeveniment: aquest atac va tenir èxit en 12 de 100 intents. I l'objectiu és més ampli que el model. Els atacs documentats ja han afectat els actius circumdants: Unicode ocult en fitxers de regles que fa que un assistent emeti una sortida amb porta enrere, enverinament d'eines en servidors MCP i execució remota completa de codi a través d'un pont MCP executat més de 437,000 vegades. Tornar a provar cada canvi de model, indicació, eina i servidor és l'única cadència que reflecteix la realitat.
Provar és el segon. Veure és el primer: IA-SPM crea l'inventari i l'AI-BOM, de manera que sàpigues quins agents tenen quines eines i quins servidors MCP ningú ha aprovat; Seguretat de la IA puntua aquests actius en relació amb el Top 10 d'OWASP per a aplicacions LLM i assenyala el fitxer i la línia exactes, i l'embut de priorització redueix milers de resultats a aquells que estan en ús, són accessibles, explotables, privilegiats i crítics per al negoci; xy-dast continua provant la superfície web i de l'API on encara s'executa l'aplicació d'IA. La mateixa intel·ligència s'aplica a les troballes ingerides dels escàners que ja teniu., de manera que això estén la pila en comptes de substituir-la.
Què és el pentesting d'IA?
El pentesting d'IA és una prova adversaria dels sistemes d'IA: enviar entrades elaborades a un model, un agent o un servidor MCP per demostrar què pot fer realment un atacant. Mentre que una prova de penetració clàssica es centra en les rutes i configuracions de codi, les proves de penetració d'IA es centren en el comportament: instruccions segrestades, eines abusives, context filtrat i accions que el sistema mai no hauria de dur a terme. Aquesta és la versió curta del que és el pentesting d'IA. Existeix com a disciplina independent per una raó incòmoda però senzilla. L'informe anual de pentesting descriu una aplicació que ja no existeix perquè el model que hi havia darrere ha canviat tres vegades des de la interacció i cap línia del codi ha canviat.
Per què una prova de penetració clàssica no cobreix la IA?
Qualsevol persona que es pregunta què és el pentesting amb IA per primera vegada sol començar aquí, amb el buit. Una prova tradicional assumeix un comportament determinista. Envieu la mateixa sol·licitud, obteniu la mateixa resposta i un resultat o bé es reprodueix o bé no. La IA trenca aquesta suposició en tres punts.
- El sistema és probabilístic. La mateixa indicació pot tenir èxit al quart intent i fallar als tres primers. Una sola prova negativa no demostra res, i per això les proves pentesting dels sistemes d'IA són una qüestió de cobertura i repetició en lloc d'una acció puntual.
- La superfície d'atac és el llenguatge, no només les interfícies. No hi ha cap paràmetre per corregir quan la càrrega útil és una frase dins d'un tiquet de suport, un comentari de codi o un document recuperat. Res de la sol·licitud sembla mal format.
- El radi de la voladura és la superfície de l'eina. Un agent amb eines pot enviar correus electrònics, consultar bases de dades, cridar API internes i escriure fitxers. Fer proves pentesting dels agents d'IA significa provar què es pot persuadir el model a fer amb aquestes eines, no si les seves respostes són educades.
Què prova realment el pentesting d'IA
L'abast s'ha establert al voltant d'un conjunt d'objectius recognoscibles, alineats amb Els 10 millors de l'OWASP per a sol·licituds de LLM i la OWASP Top 10 per a aplicacions agentives 2026.
- Injecció directa immediata. Pot un usuari anul·lar la indicació del sistema i prendre el control del comportament del model?
- Injecció immediata indirecta. Pot un atacant introduir instruccions en el contingut que recupera el sistema, de manera que ningú hagi d'interactuar-hi en absolut?
- Extracció de l'indicador del sistema. El model revela les seves pròpies instruccions, els seus guardrails o la lògica empresarial que hi ha integrada?
- Bypass de la barana i fuga de la presó. Quants intents i quines codificacions invaliden la capa de seguretat i política?
- Abús d'eines. Es pot induir el model a cridar una eina amb arguments escollits per l'atacant, per exemple, enviant dades a un destinatari arbitrari a través de la seva pròpia eina de correu electrònic?
- Excés d'agència. Quina és l'acció més àmplia que pot dur a terme l'agent, i hi ha alguna cosa que requereixi la intervenció d'un humà abans d'executar-se?
- Rutes d'exfiltració de dades. El context, els secrets o les dades personals poden arribar a un canal de sortida, un registre o una eina de tercers?
- Intoxicació per recuperació. El contingut enverinat del magatzem de vectors canvia el comportament posterior i persisteix?
- Exposició al servidor MCP. Què exposa cada servidor connectat, valida els arguments i qui més hi pot accedir?
- Gestió de la sortida insegura. La sortida del model flueix sense validar cap a un shell, un navegador, una consulta o una plantilla?
Aquesta llista és la raó per la qual les proves de penetració d'IA produeixen un tipus d'informe diferent. El resultat valuós no és un CVELa resposta pràctica al que és el pentesting amb IA és una seqüència reproduïble: aquesta entrada, a través d'aquest camí, va produir aquesta acció no autoritzada, amb aquesta evidència.
Proves de penetració per IA en comparació amb el que ja executeu
| Prova de penetració clàssica / DAST | Proves de penetració d'IA | |
|---|---|---|
| Objectiu | Punts finals, paràmetres, configuració | Comportament model, agent decisions, trucades d'eines |
| Carrega útil | Sol·licituds mal formades o malicioses | Llenguatge natural i contingut que recupera el sistema |
| Resultat | Determinista i reproduïble | Probabilista, necessita repetició per establir una taxa |
| evidència | Sol·licitud, resposta, CWE | Sol·licitar, rastrejar, l'acció que ha dut a terme el sistema |
| cadència | Per llançament o per any | Per model, indicació, eina o canvi de configuració |
Les proves de penetració d'IA i les proves d'execució clàssiques són complementàries, no competeixen. Una aplicació d'IA encara s'executa en una pila web amb autenticació, API i infraestructura, i aquesta superfície necessita proves d'execució exactament com abans. Xygeni DAST ho cobreix: xy-dast simula tècniques d'atac reals contra aplicacions web i API en execució, proves darrere login amb autenticació basada en formularis, testimonis, capçaleres o scripts, s'executa des d'una única ordre CLI en qualsevol pipeline, les portes es basen en un llindar i retornen la càrrega útil de l'atac més la sol·licitud i la resposta completes com a prova de cada troballa. Les troballes passen a través de l'embut de priorització, que es filtra al que està exposat a Internet, explotable sense credencials i adjunt a alguna cosa que importa a l'empresa.
El que DAST no fa és discutir amb un model de llenguatge. Aquest és el buit que omplen les proves pentesting d'IA.
Abans de la primera càrrega útil
Dues coses fan que una prova de penetració d'IA sigui útil en lloc de teatral, i ambdues vénen abans de la primera càrrega útil.
- Una llista d'objectius. No pots provar una IA que no hagis trobat. Xygeni AI Security descobreix tots els actius d'IA del SDLC, incloent-hi els models, agents, servidors d'agents, conjunts de dades, servidors MCP, fitxers d'habilitats, indicacions i guardrails ningú ha declarat, llegint el codi de l'aplicació, les dependències declarades i els fitxers de configuració que les eines d'IA deixen enrere. Mapeja les relacions entre ells, que és el que converteix una llista d'actius en una ruta d'atac que val la pena provar.
- Una llista curta. Xygeni detecta les debilitats que fan que una vulnerabilitat sigui probable abans que algú l'intenti: injecció de prompts i fuites de prompts del sistema, instruccions malicioses i injecció d'eines en regles i fitxers d'habilitats, configuració MCP insegura, excés d'agència i mancances. guardrails, secrets en fitxers d'IA i dependències d'IA vulnerables o desaprofitades. Les troballes es corresponen amb el Top 10 d'OWASP per a aplicacions LLM i apunten al fitxer i la línia exactes, i l'embut de priorització redueix milers de troballes al grapat que estan en ús, són accessibles, explotables, privilegiades i crítiques per al negoci.
Executeu-ho en aquest ordre i una prova de penetració deixa de ser una expedició de pesca. Arribeu sabent quin agent té quines eines, quin servidor ningú ha aprovat i quin indicador accepta entrades no fiables.
Com executar una prova de penetració d'IA que produeixi alguna cosa útil
Set hàbits separen les proves de penetració d'IA útils d'una demostració, i els equips que són nous en les proves de penetració d'aplicacions d'IA tendeixen a ometre els dos primers.
- Inventari primer Models, agents, servidors MCP, conjunts de dades, indicacions. Provar una superfície desconeguda produeix un resultat desconegut.
- Defineix què significa no autoritzat Escriu les accions que el sistema no ha de dur a terme mai. Sense aquesta llista, cada troballa és una qüestió d'opinió.
- Prova la ruta de recuperació, no només la finestra de xat La injecció indirecta és la tècnica que escala i mai toca la part frontal.
- Mesurar taxes, no esdeveniments Informeu que un atac ha tingut èxit en 12 de cada 100 intents, perquè aquest és el nombre sobre el qual un enginyer pot actuar i que una junta pot entendre.
- Prova també la capa de configuració Fer proves de penetració de la IA sense llegir-ne la configuració és mig test i un exercici d'enduriment ràpid.cise es malgasta si un fitxer de regles el sobreescriu silenciosament.
- Torna a provar el canvi Nova versió del model, nova eina, nou servidor MCP o indicació editada, totes aquestes opcions invaliden l'últim resultat.
- Introduir els resultats a la postura Una troballa que es troba en un PDF no canvia res. Una troballa correlacionada amb l'actiu que l'ha produït canvia les prioritats.
FAQ
- Què és el pentesting d'IA, en una frase? Proves contradictòries que demostren què pot fer un atacant als vostres models, agents i servidors MCP.
- És el mateix fer pentesting amb IA que fer equips vermells amb IA? Se superposen molt. El red teaming és més ampli i sovint inclou escenaris de seguretat, biaix i abús; el pentesting d'IA tendeix a centrar-se en resultats de seguretat com ara la injecció, l'exposició de dades i les accions no autoritzades.
- En què es diferencia el pentesting de la IA de provar una aplicació web? La càrrega útil és el llenguatge, el resultat és probabilístic i el dany es produeix a través d'eines que el model pot utilitzar en lloc d'una ruta de codi vulnerable.
- Amb quina freqüència s'han de fer proves de penetració d'IA? En cada canvi que afecta el comportament: versió del model, indicació, superfície de l'eina, servidor MCP connectat o corpus de recuperació. Una cadència anual descriu un sistema que ja no existeix.
- Encara necessitem DAST si executem proves de pentesting amb IA? Sí. L'aplicació, les seves API i la seva infraestructura continuen sent un objectiu. Les proves de pentesting amb IA afegeixen una capa; no substitueixen la que hi ha a sota.
- Què hauríem de provar primer? L'agent amb la superfície d'eines més àmplia i qualsevol camí on el contingut de fora de l'organització arriba a una indicació.
Comença amb el que pots veure
La resposta a què és el pentesting de la IA es redueix a una pregunta: és explotable i per qui? Obtenir una resposta útil depèn de saber què existeix primer, perquè una simulació d'atac contra un inventari incomplet mesura la teva visibilitat, no la teva exposició.
Xygeni descobreix la IA que tens dins SDLC, puntua què és realment explotable i aplica la política al punt final del desenvolupador on s'executa la major part. Vegeu a què estan connectats els vostres agents a Xígeni.







