Falls Sie schon einmal gefragt wurden, was Prompt Injection ist und nur eine unvollständige Antwort erhalten haben, hier die Kurzfassung: Es handelt sich um eine Angriffstechnik, bei der bösartiger oder manipulativer Text in die Eingabe eines KI-Modells eingeschleust wird. Dadurch wird das Modell dazu gebracht, seine ursprünglichen Anweisungen zu ignorieren und stattdessen den Anweisungen des Angreifers zu folgen. Das ist der Kern der Prompt Injection: Es ist kein Fehler im Code, sondern ein Angriff, der die Anweisungen des Modells mithilfe von Alltagssprache anstatt herkömmlichem Exploit-Code kapert.
Prompt-Injektion – Bedeutung in einfachen Worten #
Die Bedeutung der Prompt-Eingabe Wort für Wort aufzuschlüsseln, hilft dabei, sie sich besser einzuprägen:
- Prompt: Die Anweisungen und der Kontext, die in ein KI-Modell eingespeist werden, egal ob sie direkt von einem Benutzer eingegeben oder automatisch aus einem Dokument, einer Webseite oder einer API-Antwort abgerufen wurden.
- Injektion: Das Einfügen von Daten, die dort nicht hingehören, ist der gleichen Logik entlehnt wie die SQL-Injection, bei der nicht vertrauenswürdige Eingaben als Befehl und nicht als einfache Daten behandelt werden.
Wenn also jemand fragt, was Prompt Injection ist, lautet die einfachste Antwort: Es ist das, was passiert, wenn ein KI-Modell nicht zwischen den Anweisungen seines Entwicklers und den im zu verarbeitenden Inhalt verborgenen Anweisungen unterscheiden kann.
Was genau ist enthalten? #
Die meisten realen Fälle lassen sich in diese Hauptkategorien einteilen:
- Direkte SofortinjektionDer Angreifer tippt die bösartige Anweisung direkt in den Chat oder das Eingabefeld ein und fordert das Modell damit offen auf, seine vorherigen Regeln zu ignorieren („ignoriere alle vorherigen Anweisungen und…“).
- Indirekte SofortinjektionDie schädliche Anweisung ist in Inhalten versteckt, die das Modell später liest, wie z. B. einer Webseite, einem PDF, einer E-Mail oder einem Codekommentar, und sie wird erst aktiviert, wenn das Modell diese Inhalte verarbeitet, wobei sich zu diesem Zeitpunkt kein Angreifer befindet.
- Injektion im Jailbreak-StilEine spezielle Form der Injektion, die Rollenspiele, hypothetische Darstellungen oder Kodierungstricks nutzt, um die Sicherheit eines Modells zu umgehen. guardrails insbesondere, anstatt dessen Aufgabe zu kapern.
Prompt Injection vs. Jailbreaking: Was ist der Unterschied? #
Eine häufige Anschlussfrage zu Prompt Injection ist der Unterschied zum Jailbreaking. Es gibt zwar Überschneidungen, aber keine identischen Verfahren. Beim Jailbreaking geht es speziell darum, die Sicherheitsvorkehrungen eines Betriebssystems zu umgehen. Inhalt guardrails, Es geht darum, das Modell dazu zu bringen, etwas zu sagen oder zu generieren, was es eigentlich ablehnen sollte. Prompt Injection ist umfassender: Es geht darum, die Anweisungen oder Aufgaben des Modells zu übernehmen, was Sicherheitsrisiken bergen kann. guardrails Überhaupt nicht. Eine indirekte Code-Injektion, versteckt in einem Support-Ticket, die einen Kundendienstmitarbeiter stillschweigend anweist, die Daten eines Benutzers an eine externe Adresse zu senden, versucht nicht, irgendetwas zu jailbreaken; sie leitet lediglich die Aufgabe selbst um.
Wo die Sofortinjektion tatsächlich sichtbar wird #
Sobald man die Bedeutung der Prompt-Injektion verstanden hat, wird es einfacher zu erkennen, wo das Risiko in realen Systemen liegt:
MCP-Server und KI-Codierungsassistenten – Ein bösartiger Kommentar, eine README-Datei oder eine Tool-Ergebnis-Payload können die Aktionen eines Agenten innerhalb der Codebasis oder des Terminals eines Entwicklers umleiten. Dies hängt von der verwendeten Programmiersprache ab, aber die Kernidee (Editor + Build-Tools + Debugger an einem Ort) bleibt dieselbe.
Chatbots und Support-Mitarbeiter – Ein Benutzer fügt einen eingeschleusten Text ein, um den Bot dazu zu bringen, seine Systemabfrage anzuzeigen oder unbeabsichtigte Aktionen auszuführen.
Retrieval-Augmented Generation (RAG) pipelines – Ein manipuliertes Dokument in der Wissensdatenbank enthält Anweisungen, die beim Abruf aktiviert werden.
Autonome KI-Agenten – Ein Agent, der im Internet surft, E-Mails liest oder Anrufe tätigt, kann in beliebige Inhalte eingeschleuste Anweisungen aufnehmen und diese dann mit echten Berechtigungen ausführen.
Warum die Bedeutung der Prompt-Eingabe mehr ist als nur ein „Prompt-Trick“ #
Man könnte es leicht als Spielerei abtun, als cleveren Trick, um einen Chatbot etwas Albernes sagen zu lassen. Doch sobald KI-Modelle in Agenten integriert sind, die E-Mails versenden, Code ausführen, Datenbanken abfragen oder Pakete installieren können, ist Prompt-Injection keine bloße Kuriosität im Chatfenster mehr, sondern ein echtes Sicherheitsproblem: Wer die Inhalte kontrolliert, die ein Modell liest, kann unter bestimmten Bedingungen auch dessen weiteres Vorgehen steuern. Deshalb wird diese Art der Injection nun als eigene Kategorie in der Sicherheitsarchitektur geführt. OWASP Top 10 für LLM-Bewerbungenund warum das Verständnis von Prompt Injection heute als grundlegendes Wissen für jeden gilt, der KI-gestützte Systeme entwickelt oder absichert, und nicht nur als Kuriosität für Red-Team-Mitglieder.
Wenn Sie dies speziell aus der Perspektive von AppSec und DevSecOps betrachten, also wie sich das Risiko der Prompt-Injection bei KI-Agenten, MCP-Servern und KI-generiertem Code äußert und nicht nur, was der Begriff bedeutet, haben wir das hier ausführlicher behandelt: KI-gestützte Lieferkettensicherheit.

FAQ #
Bei einem Angriff werden bösartige Anweisungen in den Eingabedaten oder Inhalten versteckt, die ein KI-Modell verarbeitet, sodass das Modell den Anweisungen des Angreifers anstatt seinen ursprünglichen Anweisungen folgt.
Es kombiniert „Prompt“ (die Anweisungen und den Kontext, die einem KI-Modell gegeben werden) mit „Injection“ (dem Einfügen nicht autorisierter Befehle in etwas, das eigentlich nur Daten enthalten sollte), der gleichen Kernidee wie bei älteren Angriffen wie SQL-Injection.
Nein. Jailbreaking zielt gezielt auf die Sicherheit eines Models ab. guardrails um es dazu zu bringen, unzulässige Inhalte zu erzeugen. Die Eingabeaufforderung ist umfassender: Sie kapert die Aufgaben oder Anweisungen des Modells, die möglicherweise überhaupt nichts mit Sicherheitsfiltern zu tun haben.
Ja. Dies wird als indirekte Prompt-Injektion bezeichnet: Die schädliche Anweisung befindet sich in einem Dokument, einer Webseite oder einer Datei, die ein Modell oder Agent später liest, und wird automatisch ausgelöst, sobald dieser Inhalt verarbeitet wird.
Nein. Es nutzt die Art und Weise aus, wie ein Modell natürliche Sprache interpretiert, nicht einen Fehler im Anwendungscode. Genau das macht es so schwierig, es mit herkömmlichen Sicherheitstools zu beheben.