Prompt Injection Prompt Injection ist ein Angriff, bei dem in Daten, die ein KI-System verarbeitet, Anweisungen versteckt werden, die das Modell befolgt. Bei der indirekten Form stehen sie in einer Webseite, einer E-Mail oder einem hochgeladenen Dokument. Weil ein Sprachmodell nicht zwischen Anweisung und Inhalt unterscheiden kann, gibt es nach heutigem Stand keine vollständige technische Abwehr.
Kurz-Fakten
Direkt: über die Nutzereingabe. Indirekt: über verarbeitete Fremdinhalte
Das Modell trennt Anweisung und Daten nicht zuverlässig
Gefährlich wird es erst mit Rechten: Werkzeugzugriff, Versand, Datenabfluss
Wirksamste Gegenmaßnahme ist die Begrenzung dieser Rechte
Bedeutung in der Praxis
Solange ein System nur Text ausgibt, ist der Schaden begrenzt. Sobald es E-Mails versenden, Dateien lesen oder Bestellungen auslösen darf, wird aus dem Ärgernis ein Sicherheitsvorfall.
Die tragfähige Regel lautet deshalb: Geben Sie einem Modell keine Berechtigung, deren Missbrauch Sie nicht verkraften würden. Filter und Erkennungsregeln sind eine Ergänzung, keine Lösung.
Inhaber von SEO NW in Bertingen. Arbeitet an der Schnittstelle von Suchmaschinenoptimierung und angewandter künstlicher Intelligenz: Prompt Engineering, Retrieval-Augmented Generation und die Frage, unter welchen Bedingungen ein Sprachmodell einen Inhalt übernimmt und der richtigen Quelle zuschreibt.