Davies Meyer – Startseite
    AI3 Min. Lesezeit

    Prompt Injection

    Prompt Injection bezeichnet die Beeinflussung einer KI-Anwendung durch Eingaben, die ihr Verhalten vom vorgesehenen Auftrag ablenken. Solche Anweisungen können direkt eingegeben werden oder indirekt in verarbeiteten Webseiten, Dokumenten und anderen Inhalten stehen.

    Prompt Injection im Detail

    Ein Assistent soll ein Dokument zusammenfassen. Im Dokument steht zusätzlich eine Anweisung an das KI-System. Der kritische Unterschied: Der Inhalt ist Material für die Aufgabe, keine neue Berechtigung, den Auftrag zu ändern. Wenn die Anwendung diese Grenze nicht hält, kann daraus eine falsche Antwort oder eine unerlaubte Aktion entstehen.

    Das Problem betrifft nicht nur die Formulierung von Texten. Mit Zugriff auf Werkzeuge können auch Daten und Aktionen betroffen sein. Die möglichen Folgen hängen deshalb davon ab, was das System tatsächlich lesen, verändern oder weitergeben darf.

    Eine sinnvolle Umsetzung trennt Auftrag und fremde Inhalte und begrenzt den Zugriff auf das für die Aufgabe Nötige. Rechte müssen im System durchgesetzt werden. Zusätzliche Prüfungen und Freigaben können bestimmte Folgen begrenzen; keine einzelne Prompt-Formulierung ist eine universelle Lösung.

    Prüfe die Anwendung mit kontrollierten Beispielen in einer geeigneten Testumgebung. Entscheidend ist, ob sie den erlaubten Auftrag weiterhin erfüllt und unerwünschte Aktionen verhindert. Eine hohe Abwehrquote bei einem begrenzten Testset ist kein Beleg für Sicherheit gegen jede zukünftige Variante.

    Beispiele

    Hypothetisches Anwendungsbeispiel

    Ein Rechercheassistent erhält eine Testseite mit sachlichen Produktinformationen und einer widersprüchlichen Anweisung an das System. Er soll die Fakten für seine Aufgabe verwenden, die fremde Anweisung aber nicht als Auftrag behandeln. Geprüft werden die Antwort und mögliche Aktionen, nicht nur ein Warnhinweis.

    Wichtige Punkte

    • Fremder Inhalt darf den Auftrag nicht eigenständig erweitern.
    • Die Folgen hängen von Datenzugang und erlaubten Aktionen ab.
    • Mehrere Schutzmaßnahmen und technische Rechte kombinieren.
    • Testergebnisse mit ihrem Umfang und ihren Grenzen dokumentieren.

    Anwendung im Marketing-Alltag

    Erfasse, welche externen Inhalte eine KI-Anwendung verarbeitet und welche Aktionen sie auslösen kann. Lege die Grenzen fest und prüfe ihre Einhaltung mit kontrollierten Testfällen. Dokumentiere beobachtete Fehler und die Wirkung konkreter Gegenmaßnahmen.

    Sinnvolle Messgrößen

    Auftragstreue im Test

    Ob der erlaubte Auftrag trotz manipulierter Testinhalte erfüllt wird.

    Unzulässige Aktionen

    Beobachtete Versuche oder tatsächliche Ausführungen außerhalb der festgelegten Grenzen.

    Testabdeckung und Fehlalarme

    Geprüfte Inhaltsarten und Situationen sowie legitime Aufgaben, die unnötig blockiert werden.

    Häufige Fehler

    • Nur direkte Nutzereingaben prüfen und externe Inhalte ausblenden.
    • Ein Abwehrversprechen im Prompt mit wirksamer Zugriffskontrolle gleichsetzen.
    • Ein erfolgreiches Einzelbeispiel als vollständigen Sicherheitsnachweis verwenden.

    Quellen und Einordnung

    Häufige Fragen zu Prompt Injection

    Die beeinflussende Anweisung kommt über Material in die Anwendung, etwa eine Webseite oder Datei, statt als unmittelbarer Auftrag des Nutzers. Die Anwendung muss den Inhalt bearbeiten können, ohne ihn als übergeordnete Anweisung zu behandeln.

    Begriffsempfehlungen werden geladen…

    Alle Begriffe