· KI  · 11 Min. Lesezeit

Datenklassifizierung: Warum feste Zugriffsstufen zuverlässiger sind als Prompt-Filter

Ein KI-System, das jeden Prompt auf sensible Inhalte prüft, verlässt sich auf Erkennung. Ein System, das Zugriffsrechte vorher festlegt, braucht keine. Warum der Unterschied bei der Datenwege-Prüfung zählt.

Ein KI-System, das jeden Prompt auf sensible Inhalte prüft, verlässt sich auf Erkennung. Ein System, das Zugriffsrechte vorher festlegt, braucht keine. Warum der Unterschied bei der Datenwege-Prüfung zählt.

Datenklassifizierung statt Prompt-Filter.

Datenklassifizierung heißt: Jede Datei und E-Mail bekommt eine Einstufung ihrer Vertraulichkeit, in Microsoft 365 als Sensitivity Label. Trägt das Label Verschlüsselung, legt es fest, wer den Inhalt lesen und entnehmen darf. Die Zugriffsstufe steht damit an der Datei fest, bevor jemand einen Prompt schreibt. Ein Prompt-Filter arbeitet umgekehrt: Er muss sensible Inhalte bei jeder neuen Formulierung erst erkennen. Beide Mechanismen stecken oft im selben Produkt. Nur einer davon lässt sich mit Ja oder Nein prüfen.

Ein Forschungsteam hat 2025 mehrere kommerzielle Filter für Prompt Injection und Jailbreaks ausgetrickst. Das Werkzeug: einfache Zeichentricks und automatisiertes Umformulieren. Betroffen waren unter anderem Microsofts Azure Prompt Shield und Metas Prompt Guard. Erfolgsquote der Umgehung: bis zu 100 Prozent, je nach System. Das ist kein Ausreißer eines einzelnen Labors. Kein System auf Lakeras öffentlicher PINT-Rangliste kommt ohne Fehler durch den Testsatz. Das ist das Muster bei Filtern, die freien Text in Echtzeit bewerten müssen.

Für eine Datenwege-Prüfung ist das keine Randnotiz. Die Frage “Was verhindert, dass Copilot vertrauliche Daten preisgibt?” hat zwei sehr unterschiedliche Antworten. Welche zutrifft, hängt davon ab, welchen Mechanismus man meint.

Zwei Wege, dieselbe Frage

Microsoft 365 Copilot selbst zeigt beide Wege nebeneinander. Der eine: Sensitivity Labels, die an einer Datei oder E-Mail hängen. Ein Label allein markiert nur die Einstufung. Erst ein Label mit Verschlüsselung legt Nutzungsrechte fest. Dann braucht ein Nutzer laut Microsofts eigener Dokumentation das Nutzungsrecht EXTRACT, zusätzlich zu VIEW, damit Copilot den Inhalt zurückgibt. Fehlt EXTRACT, fasst Copilot die Datei nicht zusammen und verweist nur per Link darauf. Microsoft nennt Ausnahmen. Die wichtigste: Copilot in Edge und in Windows kann verschlüsselten Inhalt aus dem aktiven Browser-Tab auch ohne EXTRACT heranziehen. Das gilt, solange keine DLP-Regel in Edge greift. Im Regelfall fragt diese Prüfung nicht, was im Prompt steht. Sie fragt, wer die Datei lesen und Text daraus entnehmen darf.

Der andere Weg: eine Data-Loss-Prevention-Richtlinie für die Position “Microsoft 365 Copilot und Copilot Chat”. Dieselbe Position kann zwar auch Dateien mit bestimmten Labels von der Verarbeitung ausschließen, das ist dann wieder der erste Weg. Die Erkennungs-Variante ist die Bedingung “Sensitive Information Types”: Sie durchsucht den Text, den ein Nutzer in den Prompt tippt, nach Mustern wie IBANs oder Sozialversicherungsnummern. Wird sie fündig, antwortet Copilot nicht. Laut Microsoft ist diese Prompt-Sperre noch in der Vorschau, und hochgeladene Dateien prüft sie nicht, nur den getippten Text. Das ist Erkennung in Echtzeit an frei formuliertem Text, geschrieben von genau der Person, die der Filter prüfen soll.

Die beiden Wege beantworten nicht dieselbe Bedrohung. Das Label mit Nutzungsrechten regelt, was Copilot aus der Ablage preisgibt: an wen, aus welcher Datei. Die Prompt-Sperre regelt, was ein Nutzer selbst in den Prompt tippt, etwa eine Kundennummer aus dem Kopf. Für diesen zweiten Fall greift kein Dateilabel, weil keine Datei im Spiel ist. Die Frage dieses Beitrags ist die erste: Was verhindert, dass Copilot vertrauliche Inhalte aus der Ablage zurückgibt?

Beide Wege existieren im selben Produkt, oft in derselben Konfiguration. Nur der erste ist eine feste Regel. Der zweite ist eine Wette auf die Erkennungsqualität eines Klassifikators.

Warum die Wette schlecht steht

Für Microsofts Prompt-Sperre gibt es keine öffentliche Messung. Für die Nachbarklasse gibt es eine: Filter, die Prompt Injection und Jailbreaks erkennen sollen, also ebenfalls freien Text in Echtzeit bewerten. Lakera betreibt dafür mit PINT eine öffentlich einsehbare Rangliste. Die Testbasis: 4.314 Fälle, darunter echte Angriffe, aber auch harmlose Sätze, die wie Angriffe klingen, um Fehlalarme zu messen. Der eigene Filter des Anbieters führt die Liste mit 95,22 Prozent an, gemessen im Mai 2025, auf einem Testsatz, den der Anbieter selbst zusammengestellt hat. Dahinter: Azure Prompt Shield bei 89,1 Prozent und Metas Prompt Guard 2 bei 78,8 Prozent. Googles Model Armor liegt bei 70,1 Prozent, das erste Prompt Guard bei 61,8. Selbst der Spitzenwert lässt knapp fünf Punkte offen. Weiter unten fehlen zehn bis fast vierzig.

Das sind Werte unter Testbedingungen, nicht unter aktivem Angriff. Die eingangs erwähnte Umgehungsstudie zeigt, was passiert, wenn jemand gezielt versucht, den Filter zu täuschen. Die wirksamste Technik, in Emojis versteckter Text, erreichte laut der Studie 100 Prozent Erfolg, bei Prompt Injections wie bei Jailbreaks.

Die Zahlen gelten für Injection-Filter, nicht für Microsofts Sensitive Information Types. Die funktionieren anders: musterbasiert, mit regulären Ausdrücken, Schlüsselwörtern und Prüfsummen statt eines trainierten Modells. Wie oft sie in einem Prompt danebenliegen, hat niemand öffentlich gemessen, in keine Richtung. Gemeinsam ist beiden der Ansatz. Sie bewerten Text, den genau die Person schreibt, die sie täuschen will, und sie finden nur, was ihrer Definition entspricht. Kein Erkenner, der auf Text im Prompt wartet, wird zuverlässiger als das Muster, das er sucht. Das ist keine Frage der Implementierung. Es ist eine Frage des Ansatzes.

Das Armband am Einlass, nicht der Türsteher, der jeden Satz mithört

Ein Sensitivity Label mit Verschlüsselung funktioniert wie ein Armband, das beim Einlass ausgegeben wird. Es steht vorher fest, wer welchen Bereich betreten darf. Was die Person später am Einlass sagt, ändert daran nichts. Ein Prompt-Filter funktioniert wie ein Türsteher, der jeden Satz eines Gastes live bewerten muss, um zu entscheiden, ob eine Formulierung gefährlich klingt. Der zweite Job ist strukturell schwerer, weil die Zahl möglicher Sätze unbegrenzt ist und der Gast ein Interesse daran hat, harmlos zu klingen.

Hier endet das Bild. Am Einlass bekommt jeder Gast ein Armband. Eine Datei bekommt ihr Sensitivity Label nur, wenn jemand es vergibt. Eine Datei ohne Label hat im Regelfall nur den Schutz ihrer Freigabeberechtigung. Wer sie öffnen darf, bekommt ihren Inhalt auch über Copilot, egal wie vertraulich er ist. Die Ausnahme ist Verschlüsselung ohne Label, etwa über Rights Management. Dann prüft Copilot laut Microsoft ebenfalls VIEW und EXTRACT, nur vererbt sich dieser Schutz nicht auf neue Inhalte. Die zusätzliche Schicht, die das Label bringt, gibt es für die unverschlüsselte Datei nicht. Die Klassifizierung ist die Voraussetzung, nicht das Ergebnis.

Für die Technik-Tiefe: was eine Datenwege-Prüfung belegen kann

Eine Prüfung, die Datenwege dokumentiert, sollte deshalb zwei kategorisch unterschiedliche Fragen trennen. Die erste ist belegbar. Welche Dateien tragen welches Label, welche dieser Labels bringen Verschlüsselung mit, wer hat darauf EXTRACT-Rechte, und stimmt diese Liste mit der gewünschten Berechtigungsstruktur überein? Das lässt sich gegen die Konfiguration prüfen, mit einem klaren Ja oder Nein je Datei. Was diese Prüfung nicht zeigt: ob die Einstufung stimmt. Eine vertrauliche Datei, die als unkritisch gelabelt wurde, sieht in der Konfiguration korrekt aus. Und wenn Labels automatisch vergeben werden, geschieht das laut Microsoft über dieselben Sensitive Information Types oder trainierte Klassifikatoren. Deren Erkennungsfehler landen dann im Label. Die feste Durchsetzung beseitigt sie nicht. Sie macht die Einstufung nur nachprüfbar, weil sie als Label an der Datei steht und nicht in einem Klassifikator zur Laufzeit.

Die zweite Frage ist nicht belegbar, sondern nur schätzbar: Wie oft erkennt die DLP-Richtlinie sensible Inhalte in einem frei formulierten Prompt korrekt? Jede Zahl dazu ist eine Momentaufnahme gegen einen bestimmten Testdatensatz, keine Garantie für den nächsten, noch nicht gesehenen Satz. Aussagen wie “der Filter verhindert das Durchsickern vertraulicher Daten” sind ohne Beleg für den konkreten Datenweg unzulässig. Das gilt unabhängig davon, wie gut der Filter in einem Test abgeschnitten hat.

Für die Praxis heißt das: Die DLP-Prüfung von Prompts ist ein zusätzliches Netz für den Fall, dass jemand sensible Angaben selbst eintippt. Für die Frage, was Copilot aus der Ablage preisgibt, ist sie kein Fundament. Das Fundament ist, ob die Daten überhaupt klassifiziert sind und ob die Einstufung stimmt, bevor ein KI-Werkzeug sie zu Gesicht bekommt. Eine Organisation, die viel Aufwand in Erkennungsregeln steckt, aber ihre Dateiablage nie klassifiziert hat, hat die schwerere Aufgabe gegen die leichtere getauscht.

Sie können jetzt erklären, warum ein DLP-Alarm für einen Copilot-Prompt keine Zugriffskontrolle ersetzt. Und Sie wissen, welche der beiden Fragen sich bei einer Datenwege-Prüfung mit Ja oder Nein beantworten lässt. Was aus einer belegten Berechtigungsstruktur folgt, wenn der Dienstleister wechselt, der sie verwaltet, ist die anschließende Frage. Dazu Was passiert, wenn der KI-Dienstleister wegfällt.

Häufige Fragen

Was bedeutet Datenklassifizierung bei KI-Werkzeugen wie Copilot? Dateien und E-Mails erhalten ein Sensitivity Label, das ihre Vertraulichkeit markiert. Ein Label kann nur markieren oder zusätzlich Verschlüsselung mit Nutzungsrechten mitbringen. Nur im zweiten Fall prüft Copilot vor der Ausgabe, ob der Nutzer den Inhalt entnehmen darf. Ohne Label gilt die normale Freigabeberechtigung der Datei; bei Verschlüsselung ohne Label prüft Copilot die dort gesetzten Nutzungsrechte.

Warum ist Erkennung sensibler Daten im Prompt keine zuverlässige Schutzmaßnahme? Prompt-Filter müssen freien Text in Echtzeit bewerten. Für Microsofts Prompt-Sperre gibt es keine öffentliche Messung. Für die Nachbarklasse der Prompt-Injection-Filter zeigt Lakeras PINT-Rangliste selbst beim besten System 95,22 Prozent, bei schwächeren deutlich weniger. Unter gezieltem Umgehungsversuch zeigt eine Studie von 2025 Erfolgsquoten von bis zu 100 Prozent gegen kommerzielle Systeme.

Was ist der Unterschied zwischen Sensitivity Labels und DLP-Richtlinien für Copilot? Sensitivity Labels mit Verschlüsselung regeln den Zugriff über Nutzungsrechte an der Datei. Copilot prüft sie, bevor es Inhalt daraus zurückgibt. DLP-Richtlinien für Copilot können den getippten Prompt-Text nach sensiblen Mustern durchsuchen und die Antwort blockieren, oder Dateien mit bestimmten Labels von der Verarbeitung ausschließen. Beide lassen sich parallel einsetzen, sie sichern aber unterschiedliche Fälle ab. Das Label regelt, was Copilot aus der Ablage preisgibt, die Prompt-Sperre, was ein Nutzer selbst eintippt.

Ersetzt eine Sensitivity-Label-Struktur die Prüfung der tatsächlichen Datenwege? Nein. Ein Label belegt nur, dass eine Datei eingestuft wurde. Eine Zugriffsregel gibt es erst, wenn das Label Verschlüsselung mit Nutzungsrechten trägt oder eine Richtlinie auf das Label reagiert. Ob die Einstufung stimmt, wie vollständig der Datenbestand klassifiziert ist und welche Datenwege ein KI-Dienst nutzt, sind weitere Fragen. Alle müssen geprüft werden.

Quellen


Verwandt: Residenz ist nicht Jurisdiktion und Copilot: Was das Admin Center zeigt.

Zurück zum Blog

Ähnliche Beiträge

Alle Beiträge ansehen »
Residenz ist nicht Jurisdiktion

Residenz ist nicht Jurisdiktion

Daten "in der EU gespeichert" klingt nach Schutz vor US-Zugriff. Das ist es nicht automatisch. Was CLOUD Act und FISA 702 bedeuten, und wann das für Ihr Unternehmen zählt.

Ist ein KI-Modell aus China ein Problem?

Ist ein KI-Modell aus China ein Problem?

Hinter der Frage stecken drei verschiedene Fragen: wohin die Daten gehen, wie sich das Modell verhält und was im Unternehmen erlaubt ist. Nur die erste löst sich über den Betriebsort.