· KI · 11 Min. Lesezeit
Datenklassifizierung: Warum feste Zugriffsstufen zuverlässiger sind als Prompt-Filter
Ein KI-System, das jeden Prompt auf sensible Inhalte prüft, verlässt sich auf Erkennung. Ein System, das Zugriffsrechte vorher festlegt, braucht keine. Warum der Unterschied bei der Datenwege-Prüfung zählt.

Datenklassifizierung statt Prompt-Filter.
Datenklassifizierung heißt: Jede Datei und E-Mail bekommt eine Einstufung ihrer Vertraulichkeit, in Microsoft 365 als Sensitivity Label. Trägt das Label Verschlüsselung, legt es fest, wer den Inhalt lesen und entnehmen darf. Die Zugriffsstufe steht damit an der Datei fest, bevor jemand einen Prompt schreibt. Ein Prompt-Filter arbeitet umgekehrt: Er muss sensible Inhalte bei jeder neuen Formulierung erst erkennen. Beide Mechanismen stecken oft im selben Produkt. Nur einer davon lässt sich mit Ja oder Nein prüfen.
Ein Forschungsteam hat 2025 mehrere kommerzielle Filter für Prompt Injection und Jailbreaks ausgetrickst. Das Werkzeug: einfache Zeichentricks und automatisiertes Umformulieren. Betroffen waren unter anderem Microsofts Azure Prompt Shield und Metas Prompt Guard. Erfolgsquote der Umgehung: bis zu 100 Prozent, je nach System. Das ist kein Ausreißer eines einzelnen Labors. Kein System auf Lakeras öffentlicher PINT-Rangliste kommt ohne Fehler durch den Testsatz. Das ist das Muster bei Filtern, die freien Text in Echtzeit bewerten müssen.
Für eine Datenwege-Prüfung ist das keine Randnotiz. Die Frage “Was verhindert, dass Copilot vertrauliche Daten preisgibt?” hat zwei sehr unterschiedliche Antworten. Welche zutrifft, hängt davon ab, welchen Mechanismus man meint.
Zwei Wege, dieselbe Frage
Microsoft 365 Copilot selbst zeigt beide Wege nebeneinander. Der eine: Sensitivity Labels, die an einer Datei oder E-Mail hängen. Ein Label allein markiert nur die Einstufung. Erst ein Label mit Verschlüsselung legt Nutzungsrechte fest. Dann braucht ein Nutzer laut Microsofts eigener Dokumentation das Nutzungsrecht EXTRACT, zusätzlich zu VIEW, damit Copilot den Inhalt zurückgibt. Fehlt EXTRACT, fasst Copilot die Datei nicht zusammen und verweist nur per Link darauf. Microsoft nennt Ausnahmen. Die wichtigste: Copilot in Edge und in Windows kann verschlüsselten Inhalt aus dem aktiven Browser-Tab auch ohne EXTRACT heranziehen. Das gilt, solange keine DLP-Regel in Edge greift. Im Regelfall fragt diese Prüfung nicht, was im Prompt steht. Sie fragt, wer die Datei lesen und Text daraus entnehmen darf.
Der andere Weg: eine Data-Loss-Prevention-Richtlinie für die Position “Microsoft 365 Copilot und Copilot Chat”. Dieselbe Position kann zwar auch Dateien mit bestimmten Labels von der Verarbeitung ausschließen, das ist dann wieder der erste Weg. Die Erkennungs-Variante ist die Bedingung “Sensitive Information Types”: Sie durchsucht den Text, den ein Nutzer in den Prompt tippt, nach Mustern wie IBANs oder Sozialversicherungsnummern. Wird sie fündig, antwortet Copilot nicht. Laut Microsoft ist diese Prompt-Sperre noch in der Vorschau, und hochgeladene Dateien prüft sie nicht, nur den getippten Text. Das ist Erkennung in Echtzeit an frei formuliertem Text, geschrieben von genau der Person, die der Filter prüfen soll.
Die beiden Wege beantworten nicht dieselbe Bedrohung. Das Label mit Nutzungsrechten regelt, was Copilot aus der Ablage preisgibt: an wen, aus welcher Datei. Die Prompt-Sperre regelt, was ein Nutzer selbst in den Prompt tippt, etwa eine Kundennummer aus dem Kopf. Für diesen zweiten Fall greift kein Dateilabel, weil keine Datei im Spiel ist. Die Frage dieses Beitrags ist die erste: Was verhindert, dass Copilot vertrauliche Inhalte aus der Ablage zurückgibt?
Beide Wege existieren im selben Produkt, oft in derselben Konfiguration. Nur der erste ist eine feste Regel. Der zweite ist eine Wette auf die Erkennungsqualität eines Klassifikators.
Warum die Wette schlecht steht
Für Microsofts Prompt-Sperre gibt es keine öffentliche Messung. Für die Nachbarklasse gibt es eine: Filter, die Prompt Injection und Jailbreaks erkennen sollen, also ebenfalls freien Text in Echtzeit bewerten. Lakera betreibt dafür mit PINT eine öffentlich einsehbare Rangliste. Die Testbasis: 4.314 Fälle, darunter echte Angriffe, aber auch harmlose Sätze, die wie Angriffe klingen, um Fehlalarme zu messen. Der eigene Filter des Anbieters führt die Liste mit 95,22 Prozent an, gemessen im Mai 2025, auf einem Testsatz, den der Anbieter selbst zusammengestellt hat. Dahinter: Azure Prompt Shield bei 89,1 Prozent und Metas Prompt Guard 2 bei 78,8 Prozent. Googles Model Armor liegt bei 70,1 Prozent, das erste Prompt Guard bei 61,8. Selbst der Spitzenwert lässt knapp fünf Punkte offen. Weiter unten fehlen zehn bis fast vierzig.
Das sind Werte unter Testbedingungen, nicht unter aktivem Angriff. Die eingangs erwähnte Umgehungsstudie zeigt, was passiert, wenn jemand gezielt versucht, den Filter zu täuschen. Die wirksamste Technik, in Emojis versteckter Text, erreichte laut der Studie 100 Prozent Erfolg, bei Prompt Injections wie bei Jailbreaks.
Die Zahlen gelten für Injection-Filter, nicht für Microsofts Sensitive Information Types. Die funktionieren anders: musterbasiert, mit regulären Ausdrücken, Schlüsselwörtern und Prüfsummen statt eines trainierten Modells. Wie oft sie in einem Prompt danebenliegen, hat niemand öffentlich gemessen, in keine Richtung. Gemeinsam ist beiden der Ansatz. Sie bewerten Text, den genau die Person schreibt, die sie täuschen will, und sie finden nur, was ihrer Definition entspricht. Kein Erkenner, der auf Text im Prompt wartet, wird zuverlässiger als das Muster, das er sucht. Das ist keine Frage der Implementierung. Es ist eine Frage des Ansatzes.
Das Armband am Einlass, nicht der Türsteher, der jeden Satz mithört
Ein Sensitivity Label mit Verschlüsselung funktioniert wie ein Armband, das beim Einlass ausgegeben wird. Es steht vorher fest, wer welchen Bereich betreten darf. Was die Person später am Einlass sagt, ändert daran nichts. Ein Prompt-Filter funktioniert wie ein Türsteher, der jeden Satz eines Gastes live bewerten muss, um zu entscheiden, ob eine Formulierung gefährlich klingt. Der zweite Job ist strukturell schwerer, weil die Zahl möglicher Sätze unbegrenzt ist und der Gast ein Interesse daran hat, harmlos zu klingen.
Hier endet das Bild. Am Einlass bekommt jeder Gast ein Armband. Eine Datei bekommt ihr Sensitivity Label nur, wenn jemand es vergibt. Eine Datei ohne Label hat im Regelfall nur den Schutz ihrer Freigabeberechtigung. Wer sie öffnen darf, bekommt ihren Inhalt auch über Copilot, egal wie vertraulich er ist. Die Ausnahme ist Verschlüsselung ohne Label, etwa über Rights Management. Dann prüft Copilot laut Microsoft ebenfalls VIEW und EXTRACT, nur vererbt sich dieser Schutz nicht auf neue Inhalte. Die zusätzliche Schicht, die das Label bringt, gibt es für die unverschlüsselte Datei nicht. Die Klassifizierung ist die Voraussetzung, nicht das Ergebnis.
Für die Technik-Tiefe: was eine Datenwege-Prüfung belegen kann
Eine Prüfung, die Datenwege dokumentiert, sollte deshalb zwei kategorisch unterschiedliche Fragen trennen. Die erste ist belegbar. Welche Dateien tragen welches Label, welche dieser Labels bringen Verschlüsselung mit, wer hat darauf EXTRACT-Rechte, und stimmt diese Liste mit der gewünschten Berechtigungsstruktur überein? Das lässt sich gegen die Konfiguration prüfen, mit einem klaren Ja oder Nein je Datei. Was diese Prüfung nicht zeigt: ob die Einstufung stimmt. Eine vertrauliche Datei, die als unkritisch gelabelt wurde, sieht in der Konfiguration korrekt aus. Und wenn Labels automatisch vergeben werden, geschieht das laut Microsoft über dieselben Sensitive Information Types oder trainierte Klassifikatoren. Deren Erkennungsfehler landen dann im Label. Die feste Durchsetzung beseitigt sie nicht. Sie macht die Einstufung nur nachprüfbar, weil sie als Label an der Datei steht und nicht in einem Klassifikator zur Laufzeit.
Die zweite Frage ist nicht belegbar, sondern nur schätzbar: Wie oft erkennt die DLP-Richtlinie sensible Inhalte in einem frei formulierten Prompt korrekt? Jede Zahl dazu ist eine Momentaufnahme gegen einen bestimmten Testdatensatz, keine Garantie für den nächsten, noch nicht gesehenen Satz. Aussagen wie “der Filter verhindert das Durchsickern vertraulicher Daten” sind ohne Beleg für den konkreten Datenweg unzulässig. Das gilt unabhängig davon, wie gut der Filter in einem Test abgeschnitten hat.
Für die Praxis heißt das: Die DLP-Prüfung von Prompts ist ein zusätzliches Netz für den Fall, dass jemand sensible Angaben selbst eintippt. Für die Frage, was Copilot aus der Ablage preisgibt, ist sie kein Fundament. Das Fundament ist, ob die Daten überhaupt klassifiziert sind und ob die Einstufung stimmt, bevor ein KI-Werkzeug sie zu Gesicht bekommt. Eine Organisation, die viel Aufwand in Erkennungsregeln steckt, aber ihre Dateiablage nie klassifiziert hat, hat die schwerere Aufgabe gegen die leichtere getauscht.
Sie können jetzt erklären, warum ein DLP-Alarm für einen Copilot-Prompt keine Zugriffskontrolle ersetzt. Und Sie wissen, welche der beiden Fragen sich bei einer Datenwege-Prüfung mit Ja oder Nein beantworten lässt. Was aus einer belegten Berechtigungsstruktur folgt, wenn der Dienstleister wechselt, der sie verwaltet, ist die anschließende Frage. Dazu Was passiert, wenn der KI-Dienstleister wegfällt.
Häufige Fragen
Was bedeutet Datenklassifizierung bei KI-Werkzeugen wie Copilot? Dateien und E-Mails erhalten ein Sensitivity Label, das ihre Vertraulichkeit markiert. Ein Label kann nur markieren oder zusätzlich Verschlüsselung mit Nutzungsrechten mitbringen. Nur im zweiten Fall prüft Copilot vor der Ausgabe, ob der Nutzer den Inhalt entnehmen darf. Ohne Label gilt die normale Freigabeberechtigung der Datei; bei Verschlüsselung ohne Label prüft Copilot die dort gesetzten Nutzungsrechte.
Warum ist Erkennung sensibler Daten im Prompt keine zuverlässige Schutzmaßnahme? Prompt-Filter müssen freien Text in Echtzeit bewerten. Für Microsofts Prompt-Sperre gibt es keine öffentliche Messung. Für die Nachbarklasse der Prompt-Injection-Filter zeigt Lakeras PINT-Rangliste selbst beim besten System 95,22 Prozent, bei schwächeren deutlich weniger. Unter gezieltem Umgehungsversuch zeigt eine Studie von 2025 Erfolgsquoten von bis zu 100 Prozent gegen kommerzielle Systeme.
Was ist der Unterschied zwischen Sensitivity Labels und DLP-Richtlinien für Copilot? Sensitivity Labels mit Verschlüsselung regeln den Zugriff über Nutzungsrechte an der Datei. Copilot prüft sie, bevor es Inhalt daraus zurückgibt. DLP-Richtlinien für Copilot können den getippten Prompt-Text nach sensiblen Mustern durchsuchen und die Antwort blockieren, oder Dateien mit bestimmten Labels von der Verarbeitung ausschließen. Beide lassen sich parallel einsetzen, sie sichern aber unterschiedliche Fälle ab. Das Label regelt, was Copilot aus der Ablage preisgibt, die Prompt-Sperre, was ein Nutzer selbst eintippt.
Ersetzt eine Sensitivity-Label-Struktur die Prüfung der tatsächlichen Datenwege? Nein. Ein Label belegt nur, dass eine Datei eingestuft wurde. Eine Zugriffsregel gibt es erst, wenn das Label Verschlüsselung mit Nutzungsrechten trägt oder eine Richtlinie auf das Label reagiert. Ob die Einstufung stimmt, wie vollständig der Datenbestand klassifiziert ist und welche Datenwege ein KI-Dienst nutzt, sind weitere Fragen. Alle müssen geprüft werden.
Quellen
- Sensitivity Labels, EXTRACT- und VIEW-Nutzungsrecht, bestehende Berechtigungen als Grundschutz auch ohne Label; Verschlüsselung ohne Label (Azure Rights Management) wird ebenfalls auf VIEW und EXTRACT geprüft, ohne Vererbung des Schutzes: Microsoft Learn, Use Microsoft Purview to manage data security & compliance for Microsoft 365 Copilot (Stand 25.06.2026).
- Labels können ohne Schutzeinstellungen nur einstufen; Verschlüsselung mit Nutzungsrechten ist eine Konfiguration des Labels: Microsoft Learn, Learn about sensitivity labels (Stand 25.06.2026).
- Ohne EXTRACT keine Zusammenfassung, nur Verweis per Link; Ausnahme Copilot in Edge und Windows, das verschlüsselten Inhalt aus dem aktiven Browser-Tab ohne EXTRACT referenzieren kann, sofern keine DLP-Regel in Edge greift: Microsoft Learn, Considerations for Microsoft Purview to manage Microsoft 365 Copilot (Stand 30.06.2026).
- DLP-Position “Microsoft 365 Copilot und Copilot Chat”: Bedingungen Sensitive Information Types (nur getippter Prompt-Text, hochgeladene Dateien nicht geprüft, Prompt-Sperre in der Vorschau) und Sensitivity Labels (Ausschluss von der Verarbeitung): Microsoft Learn, Microsoft Purview DLP for Microsoft 365 Copilot and Copilot Chat (Stand 17.09.2026).
- Sensitive Information Types als musterbasierte Klassifikatoren (reguläre Ausdrücke, Schlüsselwörter, Prüfsummen, Konfidenzstufen): Microsoft Learn, Learn about sensitive information types (Stand 05.08.2026).
- Automatische Labelvergabe nutzt Sensitive Information Types oder trainierbare Klassifikatoren als Bedingung: Microsoft Learn, Automatically apply a sensitivity label to Microsoft 365 data (Stand 22.09.2026).
- PINT-Rangliste, 4.314 Testfälle: Lakera Guard 95,22 %, Azure AI Prompt Shield 89,1 %, Llama Prompt Guard 2 78,8 %, Llama Prompt Guard 61,8 % (jeweils Mai 2025), Google Model Armor 70,1 % (27.08.2025); die Prompt-Guard-Werte beziehen sich laut Lakera nur auf Jailbreak-Erkennung: GitHub, lakeraai/pint-benchmark.
- Umgehung von sechs Erkennungssystemen, darunter Azure Prompt Shield und Meta Prompt Guard, per Zeicheninjektion und adversarialer Umformulierung, bis zu 100 % Erfolgsquote (Emoji Smuggling): Hackett, Birch, Trawicki, Suri, Garraghan, Bypassing LLM Guardrails: An Empirical Analysis of Evasion Attacks against Prompt Injection and Jailbreak Detection Systems, arXiv:2504.11168, eingereicht 15.04.2025, revidiert 14.07.2025.
Verwandt: Residenz ist nicht Jurisdiktion und Copilot: Was das Admin Center zeigt.



