· KI  · 9 Min. Lesezeit

Ist ein KI-Modell aus China ein Problem?

Hinter der Frage stecken drei verschiedene Fragen: wohin die Daten gehen, wie sich das Modell verhält und was im Unternehmen erlaubt ist. Nur die erste löst sich über den Betriebsort.

Hinter der Frage stecken drei verschiedene Fragen: wohin die Daten gehen, wie sich das Modell verhält und was im Unternehmen erlaubt ist. Nur die erste löst sich über den Betriebsort.

Ob ein chinesisches KI-Modell ein Problem ist, hängt davon ab, welche von drei Fragen gemeint ist.

Erstens: Wohin gehen die Daten? Das entscheidet der Betreiber, nicht der Entwickler des Modells. Zweitens: Wie verhält sich das Modell? Das steckt in den Gewichten und ändert sich durch den Betriebsort nicht. Drittens: Was ist im Unternehmen erlaubt? Das ist eine Vorgabe, keine technische Frage. Wer die drei trennt, kann jede einzeln beantworten.

Am 27. Juni 2025 meldete die Berliner Datenschutzbeauftragte die DeepSeek-App bei Apple und Google als rechtswidrigen Inhalt. Der Grund: Die App schickt Eingaben, Chatverläufe und hochgeladene Dateien auf Server in China.

Im Oktober 2025 nahm Amazon das Modell Qwen3 des chinesischen Konzerns Alibaba in Frankfurt ins Angebot. Anfragen an dieses Modell bleiben laut Modellkarte von AWS in der Region.

Beide Male geht es um “ein Modell aus China”. Es sind aber zwei verschiedene Fälle. Wer auf “Ist das ein Problem?” pauschal Ja oder Nein sagt, wirft sie zusammen.

Frage 1: Wohin gehen die Daten?

Ein offenes Sprachmodell ist erst einmal eine Datei. Sie enthält die gelernten Zahlen des Modells, die Gewichte. Das übliche Format heißt safetensors. Es führt beim Laden keinen Code aus, dafür wurde es entworfen. Die Datei ruft nirgendwo an. Manche Modelle bringen zusätzlich eigenen Code mit. Die verbreitete Bibliothek transformers führt ihn nur aus, wenn man es ausdrücklich erlaubt. Genau diese Freigabe gehört in jede Prüfung. Wer die Gewichte auf einem eigenen Server oder im eigenen Cloud-Konto betreibt, schickt dem Entwickler nichts.

Ganz anders die App oder die Schnittstelle des Anbieters selbst. DeepSeek schreibt in der eigenen Datenschutzerklärung, dass Daten über Personen in China erhoben, verarbeitet und gespeichert werden. Die Berliner Behörde verwies auch auf das Recht dort. Ihr Satz dazu: “Chinesische Behörden haben weitreichende Zugriffsrechte auf personenbezogene Daten im Einflussbereich chinesischer Unternehmen.”

Für die erste Frage zählt also, wer das Modell betreibt. Wer es entwickelt hat, zählt nicht. Läuft es bei Amazon in Frankfurt, gilt für den Datenweg dasselbe wie für jedes andere Modell dort. Welche Region gilt und ob Anfragen weitergehen, steht in den Einstellungen und Unterlagen des Anbieters. Dort prüft man es. Wo die Daten liegen und wer darauf zugreifen darf, sind außerdem zwei verschiedene Dinge. Mehr dazu steht in Residenz ist nicht Jurisdiktion.

Frage 2: Wie verhält sich das Modell?

Hier hilft der Betriebsort nicht. Was ein Modell im Training gelernt hat, läuft auf jedem Server mit.

Das zeigt eine Untersuchung des US-Instituts NIST vom September 2025. Getestet wurden drei DeepSeek-Modelle. NIST nutzte dafür nicht DeepSeeks Schnittstelle. Die Gewichte kamen von der Plattform Hugging Face und liefen auf eigenen Servern. Einige Ergebnisse:

  • Politische Zensur: NIST stellte 190 Fragen zu chinesischer Geschichte und Politik. Gezählt wurde, wie viele bekannte irreführende Positionen der Kommunistischen Partei ein Modell wiedergab. Bei DeepSeek V3.1 waren es auf Englisch 5 Prozent, auf Chinesisch 12 Prozent. Die US-Vergleichsmodelle lagen bei 2 und 3 Prozent. NIST folgert, die Zensur sei direkt in die Modelle eingebaut.
  • Jailbreaks: Das am besten abgesicherte DeepSeek-Modell erfüllte 94 Prozent offen schädlicher Anfragen, wenn diese mit bekannten Umgehungstricks gestellt wurden. Bei den US-Vergleichsmodellen waren es 8 Prozent.
  • Übernahme von Agenten: Versteckte, schädliche Anweisungen lenkten Agenten mit diesem Modell im Schnitt zwölfmal so oft um wie die US-Spitzenmodelle GPT-5 und Opus 4.

Zwei Einschränkungen gehören dazu. Erstens ist NIST eine US-Behörde. Den Auftrag gab die US-Regierung mit ihrem KI-Aktionsplan, ausdrücklich mit Blick auf KI-Systeme von Gegnern der USA. Zweitens liefen die US-Modelle über die Schnittstellen ihrer Anbieter, die DeepSeek-Modelle auf eigenen Servern. Der Vergleich misst also Modell plus Umgebung. In der späteren Prüfung von GLM-5.2 sagt NIST das deutlich: Die US-Modelle hatten die Schutzfilter ihrer Anbieter, die chinesischen nicht. Dort steht auch, dass sich Schutzmechanismen offener Modelle beim Selbstbetrieb umgehen lassen. Das gilt für jedes offene Modell, egal aus welchem Land.

Und die Modelle unterscheiden sich stark. Im Juli 2026 prüfte NIST das GLM-5.2 von Z.ai. Laut Bericht hielt es Jailbreaks und Übernahmen womöglich besser stand als die anderen geprüften Modelle aus China. “Chinesisch” ist deshalb keine Eigenschaft, die man messen kann. Messen lässt sich ein bestimmtes Modell an einer bestimmten Aufgabe.

Welche dieser Schwächen zählt, hängt vom Einsatz ab. Ein Modell, das Rechnungsdaten aus PDFs zieht, bekommt die politischen Fragen aus dem NIST-Test nicht gestellt. Ob es Rechnungen zuverlässig liest, sagt der Test aber auch nicht. Das zeigt nur eine eigene Messung. Ein Agent dagegen, der E-Mails liest und Werkzeuge bedienen darf, ist genau dort verwundbar, wo die Übernahme-Tests ansetzen. Für ihn wiegt dieser Wert schwerer als jede Herkunftsfrage.

Und versteckte Hintertüren?

Die unbequemste Frage lautet: Kann ein Modell absichtlich eingebaute Fehlfunktionen haben, die nur bei einem bestimmten Auslöser auftreten? Die ehrliche Antwort ist ja. Forscher von Anthropic haben 2024 gezeigt, dass sich solche Hintertüren in Sprachmodelle trainieren lassen. Übliches Sicherheitstraining entfernt sie nicht zuverlässig. In ihrem Versuch schrieb ein Modell sicheren Programmcode, bis ein bestimmtes Jahr im Text stand, und danach angreifbaren. Durch Testfragen allein findet man so etwas kaum. Eine Folgearbeit erkannte die Hintertüren in den eigenen Versuchsmodellen über die inneren Rechenwerte. Die Forscher schreiben aber selbst, dass das auch an ihrer Art lag, die Hintertür einzubauen.

Das betrifft jedes Modell, dessen Training man nicht selbst kontrolliert, also praktisch alle. Die sinnvolle Antwort ist deshalb nicht die Herkunftsprüfung, sondern der Aufbau um das Modell herum. Und der hat zwei Teile.

Der erste betrifft den Abfluss. Das Modell selbst erzeugt nur Text. Welche Daten es sieht, welche Werkzeuge es bedienen darf und welche Netzverbindungen die Anwendung hat, entscheidet der Betreiber. Ein Modell ohne Werkzeuge und ohne Netzverbindung kann auch mit einer Hintertür nichts verschicken.

Der zweite betrifft die Ergebnisse. Gegen eine gezielt falsche Antwort hilft kein Netzwerkschutz. Hier hilft nur, Ergebnisse zu prüfen, bevor sie wirken: Code wird gegengelesen, Auszüge werden stichprobenhaft verglichen, und was Folgen hat, gibt ein Mensch frei.

Frage 3: Was ist im Unternehmen erlaubt?

Manchmal ist die Antwort schlicht Nein. Ein Kunde verlangt es im Vertrag, der Konzern gibt es vor, der Einkauf hat eine Liste. Das ist eine legitime Entscheidung. Sie braucht keine technische Begründung.

Dann hilft es, das Modell als austauschbares Bauteil zu behandeln statt als Vertrauensfrage. Welche Modelle erlaubt sind, ist eine feste Regel. Die offene Frage lautet danach nur noch: Wie gut erledigt das beste erlaubte Modell die eigenen Aufgaben? Offene Modelle aus Europa und den USA gibt es. Beispiele sind die Modelle von Mistral oder gpt-oss von OpenAI. Letzteres nutzte NIST selbst als Vergleich.

Wie groß der Abstand zum ausgeschlossenen Modell ist, lässt sich an eigenen Beispielen messen. Bei Routine ist er zwischen guten Modellen oft klein. Bei schwierigen Aufgaben mit vielen Denkschritten ist er größer. Das haben wir in Die Qualitätslücke offener KI-Modelle beschrieben. Wie groß der eigene Anteil an Routine ist, steht in Welcher Anteil Ihrer KI-Aufgaben braucht das teuerste Modell.

Aus einer Grundsatzfrage wird so eine Messung mit Ergebnis. Und wenn die Vorgabe sich später ändert, tauscht man ein Bauteil aus, nicht die ganze Lösung.

Drei Fragen vor der Modellwahl

  • Wer betreibt das Modell, und in welchem Rechtsraum? Das entscheidet über den Datenweg, nicht die Herkunft des Modells.
  • Welche Schwächen des konkreten Modells treffen die konkrete Aufgabe? Bei einem Agenten mit Werkzeugen zählt die Anfälligkeit für Übernahme. Bei der Rechnungserfassung zählt, ob Beträge richtig gelesen werden. Beides misst man an eigenen Beispielen.
  • Was ist erlaubt, und wie gut ist das beste erlaubte Modell? Das ist eine Vorgabe plus eine Messung, keine Glaubensfrage.

Häufige Fragen

Gehen meine Daten nach China, wenn ich ein chinesisches KI-Modell nutze? Das hängt davon ab, wer das Modell betreibt. Wer die App oder die Schnittstelle des chinesischen Anbieters nutzt, schickt seine Eingaben dorthin; DeepSeek speichert laut eigener Datenschutzerklärung in China. Wer die offenen Gewichte selbst betreibt, schickt dem Entwickler nichts. Wer sie bei einem Cloud-Anbieter abruft, prüft dessen Datenweg: Bei Amazon Bedrock in Frankfurt etwa bleiben Anfragen an Qwen3 laut Modellkarte in der Region. Dann gilt der Rechtsraum des Betreibers.

Ist ein selbst betriebenes chinesisches Modell also unbedenklich? Nicht automatisch. Der Betriebsort klärt den Datenweg, nicht das Verhalten. Das US-Institut NIST hat DeepSeek-Modelle auf eigenen Servern getestet und Zensur sowie eine höhere Anfälligkeit für Jailbreaks gemessen. Solches Verhalten steckt in den Gewichten und läuft mit. Ob es für die eigene Aufgabe eine Rolle spielt, zeigt nur eine Messung an eigenen Beispielen.

Was tun, wenn chinesische Modelle im Unternehmen nicht erlaubt sind? Die Vorgabe als feste Regel behandeln und das Modell als austauschbares Bauteil. Die Frage lautet dann nicht mehr, ob man einem Modell vertraut, sondern wie gut das beste erlaubte Modell die eigenen Aufgaben erledigt. Das lässt sich an eigenen Beispielen messen.

Quellen


Verwandt: Residenz ist nicht Jurisdiktion, Die Qualitätslücke offener KI-Modelle, ehrlich beziffert und Was passiert, wenn der KI-Dienstleister wegfällt.

Zurück zum Blog

Ähnliche Beiträge

Alle Beiträge ansehen »
Die Qualitätslücke offener KI-Modelle, ehrlich beziffert

Die Qualitätslücke offener KI-Modelle, ehrlich beziffert

Im Juni knackte ein offenes Modell erstmals die 50-Punkte-Marke im wichtigsten unabhängigen KI-Ranking, sechs Wochen später rückte ein zweites bis auf drei Punkte an die Spitze heran. Warum die Durchschnittszahl für die eigene Entscheidung trotzdem fast irrelevant ist.

Welcher Anteil der KI-Aufgaben braucht das teuerste Modell

Welcher Anteil der KI-Aufgaben braucht das teuerste Modell

Ein Entwicklerteam bei Vercel lässt inzwischen ein Viertel bis ein Drittel seiner Pull Requests von einem Agenten schreiben. Der genaue Anteil ist nicht die interessante Zahl. Interessant ist, dass jemand ihn überhaupt gemessen hat.