Blog · 24. August 2026

Dürfen Kundendaten ins KI-Training? Was erlaubt ist – und was nicht

Ein Onlinehändler wollte aus tausenden Support-Mails einen KI-Assistenten trainieren, mit echten Namen, Adressen und sehr privaten Details. Genau an diesem Punkt entscheidet sich, ob aus der guten Idee ein Datenschutzproblem wird. Ich zeige Ihnen, was mit Kundendaten im KI-Training erlaubt ist und wo die Grenze verläuft.

Darstellung des beispielhaften KI-Prozesses

Ein mittelständischer Onlinehändler kommt mit einer guten Idee zu mir. Über Jahre haben sich im Support tausende E-Mails angesammelt: Fragen zu Lieferzeiten, Reklamationen, Rücksendungen, Beschwerden. Das Team möchte daraus einen KI-Assistenten bauen, der neue Anfragen automatisch im eigenen Ton beantwortet. Der Gedanke: Wir haben die Daten doch schon, also nutzen wir sie.

Der geplante Ablauf sieht so aus. Zuerst exportiert das Team den kompletten Verlauf aus dem CRM und dem Ticketsystem. In diesem Export steht alles: Vor- und Nachname, E-Mail-Adresse, Telefonnummer, Bestellnummern, Lieferadressen und der komplette Nachrichtentext. In manchen Beschwerden stehen auch heikle Sätze, etwa dass eine Bestellung wegen eines Krankenhausaufenthalts nicht angenommen wurde.

Dann wird ein Sprachmodell mit genau diesen Beispielen trainiert oder feinjustiert. Das Modell lernt aus den echten Dialogen, wie typische Anfragen aussehen und wie das Unternehmen normalerweise antwortet. Am Ende steht ein Assistent, der neue Kundenmails liest und passende Antwortentwürfe erzeugt.

Genau an diesem Punkt wird es interessant. Denn der Händler steckt keine anonymen Textbausteine hinein, sondern echte, benennbare Kundenkommunikation. Und ein trainiertes Modell kann sich einzelne Trainingsbeispiele merken und in bestimmten Situationen fast wörtlich wieder ausgeben. Aus Kundendaten wird so dauerhaft ein Bestandteil des Modells.

Datenschutzrechtliche Einordnung

Hier reden wir eindeutig über personenbezogene Daten. Namen, Adressen, Bestellhistorie, Beschwerdetexte, alles ist einer Person zuzuordnen. Sobald in den Beschwerden Gesundheitsangaben auftauchen, kommen sogar besonders geschützte Daten nach Artikel 9 dazu, für die noch strengere Regeln gelten.

Der entscheidende Punkt ist die Zweckbindung. Der Kunde hat seine Daten für die Abwicklung seiner Bestellung hinterlassen, nicht für das Training einer KI. Das Training ist also ein neuer Zweck. Ich brauche dafür eine eigene Rechtsgrundlage und muss prüfen, ob der neue Zweck mit dem ursprünglichen überhaupt vereinbar ist. Meist läuft das entweder über ein berechtigtes Interesse mit sauberer Abwägung oder über eine ausdrückliche Einwilligung. Bei den Gesundheitsangaben führt in der Regel kein Weg an einer echten Einwilligung vorbei.

Der nächste Stolperstein ist der Anbieter. Wenn ein externer KI-Dienst das Training übernimmt, brauche ich einen Vertrag zur Auftragsverarbeitung nach Artikel 28. Aber Vorsicht: Viele KI-Werkzeuge nutzen die eingegebenen Daten standardmäßig auch für die Verbesserung ihres eigenen Modells. In dem Moment ist der Anbieter kein reiner Auftragsverarbeiter mehr, sondern verfolgt eigene Zwecke. Dann fehlt mir die Rechtsgrundlage, und meine Kundendaten wandern in ein fremdes Modell, das ich nie wieder zurückhole. Sitzt der Anbieter in den USA, kommt zusätzlich das Thema Drittlandübermittlung dazu.

Dann die Transparenz. Meine Kunden müssen wissen, dass ihre Daten fürs Training verwendet werden. Und sie haben Rechte: Auskunft, Widerspruch, Löschung. Genau das wird beim Training zum Problem. Ein einzelnes Trainingsbeispiel bekomme ich aus einem fertig trainierten Modell praktisch nicht mehr sauber heraus. Das Recht auf Löschung läuft dann faktisch ins Leere, und das ist ein echtes Risiko.

Auch der AI Act spielt mit. Er verlangt für viele KI-Systeme eine ordentliche Datenqualität und eine dokumentierte Daten-Governance, also den Nachweis, woher die Trainingsdaten stammen und wie sie ausgewählt wurden. Wer roh und ungeprüft alles hineinkippt, erfüllt das nicht.

Der typische Fehler in der Praxis ist genau dieses Hineinkippen: echte Kundendaten ohne Rechtsgrundlage, ohne Information der Betroffenen, in einem Tool, dessen Voreinstellung das Mitlernen erlaubt. Der saubere Weg ist ein anderer. Ich minimiere zuerst, nehme also nur, was ich wirklich brauche. Ich anonymisiere oder pseudonymisiere die Daten, sodass Namen, Adressen und Bestellnummern verschwinden und nur noch die reine Sprachstruktur übrig bleibt. Anonyme Daten fallen aus der DSGVO heraus, und damit entspannt sich die ganze Lage. Ich schalte in den Werkzeugen das Mitlernen ab, schließe den passenden Vertrag, dokumentiere meine Abwägung und informiere meine Kunden verständlich.

Fazit

Kundendaten fürs KI-Training zu nutzen ist nicht verboten, aber die rohe Variante ist der riskanteste Weg von allen. Wer echte, benennbare Kundenkommunikation ungefiltert in ein Modell schiebt, sammelt Zweckänderung, fehlende Rechtsgrundlage, unerfüllbare Löschpflichten und ein Drittlandproblem auf einmal ein.

Die gute Nachricht: In den allermeisten Fällen brauche ich die personenbezogenen Anteile für das Training gar nicht. Es geht um Formulierungen, Tonfall und typische Abläufe, nicht um den echten Namen von Frau Müller. Wenn ich vorher konsequent anonymisiere und minimiere, wird aus dem Rechtsrisiko ein unkompliziertes Projekt. Und wo eine Einwilligung nötig ist, hole ich sie eben sauber ein.

Mein Rat als Datenschutzbeauftragter: KI im Kundenservice lohnt sich, aber die Frage, welche Daten wirklich ins Training dürfen, gehört vorher geklärt, nicht hinterher. Wenn Sie überlegen, Ihre Kundendaten für ein KI-System zu nutzen, schauen wir uns Ihren konkreten Fall im kostenlosen Erstgespräch an, bevor die Daten unumkehrbar im Modell stecken.