Pseudonymisierung
Pseudonymisierung ist eine Schutzschicht zwischen deinen Originalinhalten und dem Modell. Sie ersetzt erkannte personenbezogene Daten durch Platzhalter, bevor der Text an ein Chatmodell gesendet wird. So kann das Modell weiter mit der Struktur der Anfrage arbeiten, ohne unmittelbar Klarnamen, E-Mail-Adressen, Telefonnummern oder ähnliche Daten sehen zu müssen.
Pseudonymisierung ist kein Löschvorgang und keine Garantie, dass ein Text vollständig anonym ist. Sie reduziert das Risiko, indem sie erkannte sensible Stellen ersetzt und die Zuordnung lokal für den laufenden Chat verwaltet.
Was ersetzt wird
elmtree chat sucht nach personenbezogenen oder sensiblen Angaben, zum Beispiel:
- Namen und Namensbestandteile,
- E-Mail-Adressen und Telefonnummern,
- Adressen und Ortsangaben,
- Datums- und Altersangaben,
- Ausweis-, Steuer- oder ähnliche Identifikationsnummern,
- weitere Kategorien, die du in den Datenschutzeinstellungen aktivierst.
Erkannte Begriffe werden durch typisierte Tokens ersetzt. Ein Name wird also nicht einfach zu ***, sondern zu einem Platzhalter, der seine Rolle ungefähr erhält. Das hilft dem Modell, sinnvoll zu antworten.
Dokumentgebundene Pseudonymisierung
Pseudonymisierung ist vor allem für Dokumentarbeit gedacht. Wenn du ein Dokument in den Chat lädst und die Dokument-Pseudonymisierung aktiv ist, wird der extrahierte Dokumenttext vorbereitet und im Preview pseudonymisiert.
Reiner getippter Text wird nicht mehr allein für sich pseudonymisiert. Getippter Text wird aber pseudonymisiert, wenn du mit einem pseudonymisierten Inline-Dokument chattest. Dann gehören Dokument und getippte Nachfrage zum selben Sendekontext und werden zusammen geschützt.
Preview vor dem Senden
Der Preview ist die maßgebliche Ansicht dafür, was an das Modell gesendet wird. Wenn ein Dokument pseudonymisiert wird, zeigt der Preview die ersetzten Tokens. Du kannst vor dem Senden prüfen, ob die Ersetzung plausibel ist.
Im Preview kannst du außerdem manuell eingreifen:
- Maskierung hinzufügen ersetzt einen markierten Begriff durch ein Token.
- Maskierung entfernen stellt einen markierten Token wieder her, soweit die Zuordnung vorhanden ist.
- Text entfernen löscht ausgewählte Stellen aus Dokument oder Nachfrage.
- Text einfügen ergänzt den Preview manuell.
Inline-Dokumente und große Dokumente
Pseudonymisierung im Preview betrifft Inline-Dokumente. Das sind Dokumente, deren extrahierter Text direkt in den Chatkontext aufgenommen wird.
Große, indexierte Dokumente werden anders verwendet: Sie werden für RAG vorbereitet und als Dokumentreferenz an den Chat angebunden. Die Inline-Preview-Schalter gelten für diese Dokumente nicht.
Grenzen
Pseudonymisierung ist eine starke Reduktionsmaßnahme, aber keine vollständige Anonymisierung. Grenzen können durch nicht erkannte personenbezogene Daten, indirekte Identifizierbarkeit, OCR-Fehler, ungewöhnliche Formate oder seltene Kontextkombinationen entstehen.
Für wichtige Dokumente solltest du den Preview prüfen, fehlende Maskierungen ergänzen und unnötige Passagen entfernen.