Davies Meyer – Startseite
    Data3 Min. Lesezeit

    Synthetic Data

    Synthetic Data sind künstlich erzeugte Daten, die beispielsweise bestimmte Strukturen, Verteilungen oder Anwendungssituationen nachbilden sollen. Sie können beim Entwickeln, Testen oder Trainieren von Systemen helfen. Das Etikett „synthetisch“ garantiert jedoch weder Anonymität noch Realitätsnähe oder eine passende Rechtsgrundlage für den gesamten Herstellungs- und Nutzungsprozess.

    Synthetic Data im Detail

    Ein Testsystem braucht Bestellungen mit unterschiedlichen Warenkörben, Schreibweisen oder fehlenden Angaben. Solche Fälle lassen sich künstlich erzeugen, ohne echte Kundendatensätze in jede Entwicklungsumgebung zu kopieren. Je nach Aufgabe entstehen die Daten aus Regeln, Simulationen oder Modellen, die reale Daten auswerten. Definiert deshalb zuerst, welche Eigenschaften der Test braucht und welche Aussagen damit überhaupt möglich sein sollen.

    Wer reale Daten zur Erzeugung nutzt, verarbeitet diese weiterhin. Ein später künstlich erzeugter Datensatz macht die vorherige Verarbeitung nicht rückwirkend unproblematisch. Auch die Ausgabe kann Informationen über reale Personen verraten oder Eigenschaften des Ausgangsmaterials unzureichend abbilden. Prüft Herkunft, zulässigen Zweck und Risiken bei Erstellung und Weitergabe getrennt. Die ICO-Leitlinie erläutert solche technischen Grenzen; sie ist keine Rechtsfreigabe für einen Einsatz in Deutschland.

    Qualität braucht mehrere Prüfungen. Ähnliche Einzelverteilungen sagen noch nicht, dass Zusammenhänge, seltene Fälle oder die Leistung bei einer konkreten Aufgabe stimmen. Ein auf synthetischen Daten trainiertes Modell muss für seinen vorgesehenen Einsatz anhand geeigneter unabhängiger realer Daten geprüft werden. Zusätzliche generierte Zeilen sind keine zusätzlichen unabhängigen Beobachtungen des Marktes. Synthetische Klicks belegen keine reale Conversion-Wirkung.

    Creative Engineering setzt künstliche Daten gezielt ein, etwa um ungewöhnliche Eingaben und fehleranfällige Abläufe früher zu prüfen. Die Verantwortung für Konzept und Qualität liegt bei uns. NIST unterscheidet synthetische Verfahren von korrekt implementierter Differential Privacy; beides ist nicht gleichzusetzen. Bewertet Aufgabenqualität, Schutz und vollständigen Aufwand gemeinsam. Wenn ein einfacher künstlicher Testfall reicht, ist ein komplexes Generierungsmodell nicht automatisch die bessere Lösung.

    Beispiele

    Hypothetisches Anwendungsbeispiel

    Ein Entwicklerteam erstellt künstliche Bestellungen mit langen Adressen, fehlenden optionalen Feldern und verschiedenen Produktkombinationen. Damit prüft es Darstellung und Fehlerbehandlung eines Formulars. Ob die neue Gestaltung echten Menschen hilft und mehr erfolgreiche Bestellungen ermöglicht, wird separat mit geeigneten realen Nutzungsdaten untersucht.

    Wichtige Punkte

    • Künstlich erzeugt bedeutet nicht automatisch anonym oder realistisch.
    • Testdaten, Trainingsdaten und beobachtete Marktdaten unterscheiden.
    • Aufgabenqualität, Schutz und Gesamtaufwand getrennt prüfen.

    Anwendung im Marketing-Alltag

    Legt die Testaufgabe fest und kennzeichnet künstliche Daten eindeutig. Prüft ihren Nutzen und ihre Grenzen, bevor daraus reale Entscheidungen abgeleitet werden.

    Sinnvolle Messgrößen

    Aufgabentauglichkeit

    Prüft, ob die Daten die vorgesehenen Testfälle und relevanten Eigenschaften abdecken.

    Unabhängige Validierung

    Bewertet die spätere Systemleistung mit geeigneten Daten, die nicht nur die Generierung wiederholen.

    Schutz und Gesamtaufwand

    Erfasst Offenlegungsrisiken, Generierung, Prüfung und laufende Pflege gemeinsam.

    Häufige Fehler

    • Das Wort synthetisch als Datenschutzgarantie behandeln.
    • Generierte Datensätze als neue unabhängige Marktbeobachtungen zählen.
    • Nur durchschnittliche Ähnlichkeit prüfen und relevante Sonderfälle übersehen.

    Quellen und Einordnung

    • NIST: Differentially Private Synthetic Data

      Technische Unterscheidung synthetischer Daten und korrekt implementierter Differential Privacy.

    • ICO: Synthetic data

      Technische Risiken, Datenqualität und Re-Identifikation; britische Leitlinie in Überarbeitung, keine deutsche Rechtsfreigabe.

    • EUR-Lex: DSGVO / GDPR

      EU-Rechtsgrundlage insbesondere zu Zweckbindung, Datenminimierung, Rechtsgrundlagen, Einwilligung und Werbewiderspruch.

    Häufige Fragen zu Synthetic Data

    Das lässt sich nicht pauschal sagen. Je nach Erzeugung können Informationen über reale Personen ableitbar sein; außerdem kann bereits die Herstellung personenbezogene Ausgangsdaten verarbeiten.

    Begriffsempfehlungen werden geladen…

    Alle Begriffe