Datenqualität optimieren

Datenharmonisierung & Dublettenprüfung

Identifizieren und bereinigen Sie Duplikate in Ihren Quelldaten vor der Migration. Saubere, deduplizierte Daten für Ihr Zielsystem.

Dubletten-Cluster Übersicht

Intelligente Gruppierung und Golden Record Auswahl

Preview
0 Mio.
Max. Datensätze
0
Matching-Algorithmen
0
Golden Record Strategien
0%
Audit-Trail

Flexible Konfiguration

Tabellen-Sets, Verknüpfungen und Filter für präzise Dublettenprüfung definieren.

Intelligentes Matching

Exakte, Fuzzy, phonetische und N-Gram Matching-Regeln kombinieren.

Golden Record Auswahl

Automatische oder manuelle Bestimmung des Master-Datensatzes.

Matching-Regeltypen

Exakter Match

Felder müssen identisch sein

Anwendung: Artikelnummern, IDs
Fuzzy Match

Ähnlichkeitsvergleich mit Schwellwert

Anwendung: Namen, Beschreibungen
Phonetischer Match

Klangbasierte Ähnlichkeit

Anwendung: Personennamen
N-Gram Vergleich

Teilstring-Analyse

Anwendung: Adressen, Langtexte

Matching-Algorithmen

Levenshtein-Distanz

Berechnet minimale Editier-Distanz zwischen zwei Strings

Jaro-Winkler

Optimiert für kurze Strings und Namen

Soundex & Metaphone

Phonetischer Vergleich für Klangähnlichkeit

N-Gram-Analyse

Teilstring-Analyse für Langtexte

Workflow

1

Konfiguration

Tabellen aus Data Catalog wählen, Verknüpfungen definieren, Filter setzen

2

Regeln definieren

Match-Felder auswählen, Algorithmus & Schwellwert festlegen

3

Analyse starten

Automatische Blocking-Key-Berechnung, Cluster-Bildung, Golden Record Vorschlag

4

Review & Freigabe

Cluster prüfen, Golden Record bestätigen, optionale 4-Augen-Freigabe

5

Export

Bereinigte Daten, Mapping-Tabelle, Audit-Report

Golden Record Strategien

Bestimmen Sie automatisch oder manuell den Master-Datensatz:

  • Vollständigkeit:Datensatz mit den meisten ausgefüllten Feldern
  • Aktualität:Neuester Datensatz nach Erstelldatum
  • Qualität:Höchster Datenqualitäts-Score
  • Manuell:Keine automatischen Vorschläge

Review & Freigabe

  • Cluster-Übersicht: Alle Dubletten-Gruppen auf einen Blick
  • Detailvergleich: Feldweise Gegenüberstellung der Datensätze
  • Match-Details: Transparente Darstellung der Erkennungsgründe
  • 4-Augen-Prinzip: Optionale Freigabe durch zweite Person

Anwendungsbeispiele

Material-Dubletten (SAP)

Tabellen:MARA + MAKT
Regel:Fuzzy-Match auf Materialbezeichnung mit 85% Schwellwert
Filter:SPRAS = 'D'

Kunden-Dubletten

Tabellen:KNA1 + ADRC
Regel:Phonetischer Match auf Name + Fuzzy-Match auf Adresse
Filter:Golden Record: Vollständigster Datensatz

Lieferanten-Bereinigung

Tabellen:LFA1
Regel:Exakter Match auf Steuernummer + Fuzzy-Match auf Name
Filter:Mit 4-Augen-Freigabe

Export-Optionen

Bereinigte Daten

Neue Dataset-Version ohne Dubletten als Quelle für Migration nutzen

Mapping-Tabelle

Alt-ID → Golden-Record-ID in Migrationsregeln verwenden

Zusammenfassung

Statistiken & Audit-Trail für Dokumentation & Compliance

Vorteile

Früherkennung: Datenprobleme vor der Migration identifizieren
Flexibilität: Anpassbare Regeln für jeden Anwendungsfall
Transparenz: Nachvollziehbare Match-Scores und Entscheidungen
Compliance: 4-Augen-Prinzip und vollständiger Audit-Trail
Integration: Nahtlose Verbindung mit Data Catalog und Migrationsregeln
Skalierbarkeit: Optimiert für große Datenmengen (bis 3 Mio. Datensätze)

Bereit für saubere Daten?

Entdecken Sie, wie CUTO Ihre Datenqualität vor der Migration optimiert.