Datenqualitätsprüfungen helfen dabei, Probleme zu identifizieren, die die Genauigkeit, Vollständigkeit und Zuverlässigkeit der Daten während des Durchlaufs einer Pipeline beeinflussen können.
Datenqualitätsprüfungen sind standardmäßig für jeden Bereinigen Knoten aktiviert. Man kann die Datenqualitätsprüfungen für einen einzelnen Bereinigen ein- oder ausschalten.

Die Aktualisierungen Zusammenfassung der Datenqualität sind, wenn du einen anderen Schritt auswählst, sodass die Spaltendetails das Ergebnis des ausgewählten Schrittes widerspiegeln. Öffnen Sie den Seitenbereich für weitere Informationen.
Qualitätsindikator

Übersprungener Indikator
Ein blauer Punkt zeigt an, dass die Datenqualitätsprüfungen übersprungen wurden.

Die Qualitätsprüfung für Fehlende Werte identifiziert Datensätze, die leere oder null Werte in den erforderlichen Feldern enthalten.
Fehlende Werte können zu unvollständigen Analysen, Verarbeitungsfehlern und unzuverlässigen Ergebnissen führen. Die Überwachung fehlender Werte hilft, sicherzustellen, dass die Daten vollständig und für den nachgelagerten Einsatz geeignet sind.
Die Erkennung fehlender Werte ist für alle Spalten verfügbar.
Die Qualitätsprüfung für Outliers identifiziert Werte, die signifikant höher oder niedriger sind als andere Werte im Datensatz.
Ausreißer können auf Dateneingabefehler, Messprobleme, unerwartete Bedingungen oder bedeutende Veränderungen in einem Prozess hinweisen. Die Überwachung von Ausreißern hilft, potenzielle Qualitätsprobleme der Daten zu identifizieren und hebt Datensätze hervor, die eine weitere Untersuchung erfordern.
Ausreißererkennung ist für numerische Spalten verfügbar.
Die Interquartile Range (IQR)- Methode identifiziert Ausreißer, indem sie nach Werten sucht, die ungewöhnlich weit von den mittleren 50 % der Daten entfernt sind.
Jeder Wert außerhalb dieser Grenzen gilt als Ausreißer.
Untere Schranke=Q1−1,5×IQRObere Grenze=Q3+1,5×IQRDie Qualitätskontrolle für Seltene Kategorien identifiziert Kategorien, die selten in einer Datenspalte auftreten.
Seltene Kategorien sind Werte, die im Vergleich zur Größe des Datensatzes seltener auftreten. Seltene Kategorien können auf Tippfehler, Rechtschreibfehler, inkonsistente Großschreibung oder andere Qualitätsprobleme der Datenqualität hinweisen, die Analyse, statistische Modellierung und Ergebnisse des maschinellen Lernens beeinflussen können.
Die Erkennung seltener Kategorien erfolgt nicht bei numerischen oder Datum/Uhrzeit-Spalten, die als kontinuierliche Daten behandelt werden. Fehlende Werte werden nicht als seltene Kategorien behandelt.
Minitab Data Center berechnet den Prozentsatz der Datensätze, die jede Kategorie repräsentiert. Jede Kategorie mit einem Prozentsatz von weniger als 5 % gilt als selten.

