As verificações de qualidade dos dados ajudam a identificar questões que podem afetar a precisão, completude e confiabilidade dos dados à medida que avançam por um pipeline.
Verificações de qualidade dos dados estão ativados por padrão para cada Limpeza nó. Você pode ativar ou desativar as verificações de qualidade de dados para um nó Limpeza individual.

As Resumo da qualidade dos dados atualizações são feitas quando você seleciona uma etapa diferente, de modo que os detalhes da coluna reflitam o resultado dessa etapa selecionada. Abra o vidro lateral para mais informações.
Indicador de emissão de qualidade

Indicador pulado
Um ponto azul indica que as verificações de qualidade dos dados foram puladas.

A verificação de qualidade identifica Valores faltantes registros que contêm valores vazios ou nulos nos campos exigidos.
Valores ausentes podem levar a análises incompletas, erros de processamento e resultados pouco confiáveis. Monitorar valores ausentes ajuda a garantir que os dados estejam completos e adequados para uso posterior.
A detecção de valores faltantes está disponível para todas as colunas.
A verificação de qualidade para Outliers identifica valores significativamente maiores ou menores do que outros valores do conjunto de dados.
Outliers podem indicar erros de entrada de dados, problemas de medição, condições inesperadas ou mudanças significativas em um processo. Monitorar os valores atípicos ajuda a identificar possíveis problemas de qualidade dos dados e destaca registros que podem exigir investigação adicional.
A detecção de valores atípicos está disponível para colunas numéricas.
O método da Faixa Interquartil (IQR) identifica valores atípicos buscando valores que ficam incomumente distantes dos 50% intermediários dos dados.
Qualquer valor fora desses limites é considerado um valor fora da curva.
Limite Inferior=Q1−1,5×IQRLimite Superior=Q3+1,5×IQRA verificação de qualidade para Categorias raras identifica categorias que ocorrem raramente em uma coluna de dados.
Categorias raras são valores que ocorrem raramente em comparação com o tamanho do conjunto de dados. Categorias raras podem indicar erros de digitação, erros ortográficos, capitalização inconsistente ou outros problemas de qualidade dos dados que podem afetar análises, modelagem estatística e resultados de aprendizado de máquina.
A detecção de categorias raras não é realizada em colunas numéricas ou de data/hora que são tratadas como dados contínuos. Valores ausentes não são tratados como categorias raras.
Minitab Data Center calcula a porcentagem de registros representados por cada categoria. Qualquer categoria com porcentagem inferior a 5% é considerada rara.

