Data quality (jakość danych) to stopień, w jakim dane nadają się do zamierzonego użycia. Mierzy się ją w wymiarach: kompletność (czy są wszystkie wartości), poprawność (czy zgodne z rzeczywistością), spójność (czy to samo znaczy to samo w różnych systemach), aktualność, unikalność (brak duplikatów) i integralność (czy powiązania między danymi się zgadzają).
Dla analityka jakość danych to nie teoria, tylko pierwszy punkt każdego projektu raportowego, migracyjnego czy integracyjnego. Standardowa praktyka: profilowanie danych przed zobowiązaniem się do czegokolwiek - policzenie braków, duplikatów, wartości spoza słownika. Wyniki profilowania potrafią zmienić budżet projektu o dziesiątki procent, więc lepiej znać je przed podpisaniem harmonogramu.
Przykład z MediFlow: przed migracją bazy pacjentów do nowego systemu analityk sprofilował dane z 12 przychodni. Wyniki: 8% rekordów bez numeru telefonu (przypomnienia SMS nie dotrą), około 3 tys. duplikatów (ten sam pacjent zarejestrowany w dwóch placówkach jako dwie osoby - groźne przy historii medycznej), 412 dat urodzenia „01.01.1900" (zaszłość po starym systemie, gdzie pole było obowiązkowe, a rejestratorki wpisywały cokolwiek). Czyszczenie i deduplikacja weszły do planu jako osobny strumień prac z własnym budżetem - zamiast wypłynąć jako kryzys w trzecim tygodniu migracji.
Najważniejsza prawda o jakości danych: to proces, nie jednorazowa akcja. Wyczyszczona baza bez walidacji na wejściu (maska numeru telefonu w formularzu, słownik zamiast pola tekstowego, reguła deduplikacji przy rejestracji) zabrudzi się z powrotem w pół roku. Częsta pomyłka: zrzucanie jakości danych na IT - większość reguł („czy pacjent może nie mieć PESEL?") to decyzje biznesowe.
Pojęcia powiązane: profilowanie danych, data governance, migracja danych, ETL.