Normalizacja (ang. database normalization) to porządkowanie struktury relacyjnej bazy danych tak, by każda informacja była przechowywana dokładnie raz - przez doprowadzanie tabel do kolejnych postaci normalnych (1NF, 2NF, 3NF; dalsze są głównie akademickie). Cel praktyczny: wyeliminować redundancję i anomalie przy wstawianiu, zmianie i usuwaniu danych.
Analityk biznesowy i analityk danych spotykają normalizację przy projektowaniu modelu danych, przy czytaniu istniejących baz (żeby zrozumieć, czemu raport wymaga pięciu JOIN-ów) i przy rozmowach z zespołem o tym, czemu "dopisanie jednej kolumny" nie jest dobrym pomysłem.
Przykład (MediFlow). W starej bazie rejestracji każda wizyta miała ręcznie wpisany adres przychodni. Skutek: gdy placówka na Mokotowie przeniosła się dwie ulice dalej, trzeba było zaktualizować 40 tysięcy wierszy historycznych wizyt - i część SMS-ów z przypomnieniem dalej wysyłała stary adres. Po normalizacji adres siedzi raz, w tabeli placówek, a wizyta trzyma tylko identyfikator placówki. Zmiana adresu to jeden UPDATE.
Częsta pomyłka. Normalizowanie wszystkiego z religijną gorliwością - także hurtowni danych. Baza transakcyjna (OLTP) powinna być znormalizowana, bo chroni to spójność zapisów. Ale model analityczny celowo się denormalizuje (schemat gwiazdy: tabela faktów plus szerokie wymiary), bo przy raportowaniu liczy się szybkość odczytu i prostota zapytań, a nie oszczędność miejsca. Analityk, który zgłasza "błąd redundancji" w hurtowni, myli dwa światy. Druga pomyłka: rozpoznawanie postaci normalnych z definicji na egzamin, bez umiejętności wskazania w realnej tabeli, które kolumny się zduplikują.