Data mining (eksploracja danych) to odkrywanie nieoczywistych wzorców w dużych zbiorach danych metodami statystyki i uczenia maszynowego. Główne klasy zadań: klasyfikacja (przewidywanie kategorii), regresja (przewidywanie wartości), grupowanie/klastrowanie (znajdowanie naturalnych segmentów), reguły asocjacyjne („kto kupuje X, kupuje też Y") i wykrywanie anomalii.
Analityk biznesowy zwykle nie buduje modeli samodzielnie - od tego są data scientiści - ale stoi na obu końcach procesu. Na wejściu: tłumaczy problem biznesowy na pytanie analityczne („chcemy mniej pustych gabinetów" → „które rezerwacje mają wysokie ryzyko nieodbycia?"). Na wyjściu: ocenia, czy znaleziony wzorzec da się zamienić na działanie i pieniądze. Wzorzec bez akcji to ciekawostka.
Przykład z MediFlow: eksploracja 300 tys. historycznych wizyt z 12 przychodni wykryła wzorzec - rezerwacje robione z ponad 3-tygodniowym wyprzedzeniem na piątkowe popołudnia mają trzykrotnie wyższy odsetek nieodbycia niż średnia. Akcja biznesowa: dla takich slotów system wysyła dodatkowe przypomnienie z prośbą o potwierdzenie 48 h przed terminem, a niepotwierdzone wracają do puli. Wzorzec → reguła → odzyskane wizyty.
Dwie przestrogi, obie klasyczne. Korelacja to nie przyczynowość: to, że dwie rzeczy występują razem, nie znaczy, że jedna powoduje drugą - zanim z wzorca zrobisz regułę, sprawdź mechanizm. I garbage in, garbage out: eksploracja danych złej jakości produkuje bardzo przekonujące bzdury; jeśli 8% rekordów nie ma telefonu, a duplikaty pacjentów liczone są podwójnie, model nauczy się artefaktów bazy, nie zachowań ludzi.
Pojęcia powiązane: uczenie maszynowe, big data, data quality, analityka predykcyjna.