Disaster Recovery (DR, odtwarzanie po awarii) to zestaw procedur, ról i infrastruktury, które pozwalają przywrócić działanie systemów po poważnej awarii: pożarze serwerowni, ataku ransomware, utracie centrum danych. Dwa parametry rządzą całością: RTO (Recovery Time Objective - maksymalny akceptowalny czas przestoju) i RPO (Recovery Point Objective - maksymalna akceptowalna utrata danych).
Analityk wchodzi w DR od strony biznesu: to on wyciąga od interesariuszy odpowiedź na pytania „ile godzin bez systemu firma wytrzyma?" i „ile danych możemy stracić?". Bez tych liczb IT nie zwymiaruje rozwiązania - albo przepłaci za infrastrukturę klasy bankowej, albo zbuduje coś, co przy pierwszej awarii położy biznes.
W MediFlow rozmowa wyglądała tak: gdy rejestracja online leży, 12 przychodni wraca do zeszytów i telefonów - boli, ale da się przeżyć dzień. Gdy znikają dane o umówionych wizytach z ostatnich godzin, pacjenci przychodzą na wizyty, których nie ma w grafiku. Biznes ustalił RTO 4 godziny i RPO 15 minut. Ta druga liczba przesądziła o replikacji bazy co kwadrans zamiast nocnego backupu - różnica w kosztach znacząca, ale świadoma.
Częsta pomyłka: stawianie znaku równości między DR a backupem. Backup to kopia danych; DR to cały plan powrotu do działania - ludzie, procedury, zapasowe środowisko, kolejność odtwarzania i testy tego planu. Firmy z backupem, którego nikt nigdy nie próbował odtworzyć, mają backup, a nie DR.