Nocna kopia zapasowa się nie powiodła

Kopia zapasowa, która nie powiodła się jednej nocy, to nie katastrofa, lecz opóźnienie: ostatnia zdrowa kopia ma co najmniej 48 godzin, jeśli ta z poprzedniego dnia się udała. Kilka niepowodzeń z rzędu to już incydent ochrony danych: jego przyczyny szuka się tego samego dnia, a nie poprzestaje na potwierdzeniu alertu.

Aktualizacja: październik 20263 min czytania5 cytowanych źródeł

Najważniejsze

  • Przeczytać komunikat o błędzie, a nie tylko spojrzeć na czerwoną kontrolkę: miejsce, brak źródła, dane logowania, zablokowane pliki, przepustowość, zatrzymany agent.
  • Zadanie „udane” mogło skopiować pusty folder: sprawdzić rozmiar skopiowanych danych.
  • Zanotować datę ostatniej udanej kopii i przekazać ją osobie odpowiedzialnej za dany dział.
  • Uruchomić ponownie po usunięciu przyczyny, a następnie sprawdzić kolejną noc.
  • Trzy niepowodzenia w miesiącu na tej samej maszynie: zmienić konfigurację, a nie tylko klikać „uruchom ponownie”.

1. Przeczytać błąd, a nie tylko spojrzeć na czerwoną kontrolkę

Typowe przyczyny, w kolejności, w jakiej się pojawiają:

PrzyczynaObjawRozwiązanie
Brak miejsca w lokalizacji docelowej lub osiągnięty limitBłąd zapisu, skracający się okres retencjiZwiększyć przestrzeń lub świadomie skrócić historię
Źródło wyłączone, poza siecią, zmieniona ścieżkaZmieniona litera dysku lub nazwa udziału; zadanie „udane” na pustym folderzePrzywrócić źródło, poprawić ścieżkę, sprawdzić rozmiar skopiowanych danych
Odrzucone dane logowaniaWygasłe hasło konta usługiPrzywrócić konto: w przeciwnym razie każda kolejna noc zakończy się niepowodzeniem
Zablokowane pliki lub baza danych nieprzygotowana do kopiiKopia częściowaUżyć metody przewidzianej dla otwartych baz danych; bazy SQL w takim stanie nie da się poprawnie przywrócić
Zbyt wolne lub zerwane łączeZadanie przerwane pod koniec oknaWydajniejsza kopia przyrostowa, dłuższe okno lub mniej zbędnych danych
Zatrzymany agent na maszynieBrak wysyłki danychUruchomić usługę ponownie, ustalić, dlaczego się zatrzymała

Najbardziej mylący przypadek to zielone zadanie na pustym folderze. ANSSI, francuska krajowa agencja cyberbezpieczeństwa, wymaga, aby kopie zapasowe były systematycznie kontrolowane, ze szczególnym uwzględnieniem niespójnego wolumenu danych lub plików, spowolnień sieci i zmian konfiguracji. Rozmiar skopiowanych danych, który nagle spada z nocy na noc, zasługuje na tyle samo uwagi co niepowodzenie.

2. Ustalić, kiedy była ostatnia udana kopia

To jedyna data, która liczy się dla dzisiejszego RPO. Jeśli minęło od niej więcej niż kilka dni, należy poinformować osobę odpowiedzialną za dany dział. Pracuje ona bez zabezpieczenia i musi o tym wiedzieć. Potwierdzenie alertu w konsoli bez tej informacji to właśnie ten ruch, który dwa tygodnie później zamienia incydent w utratę danych.

3. Uruchomić ponownie po usunięciu przyczyny

Po usunięciu przyczyny należy ręcznie uruchomić zadanie i poczekać na jego zakończenie. Niepowodzenie ponownego uruchomienia oznacza, że przyczyna nadal istnieje. Następnego ranka trzeba sprawdzić kolejną noc: wiele „oczywistych” poprawek nie wytrzymuje drugiego przebiegu.

Udane zadanie dowodzi, że kopia została zapisana, a nie że da się ją przywrócić. W przypadku bazy SQL Server Microsoft zaznacza, że polecenie weryfikacji kopii zapasowej nie sprawdza struktury zawartych w niej danych. ANSSI wymaga regularnego testowania kopii zapasowych na podstawie spisanej procedury przywracania; NIST również zaleca testowanie kopii zapasowych, aby upewnić się, że pliki dają się odzyskać bez błędów. Po incydencie z kopią zapasową najlepszą kontrolą jest próbne przywrócenie pliku lub bazy danych. Zob. Jak sprawdzić, czy kopia zapasowa działa?.

4. Jeśli problem się powtarza

Trzy niepowodzenia w miesiącu na tej samej maszynie: zakres, przepustowość lub produkt są nieodpowiednie. Należy zmienić parametr (wykluczyć ogromny i zbędny folder, podzielić zadanie, zwiększyć przestrzeń dyskową), a nie ograniczać się do ręcznego ponownego uruchamiania w każdy poniedziałek.

Poranna lista kontrolna

  • Czy wszystkie nocne zadania się zakończyły, a nie tylko „nie zgłosiły błędu”?
  • Czy rozmiar skopiowanych danych jest spójny z poprzednimi nocami?
  • Czy data ostatniej udanej kopii każdej krytycznej maszyny jest młodsza niż 24 godziny?
  • Czy alerty zostały przeczytane przez wyznaczoną osobę, a nie tylko odebrane?
  • Czy pozostałe miejsce w lokalizacji docelowej wystarcza na zaplanowany okres retencji?

Z WeDoBack

Całodobowy monitoring obejmuje kopie zapasowe i wysyła alert, gdy kopia się nie powiedzie. Alert jest początkiem tej strony, a nie jej końcem. W ofercie INTEGRAL dwie godziny wsparcia miesięcznie można wykorzystać na usunięcie przyczyny. W ofercie SMART wsparcie jest rozliczane za interwencję: niepowodzenie pozostaje widoczne dla klienta w konsoli i to on powinien je odczytać. Wsparcie jest dostępne pod numerem +33 9 72 50 78 28 w godzinach 9:00–13:00 i 14:00–17:30 (czasu paryskiego). Przy doborze przestrzeni dyskowej publikowany rząd wielkości to obecny wolumen pomnożony przez trzy, z korektą po tygodniu użytkowania: zbyt małą przestrzeń widać po nieudanych zadaniach lub skracającym się okresie retencji. Klucz szyfrowania, który posiada klient, nie ma wpływu na niepowodzenie wysyłki: jeśli zadanie się nie powiedzie, zdalna kopia po prostu nie została zaktualizowana.

Najczęściej zadawane pytania

Czy jedna nieudana noc to poważny problem?

Rzadko, jeśli poprzednia noc zakończyła się powodzeniem, a przyczyna zostanie usunięta w ciągu dnia. Ryzyko wynika z kumulacji: każda nieudana noc zwiększa ilość pracy, która zostałaby utracona w razie awarii. Po kilku dniach jest to incydent, który należy zgłosić zarządowi.

Czy status „udane” wystarczy, by dowieść, że kopia zapasowa jest dobra?

Nie. ANSSI, francuska krajowa agencja cyberbezpieczeństwa, wymaga systematycznej kontroli kopii zapasowych, w szczególności niespójnych wolumenów danych, oraz regularnych testów przywracania. W przypadku SQL Server Microsoft zaznacza, że weryfikacja kopii zapasowej nie sprawdza struktury zawartych w niej danych: dowodem jest tylko rzeczywiste przywrócenie, po którym następuje kontrola spójności.

Kto powinien monitorować alerty dotyczące kopii zapasowych?

Wyznaczona osoba, z zastępcą na czas urlopów. Alert trafiający do współdzielonej skrzynki, której nikt nie czyta, oznacza w praktyce brak alertu. Należy też ustalić, kto powiadamia zarząd, gdy od ostatniej udanej kopii upłynął wcześniej uzgodniony czas.

Potrzebują Państwo pomocy teraz?

Proszę niczego nie odtwarzać, dopóki nie zostanie wskazana nienaruszona kopia. Możemy Państwa przez to przeprowadzić.

Zadzwoń: +33 9 72 50 78 28lub napisz do nas

Trwa incydent?

Nasz zespół pomoże Państwu wskazać właściwą kopię i przeprowadzić odtwarzanie – od poniedziałku do piątku w godz. 9:00–13:00 i 14:00–17:30 (CET).