Rollback czy hotfix podczas awarii produkcji

·3 min czytania

Podczas incydentu wybierz działanie najpewniej przywracające usługę przy kontrolowanym ryzyku.

Dwie wieże serwerowe połączone przerwaną ścieżką i ciągłą drogą odzyskiwania.

Podczas incydentu wybierz działanie najpewniej przywracające usługę przy kontrolowanym ryzyku. Poprzednia wersja nie przywraca automatycznie dawnych danych. Hotfix zmienia wersję bieżącą i wymaga dostatecznie potwierdzonej przyczyny oraz sprawdzalnej poprawki.

Sprawdź granice zmian

Porównaj początek problemu z wdrożeniami, konfiguracją, migracjami i dostawcami. Czy stara wersja odczytuje i zapisuje obecne dane? Destrukcyjna migracja lub nieodwracalne działanie zewnętrzne może zablokować prosty powrót. Zachowaj dowody, jednocześnie ograniczając trwającą szkodę.

Porównaj sposoby odzyskania

Uwzględnij wyłączenie funkcji, zmianę ruchu i ograniczenie obciążenia obok zmiany kodu. Porównaj czas wykonania i potwierdzenia, zasięg, odwracalność i koszt pomyłki. Hotfix powinien usuwać wąską przyczynę. Korekty danych i migracje są osobnymi kontrolowanymi krokami, nie ukrytym skutkiem wdrożenia.

Działaj w koordynacji

Wyznacz wykonawcę, zapowiedz wynik i kryterium sukcesu. Unikaj równoległych zmian niemożliwych do rozróżnienia. Użyj znanej drogi wydania i zachowaj ślad. Sprawdź prawdziwe ścieżki, kolejki i integralność. Zdrowy proces nie dowodzi nadrobienia utraconej pracy; zamknij po uzgodnionej stabilności i przypisaniu reszty działań.

Przykład i dowód odbioru

Nowa wersja może zapisywać obowiązkowe dane nieznane poprzedniej. Dostępny stary obraz nie czyni wycofania bezpiecznym. Sprawdź zgodność z aktualnymi danymi i możliwość ograniczenia ścieżki przełącznikiem funkcji. Mały hotfix może być właściwszy. Przed wykonaniem zapisz działanie, oczekiwany sygnał i warunek zatrzymania, potem sprawdź zaległe zadania. To chroni przed myleniem startującej aplikacji z odzyskaną operacją biznesową. Uzgodnij, kto w tym czasie nie wprowadza innych zmian. Druga interwencja może chwilowo poprawić metryki i stworzyć fałszywe wrażenie usunięcia pierwotnej przyczyny. W dzienniku zachowaj kolejność i czas każdej czynności. Dzięki temu przegląd po incydencie oceni decyzję na podstawie dostępnych faktów, a nie przypadkowego końcowego obrazu systemu.

Najczęstsze pytania

Czy rollback zawsze jest szybszy?

Nie. Zgodność i dane mogą uczynić go wolnym albo niebezpiecznym.

Czy można cofnąć migrację?

Tylko prawidłową przetestowaną ścieżką dla aktualnych danych.

Kiedy hotfix ma sens?

Przy wąskiej potwierdzonej przyczynie i niższym ryzyku niż alternatywy.

Czy kilka zespołów może działać?

Tak, przy koordynacji zapobiegającej sprzecznym zmianom.

Kiedy zamknąć incydent?

Po kontroli usługi i danych oraz przypisaniu pozostałej pracy.

Od pomysłu do wykonalnego zakresu

Prześlij ścieżkę użytkownika, integracje i ograniczenia terminu. Możemy przygotować wycenę z założeniami i wyłączeniami.

Warto doczytać

Odzyskiwanie po awarii: sprawdź RTO i RPO

Plan odzyskiwania jest wiarygodny, gdy można przywrócić użyteczną usługę.

Runbook produkcyjny dla małego zespołu

Runbook pomaga przejść od konkretnego objawu do bezpiecznej decyzji.

Waga incydentu: praktyczna macierz eskalacji

Waga opisuje rzeczywisty lub wiarygodny wpływ biznesowy, nie dramatyzm komunikatu w logu.