Een runbook helpt van een specifiek symptoom naar een veilige beslissing.

Een runbook helpt van een specifiek symptoom naar een veilige beslissing. Het is geen verzameling van alle beschikbare opdrachten. Schrijf voor iemand met de verwachte vaardigheden die moe kan zijn of het onderdeel nog weinig kent.
Met signaal en impact beginnen
Noem alarm, getroffen route en toepassingsvoorwaarden. Link het dashboard en leg uit welke observatie vergelijkbare oorzaken onderscheidt. Voeg eigenaar, controledatum en escalatie toe. De instructie moet bereikbaar blijven als de hoofdapplicatie faalt; de opslaglocatie is daarmee onderdeel van het beheerontwerp.
Voorwaarden en stopgrenzen vastleggen
Beschrijf rechten, omgevingskeuze en goedkeuring voor ingrijpende acties. Bepaal wanneer onverklaarde data, ontbrekende backup of tegensprekende resultaten stoppen en escaleren vereisen. Neem geen geheimen op. Iedere stap krijgt doel, verwacht resultaat en volgende keuze, inclusief gevolgen voor lopend werk.
Verificatie en onderhoud opnemen
Leg bij herstart, replay of failover dubbele verwerking en terugval uit. Controleer klantroute en achterstallig werk en noteer acties en vervolgpunten. Laat iemand anders de instructie veilig proberen. Werk bij na relevante wijzigingen en incidenten. Een korte geteste handleiding is betrouwbaarder dan een lang verlaten document.
Een concreet acceptatievoorbeeld
Bij een groeiende queue onderscheidt de instructie ontbrekende workers, een trage provider en één steeds falende taak. Alles herstarten kan de oorzaak verbergen of extra herhalingen veroorzaken. Benoem de waarneming die iedere tak bevestigt en de volgende beperkte actie. Een andere persoon moet het juiste pad kiezen en queue én zakelijk resultaat controleren. Noteer onbegrepen uitvoer en ontbrekende rechten als verbeteringen. Acceptatie draait niet om alle opdrachten uitvoeren. Zij draait om voldoende bewijs voor een veilige keuze en een duidelijk stopmoment. Leg daarom ook vast wanneer de wachtrijgroei verwacht is en geen ingreep nodig heeft, bijvoorbeeld tijdens een afgesproken gecontroleerde batch.
- Bijbehorende dienst
- Bereikbaarheidsdienst zonder eigen SRE-team
- Incidenternst: een praktische escalatiematrix
Veelgestelde vragen
Moeten commando’s erin?
Ja, beoordeeld en met voorwaarden, bereik en verwachte uitkomst.
Hoe lang moet het zijn?
Zo lang als het concrete beslispad vraagt, zonder afleidende details.
Wie moet het testen?
Iemand anders dan de auteur met de verwachte toegang en vaardigheden.
Wat als de werkelijkheid afwijkt?
Stop bij de vastgelegde grens, bewaar bewijs en escaleer.
Wanneer bijwerken?
Na wijzigingen, oefeningen en incidenten die aannames veranderen.
Maak van uw idee een uitvoerbare scope
Deel het gebruikerspad, de koppelingen en de voorwaarden voor lancering. We kunnen een raming met aannames en uitsluitingen opstellen.
Verder lezen
Bereikbaarheidsdienst zonder eigen SRE-team
Een klein team kan bruikbare bereikbaarheidsdienst organiseren als beloften bij middelen passen.
Incidenternst: een praktische escalatiematrix
Ernst beschrijft actuele of geloofwaardige zakelijke impact, niet hoe alarmerend een log klinkt.
Rollback of hotfix tijdens een productie-incident
Kies tijdens een incident de actie die waarschijnlijk het snelst verantwoord bruikbare dienstverlening herstelt.