Een productierunbook voor kleine teams

·3 min leestijd

Een runbook helpt van een specifiek symptoom naar een veilige beslissing.

Twee servertorens verbonden door een onderbroken pad en een doorlopende herstelroute.

Een runbook helpt van een specifiek symptoom naar een veilige beslissing. Het is geen verzameling van alle beschikbare opdrachten. Schrijf voor iemand met de verwachte vaardigheden die moe kan zijn of het onderdeel nog weinig kent.

Met signaal en impact beginnen

Noem alarm, getroffen route en toepassingsvoorwaarden. Link het dashboard en leg uit welke observatie vergelijkbare oorzaken onderscheidt. Voeg eigenaar, controledatum en escalatie toe. De instructie moet bereikbaar blijven als de hoofdapplicatie faalt; de opslaglocatie is daarmee onderdeel van het beheerontwerp.

Voorwaarden en stopgrenzen vastleggen

Beschrijf rechten, omgevingskeuze en goedkeuring voor ingrijpende acties. Bepaal wanneer onverklaarde data, ontbrekende backup of tegensprekende resultaten stoppen en escaleren vereisen. Neem geen geheimen op. Iedere stap krijgt doel, verwacht resultaat en volgende keuze, inclusief gevolgen voor lopend werk.

Verificatie en onderhoud opnemen

Leg bij herstart, replay of failover dubbele verwerking en terugval uit. Controleer klantroute en achterstallig werk en noteer acties en vervolgpunten. Laat iemand anders de instructie veilig proberen. Werk bij na relevante wijzigingen en incidenten. Een korte geteste handleiding is betrouwbaarder dan een lang verlaten document.

Een concreet acceptatievoorbeeld

Bij een groeiende queue onderscheidt de instructie ontbrekende workers, een trage provider en één steeds falende taak. Alles herstarten kan de oorzaak verbergen of extra herhalingen veroorzaken. Benoem de waarneming die iedere tak bevestigt en de volgende beperkte actie. Een andere persoon moet het juiste pad kiezen en queue én zakelijk resultaat controleren. Noteer onbegrepen uitvoer en ontbrekende rechten als verbeteringen. Acceptatie draait niet om alle opdrachten uitvoeren. Zij draait om voldoende bewijs voor een veilige keuze en een duidelijk stopmoment. Leg daarom ook vast wanneer de wachtrijgroei verwacht is en geen ingreep nodig heeft, bijvoorbeeld tijdens een afgesproken gecontroleerde batch.

Veelgestelde vragen

Moeten commando’s erin?

Ja, beoordeeld en met voorwaarden, bereik en verwachte uitkomst.

Hoe lang moet het zijn?

Zo lang als het concrete beslispad vraagt, zonder afleidende details.

Wie moet het testen?

Iemand anders dan de auteur met de verwachte toegang en vaardigheden.

Wat als de werkelijkheid afwijkt?

Stop bij de vastgelegde grens, bewaar bewijs en escaleer.

Wanneer bijwerken?

Na wijzigingen, oefeningen en incidenten die aannames veranderen.

Maak van uw idee een uitvoerbare scope

Deel het gebruikerspad, de koppelingen en de voorwaarden voor lancering. We kunnen een raming met aannames en uitsluitingen opstellen.

Bekijk de dienstverlening →

Verder lezen

Bereikbaarheidsdienst zonder eigen SRE-team

Een klein team kan bruikbare bereikbaarheidsdienst organiseren als beloften bij middelen passen.

Incidenternst: een praktische escalatiematrix

Ernst beschrijft actuele of geloofwaardige zakelijke impact, niet hoe alarmerend een log klinkt.

Rollback of hotfix tijdens een productie-incident

Kies tijdens een incident de actie die waarschijnlijk het snelst verantwoord bruikbare dienstverlening herstelt.