Um plantão sustentável mantém os especialistas em Rust eficazes: rotações curtas o suficiente para recuperação, alertas que significam ação e runbooks que reduzem a improvisação às 3 da manhã. Engenheiros de plantão esgotados entregam mais incidentes, não menos.
Cartão de receita de referência rápida - pronto para copiar e colar.
# Checklist de saúde do plantão (trimestral)## Rotação- [ ] Turno primário <= 7 dias (ou siga o sol)- [ ] Secundário definido para cada primário- [ ] Documento de passagem de plantão modelo usado toda segunda-feira## Higiene de alertas- [ ] < 5 páginas/semana por serviço (mediana)- [ ] Cada alerta de página tem link para runbook- [ ] Alertas intermitentes corrigidos ou silenciados com ticket## Bem-estar- [ ] Páginas após incidente revisadas para redução de trabalho repetitivo- [ ] Política de compensação aplicada quando > 2 páginas/noite- [ ] Nenhuma cultura de "herói" para alertas preveníveis
Quando usar:
Configurando o primeiro plantão de produção para um serviço Rust
Volume de alertas dobrou após nova implantação
Esgotamento ou rotatividade de engenheiros na equipe de plataforma
Ticket - Corrigir em horário comercial; limite sustentado por 30+ min.
Log - Tendência informativa; apenas dashboard.
Serviços Rust: prefira páginas em taxa de erro, taxa de pânico e falhas de prontidão em vez de CPU bruta, a menos que a CPU se correlacione com a perda do SLO.