Severity: P2 | Team: Infrastructure
- CPU > 80% sustained for 5+ minutes
- Grafana alert:
HighCPUUsage - Slow API responses / timeouts
# Identify top CPU consumers
kubectl top pods -n gistpin --sort-by=cpu
# Check recent deployments
kubectl rollout history deployment/gistpin-backend
# Inspect pod logs for hot loops
kubectl logs -n gistpin -l app=gistpin-backend --tail=100- Scale out if load-driven:
kubectl scale deployment/gistpin-backend --replicas=5
- Rollback if caused by a bad deploy:
kubectl rollout undo deployment/gistpin-backend
- Kill runaway pod if isolated:
kubectl delete pod <pod-name> -n gistpin
If unresolved after 15 min → page on-call engineer via PagerDuty.
File a post-mortem within 48 hours using the template in incident-response.md.