SRE-301
Advanced
⏱ 8 weeks
Advanced SRE & Observability
Deep observability and reliability at scale: distributed tracing, alert design, chaos engineering, capacity planning and mature on-call practice.
Prerequisites: SRE-201 SRE Fundamentals
Syllabus
Module 1 — Observability
- Three pillars: metrics, logs, traces
- OpenTelemetry
- Distributed tracing with Jaeger/Tempo
Module 2 — Alerting that works
- Symptom-based alerting
- Burn-rate alerts on SLOs
- Reducing alert fatigue
Module 3 — Resilience engineering
- Chaos experiments
- Load testing
- Graceful degradation patterns
Module 4 — Scale & practice
- Capacity planning
- Performance analysis
- Production readiness reviews
- Building an on-call rotation