← Все курсы

Мониторинг и метрики

Узнаешь о проблеме раньше пользователей: метрики для Prometheus, SLI и p95 по логам, алерты без ложных тревог.

Мониторинг начинается с вопроса «а как это посчитать». Сначала метрики из /proc: uptime, load average, память, процессы, дескрипторы — в формате Prometheus с лейблами. Потом метрики из логов: ошибки, сводка по статусам, доля 2xx, медиана и p95. Дальше — проверки: время ответа, открыт ли порт, заполнен ли диск, жив ли сервис. Финал — алерт с гистерезисом, который не дёргается на каждом всплеске.

18 заданий
  1. Экспортёр метрикилегко
  2. Uptime как метрикалегко
  3. Load average как метрикасредне
  4. Память из /proc/meminfoсредне
  5. Число процессов как метрикасредне
  6. Число дескрипторов процессасредне
  7. Prometheus: метрика с лейбламисредне
  8. Счётчики по уровню логасредне
  9. Посчитай ошибки в логелегко
  10. Сводка по статусам в логесредне
  11. SLI: доля 2xxсредне
  12. Медиана времени ответасредне
  13. p95 времени ответасложно
  14. Измерь время ответасредне
  15. Проверь доступность сервисасредне
  16. Алерт по дискусложно
  17. Healthcheck с логом паденийсложно
  18. Алерт с гистерезисомсложно