Мониторинг и метрики
Узнаешь о проблеме раньше пользователей: метрики для Prometheus, SLI и p95 по логам, алерты без ложных тревог.
Мониторинг начинается с вопроса «а как это посчитать». Сначала метрики из /proc: uptime, load average, память, процессы, дескрипторы — в формате Prometheus с лейблами. Потом метрики из логов: ошибки, сводка по статусам, доля 2xx, медиана и p95. Дальше — проверки: время ответа, открыт ли порт, заполнен ли диск, жив ли сервис. Финал — алерт с гистерезисом, который не дёргается на каждом всплеске.
- Экспортёр метрикилегко
- Uptime как метрикалегко
- Load average как метрикасредне
- Память из /proc/meminfoсредне
- Число процессов как метрикасредне
- Число дескрипторов процессасредне
- Prometheus: метрика с лейбламисредне
- Счётчики по уровню логасредне
- Посчитай ошибки в логелегко
- Сводка по статусам в логесредне
- SLI: доля 2xxсредне
- Медиана времени ответасредне
- p95 времени ответасложно
- Измерь время ответасредне
- Проверь доступность сервисасредне
- Алерт по дискусложно
- Healthcheck с логом паденийсложно
- Алерт с гистерезисомсложно