Okiyumi Status
Публичный статус и наблюдаемость production-сервисов
Надёжность · инфраструктура
Мониторинг, который говорит правду: публичное и внутренне здоровье — разные вещи.
Контекст
Продакшен-система статуса и наблюдаемости на базе Uptime Kuma, но не стандартная страница Kuma: собственный публичный интерфейс, API-шлюз, слой истории и семантика мониторинга.
Задача
Зелёный внутренний health ещё не значит, что продукт доступен пользователю. Реальный инцидент показал разницу: система жива изнутри, но недоступна снаружи — и стандартный мониторинг этого не видит.
Решение
- 01
Разделение PUBLIC HEALTH и ORIGIN HEALTH: два независимых взгляда на одну систему, выведенные из реального инцидента.
- 02
Собственный публичный UI: общий статус, группы, uptime-история на 90 дней, латентность, SSL, инциденты, обслуживание и обнаружение протухших данных.
- 03
Долгая память: daily history 730 дней, сырые замеры латентности 90 дней, Telegram-алерты через durable retry queue, мониторинг бэкапов и историческое хранилище.
Архитектура
Публичный UI
RU / EN · dark / lightAPI gateway
слой истории · семантикаUptime Kuma
мониторинг 17 сервисовInfrastructure probes
бэкапы · restore drillTelegram delivery
durable retry queueFLOW
- 01Origin health→ Публичные пробы
- 02Публичные пробыправда для пользователя→ Public status
Цифры
активных мониторов
дней истории в UI
дней daily-истории
Стек
- Uptime Kuma
- custom gateway
- Telegram bot
- nginx
- backups
- probes
Итог
- Проведён реальный изолированный restore drill бэкапа — восстановление проверено на практике, а не надежде.
- Продуктовый вывод из инцидента стал архитектурным решением: public vs origin — принцип всей системы.