К содержанию
P.
05в продакшене2025 — now

Okiyumi Status

Публичный статус и наблюдаемость production-сервисов

Надёжность · инфраструктура

ORIGINPUBLIC90D UPTIME≠ TRUTH

Мониторинг, который говорит правду: публичное и внутренне здоровье — разные вещи.

Контекст

Продакшен-система статуса и наблюдаемости на базе Uptime Kuma, но не стандартная страница Kuma: собственный публичный интерфейс, API-шлюз, слой истории и семантика мониторинга.

Задача

Зелёный внутренний health ещё не значит, что продукт доступен пользователю. Реальный инцидент показал разницу: система жива изнутри, но недоступна снаружи — и стандартный мониторинг этого не видит.

Решение

  • 01

    Разделение PUBLIC HEALTH и ORIGIN HEALTH: два независимых взгляда на одну систему, выведенные из реального инцидента.

  • 02

    Собственный публичный UI: общий статус, группы, uptime-история на 90 дней, латентность, SSL, инциденты, обслуживание и обнаружение протухших данных.

  • 03

    Долгая память: daily history 730 дней, сырые замеры латентности 90 дней, Telegram-алерты через durable retry queue, мониторинг бэкапов и историческое хранилище.

Архитектура

Публичный UI

RU / EN · dark / light

API gateway

слой истории · семантика

Uptime Kuma

мониторинг 17 сервисов

Infrastructure probes

бэкапы · restore drill

Telegram delivery

durable retry queue

FLOW

  1. 01Origin health
    → Публичные пробы
  2. 02Публичные пробы
    правда для пользователя
    → Public status

Цифры

17

активных мониторов

90

дней истории в UI

730

дней daily-истории

Стек

  • Uptime Kuma
  • custom gateway
  • Telegram bot
  • nginx
  • backups
  • probes

Итог

  • Проведён реальный изолированный restore drill бэкапа — восстановление проверено на практике, а не надежде.
  • Продуктовый вывод из инцидента стал архитектурным решением: public vs origin — принцип всей системы.