Okiyumi Status
Caso de estudio de sistema: observabilidad y estado honesto de los servicios
Fiabilidad · infraestructura
El estudio de un sistema de estado en producción: por qué el verde «por dentro» no significa accesible «por fuera».
Contexto
Okiyumi Status es un sistema de observabilidad en producción construido sobre Uptime Kuma, pero no es la página estándar de Kuma: una interfaz pública propia, un gateway de API, una capa de historial y una semántica de monitorización propia. La estudio como ejemplo de pensamiento de sistemas.
Problema
Un health interno verde no significa que el producto sea accesible para el usuario. Un incidente real mostró la diferencia: el sistema estaba vivo por dentro pero inaccesible por fuera, y el monitoreo estándar no veía nada.
Cómo funciona el sistema
- 01
La separación de PUBLIC HEALTH y ORIGIN HEALTH: dos miradas independientes sobre un mismo sistema, nacidas de un incidente real.
- 02
Una interfaz pública propia: estado general, grupos, historial de uptime de 90 días, latencia, SSL, incidentes, mantenimiento y detección de datos obsoletos.
- 03
Memoria larga: historial diario de 730 días, latencia cruda de 90 días, alertas de Telegram mediante una retry queue persistente, monitoreo de backups y un almacén histórico.
Arquitectura
Interfaz pública
RU / EN · tema oscuro / claroGateway de API
capa de historial · semánticaUptime Kuma
monitoreo de 17 serviciosProbes de infraestructura
backups · restore drillEntrega por Telegram
retry queue persistenteFLOW
- 01Origin health→ Probes públicos
- 02Probes públicosla verdad para el usuario→ Estado público
Cifras
todas las métricas son del proyecto, no logros personales
monitores activos
métrica del proyecto
días de historial en la interfaz
métrica del proyecto
días de historial diario
métrica del proyecto
Por qué importa
- Un ejemplo fuerte de cómo quiero pensar: problema → observación → modelo → solución. No «infraestructura por la infraestructura», sino honestidad hacia el usuario.
Qué aprendí
- Un buen monitoreo mide lo que ve el usuario, no lo que es cómodo medir.
Stack
- Uptime Kuma
- custom gateway
- Telegram bot
- nginx
- backups
- probes
Habilidades
- Pensamiento de sistemas
- Análisis de procesos
Resultado
- Se realizó un restore drill real y aislado del backup: la recuperación está probada en la práctica, no asumida.
- Una intuición de producto surgida de un incidente se convirtió en un principio arquitectónico: public vs origin guía todo el sistema.