Skip to content
04Caso de estudio2026

Okiyumi Status

Caso de estudio de sistema: observabilidad y estado honesto de los servicios

Fiabilidad · infraestructura

ORIGINPUBLIC90D UPTIME≠ TRUTH

El estudio de un sistema de estado en producción: por qué el verde «por dentro» no significa accesible «por fuera».

Contexto

Okiyumi Status es un sistema de observabilidad en producción construido sobre Uptime Kuma, pero no es la página estándar de Kuma: una interfaz pública propia, un gateway de API, una capa de historial y una semántica de monitorización propia. La estudio como ejemplo de pensamiento de sistemas.

Problema

Un health interno verde no significa que el producto sea accesible para el usuario. Un incidente real mostró la diferencia: el sistema estaba vivo por dentro pero inaccesible por fuera, y el monitoreo estándar no veía nada.

Cómo funciona el sistema

  • 01

    La separación de PUBLIC HEALTH y ORIGIN HEALTH: dos miradas independientes sobre un mismo sistema, nacidas de un incidente real.

  • 02

    Una interfaz pública propia: estado general, grupos, historial de uptime de 90 días, latencia, SSL, incidentes, mantenimiento y detección de datos obsoletos.

  • 03

    Memoria larga: historial diario de 730 días, latencia cruda de 90 días, alertas de Telegram mediante una retry queue persistente, monitoreo de backups y un almacén histórico.

Arquitectura

Interfaz pública

RU / EN · tema oscuro / claro

Gateway de API

capa de historial · semántica

Uptime Kuma

monitoreo de 17 servicios

Probes de infraestructura

backups · restore drill

Entrega por Telegram

retry queue persistente

FLOW

  1. 01Origin health
    → Probes públicos
  2. 02Probes públicos
    la verdad para el usuario
    → Estado público

Cifras

todas las métricas son del proyecto, no logros personales

17

monitores activos

métrica del proyecto

90

días de historial en la interfaz

métrica del proyecto

730

días de historial diario

métrica del proyecto

Por qué importa

  • Un ejemplo fuerte de cómo quiero pensar: problema → observación → modelo → solución. No «infraestructura por la infraestructura», sino honestidad hacia el usuario.

Qué aprendí

  • Un buen monitoreo mide lo que ve el usuario, no lo que es cómodo medir.

Stack

  • Uptime Kuma
  • custom gateway
  • Telegram bot
  • nginx
  • backups
  • probes

Habilidades

  • Pensamiento de sistemas
  • Análisis de procesos

Resultado

  • Se realizó un restore drill real y aislado del backup: la recuperación está probada en la práctica, no asumida.
  • Una intuición de producto surgida de un incidente se convirtió en un principio arquitectónico: public vs origin guía todo el sistema.