Skip to content
04Caso di studio2026

Okiyumi Status

Caso di studio di sistema: osservabilità e stato onesto dei servizi

Affidabilità · infrastruttura

ORIGINPUBLIC90D UPTIME≠ TRUTH

Lo studio di un sistema di stato in produzione: perché il verde «dentro» non significa raggiungibile «fuori».

Contesto

Okiyumi Status è un sistema di osservabilità in produzione costruito su Uptime Kuma — ma non la pagina standard di Kuma: un'interfaccia pubblica propria, un gateway API, uno storico e una semantica di monitoraggio propria. La studio come esempio di pensiero sistemico.

Problema

Un health interno verde non significa che il prodotto sia raggiungibile per l'utente. Un incidente reale ha mostrato la differenza: il sistema era vivo dentro ma irraggiungibile fuori — e il monitoraggio standard non vedeva nulla.

Come funziona il sistema

  • 01

    La separazione di PUBLIC HEALTH e ORIGIN HEALTH: due sguardi indipendenti sullo stesso sistema, nati da un incidente reale.

  • 02

    Un'interfaccia pubblica propria: stato complessivo, gruppi, storico uptime di 90 giorni, latenza, SSL, incidenti, manutenzione e rilevamento di dati obsoleti.

  • 03

    Memoria lunga: storico giornaliero di 730 giorni, latenza grezza di 90 giorni, alert Telegram tramite una retry queue persistente, monitoraggio dei backup e uno storico dedicato.

Architettura

Interfaccia pubblica

RU / EN · tema scuro / chiaro

Gateway API

strato storico · semantica

Uptime Kuma

monitoraggio di 17 servizi

Probe infrastrutturali

backup · restore drill

Consegna Telegram

retry queue persistente

FLOW

  1. 01Origin health
    → Probe pubbliche
  2. 02Probe pubbliche
    la verità per l'utente
    → Stato pubblico

Numeri

tutte le metriche si riferiscono al progetto, non a risultati personali

17

monitor attivi

metrica del progetto

90

giorni di storico nell'interfaccia

metrica del progetto

730

giorni di storico giornaliero

metrica del progetto

Perché è importante

  • Un esempio forte di come voglio pensare: problema → osservazione → modello → soluzione. Non «infrastruttura per l'infrastruttura», ma onestà verso l'utente.

Cosa ho imparato

  • Un buon monitoraggio misura ciò che vede l'utente, non ciò che è comodo misurare.

Stack

  • Uptime Kuma
  • custom gateway
  • Telegram bot
  • nginx
  • backups
  • probes

Competenze

  • Pensiero sistemico
  • Analisi dei processi

Risultato

  • È stato eseguito un restore drill reale e isolato del backup — il ripristino è provato in pratica, non dato per scontato.
  • Un'intuizione di prodotto nata da un incidente è diventata un principio architetturale: public vs origine guida l'intero sistema.