Okiyumi Status
Caso di studio di sistema: osservabilità e stato onesto dei servizi
Affidabilità · infrastruttura
Lo studio di un sistema di stato in produzione: perché il verde «dentro» non significa raggiungibile «fuori».
Contesto
Okiyumi Status è un sistema di osservabilità in produzione costruito su Uptime Kuma — ma non la pagina standard di Kuma: un'interfaccia pubblica propria, un gateway API, uno storico e una semantica di monitoraggio propria. La studio come esempio di pensiero sistemico.
Problema
Un health interno verde non significa che il prodotto sia raggiungibile per l'utente. Un incidente reale ha mostrato la differenza: il sistema era vivo dentro ma irraggiungibile fuori — e il monitoraggio standard non vedeva nulla.
Come funziona il sistema
- 01
La separazione di PUBLIC HEALTH e ORIGIN HEALTH: due sguardi indipendenti sullo stesso sistema, nati da un incidente reale.
- 02
Un'interfaccia pubblica propria: stato complessivo, gruppi, storico uptime di 90 giorni, latenza, SSL, incidenti, manutenzione e rilevamento di dati obsoleti.
- 03
Memoria lunga: storico giornaliero di 730 giorni, latenza grezza di 90 giorni, alert Telegram tramite una retry queue persistente, monitoraggio dei backup e uno storico dedicato.
Architettura
Interfaccia pubblica
RU / EN · tema scuro / chiaroGateway API
strato storico · semanticaUptime Kuma
monitoraggio di 17 serviziProbe infrastrutturali
backup · restore drillConsegna Telegram
retry queue persistenteFLOW
- 01Origin health→ Probe pubbliche
- 02Probe pubblichela verità per l'utente→ Stato pubblico
Numeri
tutte le metriche si riferiscono al progetto, non a risultati personali
monitor attivi
metrica del progetto
giorni di storico nell'interfaccia
metrica del progetto
giorni di storico giornaliero
metrica del progetto
Perché è importante
- Un esempio forte di come voglio pensare: problema → osservazione → modello → soluzione. Non «infrastruttura per l'infrastruttura», ma onestà verso l'utente.
Cosa ho imparato
- Un buon monitoraggio misura ciò che vede l'utente, non ciò che è comodo misurare.
Stack
- Uptime Kuma
- custom gateway
- Telegram bot
- nginx
- backups
- probes
Competenze
- Pensiero sistemico
- Analisi dei processi
Risultato
- È stato eseguito un restore drill reale e isolato del backup — il ripristino è provato in pratica, non dato per scontato.
- Un'intuizione di prodotto nata da un incidente è diventata un principio architetturale: public vs origine guida l'intero sistema.