- Internet → Caddy + login Google
- Caddy + login Google → Servicios
- Servicios → Monitor (60+)
- Monitor (60+) → Alertas push
- Servicios → Backups probados
El problema
Todo lo anterior tiene que estar andando cuando alguien lo necesita. Una vez, una actualización dejó caído el gateway de los agentes un mes y medio sin que nadie lo notara. A partir de ahí, operar dejó de ser un detalle.
Qué construí
- Un servidor propio para Nimbo y el servidor físico de Somos BZ, administrados de punta a punta: Linux, systemd, Docker y Caddy como proxy con certificados automáticos.
- Login con Google (oauth2-proxy) delante de cada panel interno, con un proxy por audiencia para que el acceso de un grupo no abra lo de otro.
- Monitoreo propio con más de sesenta chequeos (servicios, certificados, timers, colas, tokens, edad de los backups) que manda un aviso push cuando algo cae y cuando vuelve, con anti-ruido.
- Deploys con scripts idempotentes, healthcheck y vuelta atrás.
- Backups diarios con restauración probada.
Cómo funciona
Los servicios escuchan en loopback detrás del proxy y, donde se puede, con un usuario de sistema propio. Las alertas críticas salen por una vía que no depende de los agentes, porque un aviso que depende del sistema que se cayó se cae con él.
Estado y resultado
En producción. Es la base de todos los proyectos de esta página.
Stack
- Linux
- systemd
- Docker
- Caddy
- oauth2-proxy