Observability i Monitoring
Manje buke. Vise signala. Rano otkrivanje problema i smanjenje MTTR-a.
Pregled
Vecina monitoring sistema generise buku, ne uvid.
Tipicni problemi:
- previse alert-a, vecina se ignorise
- dashboard-i koji lepo izgledaju, ali ne pomazu u debug-u
- nedostatak korelacije izmedju logova, metrika i sistema
- sporo ili kasno otkrivanje stvarnih problema
Monitoring postoji.
Observability ne postoji.
Ova usluga je fokusirana na izgradnju monitoring-a zasnovanog na signalima koji zaista pomaze u upravljanju sistemom.

Izvršeni radovi po ovoj usluzi
Oporavak RabbitMQ klastera nakon ispada noda: kako je nedovoljno pracenje dovelo do split-brain klastera
Incident sa RabbitMQ Streams gde su neki upisi prolazili, dok su drugi padali sa porukom da je coordinator unavailable. Kako smo identifikovali autoritativno Raft stanje, bezbedno oporavili klaster i popravili propust u pracenju koji je dozvolio da split-brain stanje ostane neprimeceno.
NGINX 502 greske sa jednog load balancera: kako je segfault izazvao trajne upstream neuspehe
Jedan load balancer je nastavljao da vraca 502 greske iako je svaki backend bio zdrav. Osnovni uzrok bio je NGINX segfault tokom rotacije logova, a dugorocni popravak je spojio pracenje 5xx stope sa automatskim oporavkom od padova prijavljenih iz kernela.