El sistema que se congelaba por culpa de otro
El sistema de tickets se congelaba cada día pico y todos miraban al sistema de tickets. Los logs del balanceador llevaron a un código del dashboard que consultaba una API interna en cada login, y detrás, a una API que no escalaba. Síntoma en un sistema, causa en otro, evidencia en un tercero. Código reescrito, API escalada, temporada salvada.
SÍNTOMA → LOGS → CÓDIGO → CAUSA
Cuando agregar servidores no resolvió nada
Una aplicación legada escalaba servidores sobre un caché FSx compartido y la latencia no se movía, con los tableros de AWS diciendo que el almacenamiento estaba sano. El cuello estaba en las operaciones de metadata, visible recién al comparar métricas del agente de CloudWatch contra una línea base de pruebas de carga. El caché pasó a volúmenes NVMe con stickiness y el sistema aguantó 170,000 requests por minuto, 10,000 usuarios concurrentes en una ventana de 15 minutos.
170,000 REQ/MIN · 10,000 USUARIOS CONCURRENTES