Digiage Technologies · seguradora multinacional · 06/2024 - Atual
Data Lake e Observabilidade de ETLs em Escala
// Problema
Um data lake de ~900 TB em constante crescimento, com múltiplas squads gerando ETLs, tinha detecção de falhas puramente reativa — problemas só apareciam quando um usuário de negócio reportava dado incorreto ou ausente, muitas vezes dias depois da falha original.
// Solução
- → Liderei squad de 5-8 engenheiros na arquitetura e governança do lake, com padronização de camadas (bronze/silver/gold) e dos Glue Workflows/Jobs.
- → Implantei observabilidade do zero: biblioteca Python compartilhada entre os jobs Glue, com alertas via Lambda no Microsoft Teams (detalhes do erro + link direto para o CloudWatch).
- → Padronizei o processo de triagem: qualquer falha chega ao time com contexto suficiente para diagnóstico imediato.
// Impacto
Detecção reativa por incidente → resolução proativa, antes da percepção do usuário final.