Buscamos alguém pra ajudar a manter nossos serviços em produção estáveis, observáveis e confiáveis — cuidando de disponibilidade, resposta a incidentes e melhoria contínua dos nossos ambientes.
O que você vai fazer: - Garantir confiabilidade e estabilidade dos ambientes e serviços em produção
- Definir e evoluir padrões de observabilidade (logs, métricas, alertas)
- Fazer troubleshooting de incidentes e performance
- Conduzir análise de causa raiz e ações preventivas
- Reduzir toil automatizando rotinas operacionais
O que buscamos:
- Experiência sustentando ambientes produtivos em cloud (AWS)
- Vivência com ECS/Fargate, Datadog/CloudWatch, GitHub Actions, Cloudflare
- Conhecimento de SLO, SLI, SLA e error budget
- Redes, DNS, load balancer, TLS e proxies
- Terraform e experiência com Atlas MongoDB são diferenciais
📍 Remoto (Brasil), com deslocamentos pontuais a São Paulo
📄 Modelo PJ
Se você curte entender falhas a fundo, equilibrar velocidade e estabilidade, e construir sistemas mais resilientes, quero falar com você.Requisitos
- Experiência sustentando ambientes produtivos em cloud (AWS)
- Vivência com ECS/Fargate, Datadog/CloudWatch, GitHub Actions, Cloudflare
- Conhecimento de SLO, SLI, SLA e error budget
- Redes, DNS, load balancer, TLS e proxies
Diferenciais
- Terraform
- Experiência com Atlas MongoDB