SRE Pleno

MedCof

📍 São Paulo/SP🏢 remoto🎯 pleno
Buscamos alguém pra ajudar a manter nossos serviços em produção estáveis, observáveis e confiáveis — cuidando de disponibilidade, resposta a incidentes e melhoria contínua dos nossos ambientes. O que você vai fazer: - Garantir confiabilidade e estabilidade dos ambientes e serviços em produção - Definir e evoluir padrões de observabilidade (logs, métricas, alertas) - Fazer troubleshooting de incidentes e performance - Conduzir análise de causa raiz e ações preventivas - Reduzir toil automatizando rotinas operacionais O que buscamos: - Experiência sustentando ambientes produtivos em cloud (AWS) - Vivência com ECS/Fargate, Datadog/CloudWatch, GitHub Actions, Cloudflare - Conhecimento de SLO, SLI, SLA e error budget - Redes, DNS, load balancer, TLS e proxies - Terraform e experiência com Atlas MongoDB são diferenciais 📍 Remoto (Brasil), com deslocamentos pontuais a São Paulo 📄 Modelo PJ Se você curte entender falhas a fundo, equilibrar velocidade e estabilidade, e construir sistemas mais resilientes, quero falar com você.

Requisitos

  • Experiência sustentando ambientes produtivos em cloud (AWS)
  • Vivência com ECS/Fargate, Datadog/CloudWatch, GitHub Actions, Cloudflare
  • Conhecimento de SLO, SLI, SLA e error budget
  • Redes, DNS, load balancer, TLS e proxies

Diferenciais

  • Terraform
  • Experiência com Atlas MongoDB