Analista Operações Cloud (SRE) | Pleno

Empresa confidencial

🎯 pleno
Quais serão suas atividades do dia-a-dia? - Observabilidade e monitoração: Construir e evoluir a monitoração dos ambientes de produção, com foco em antecipar falha; Definir e instrumentar indicadores que representem experiência real de uso, não apenas saúde de recurso; Reduzir ruído de alerta e falso positivo; Manter dashboards que sustentem decisão técnica. - Automação e redução de toil: Identificar e eliminar trabalho manual repetitivo: provisionamento, configuração, rotinas operacionais; Evoluir infraestrutura como código (Terraform, Helm) como fonte única de verdade; Desenvolver scripts e automações em Python e Shell para operações recorrentes; Converter procedimento não documentado em runbook executável. - Sustentação e resposta a incidente: Atuar na triagem, mitigação e resolução de incidentes de produção; Documentar e apoiar post-mortem com foco em causa raiz e ação preventiva; Sustentar os ambientes junto do time de engenharia; Acompanhar consumo e custo de infraestrutura, gerando visibilidade para decisão técnica.

Requisitos

  • Experiência demonstrável, não familiaridade conceitual
  • Ter operado Kubernetes em produção: debug de pod, análise de consumo de recurso, entendimento de modos de falha Cloud em ambiente de missão crítica — AWS preferencialmente
  • Ter escrito e mantido infraestrutura como código com Terraform e Helm, incluindo revisão de mudança de outra pessoa
  • Ter construído monitoração com Prometheus e Grafana: criação de métrica e regra de alerta, não apenas consumo de dashboard pronto
  • Troubleshooting em Linux com autonomia: serviços, processos, rede, disco, análise de log
  • Automações em Python ou Shell que outras pessoas passaram a usar
  • Participação em resposta a incidente de produção, com clareza sobre quando resolver e quando escalar
  • Conhecimento de rede suficiente para investigar: segmentação, DNS, TLS, VPN, ferramentas de debug

Diferenciais

  • Experiência em ambiente regulado: financeiro, seguros ou similar
  • Vivência com APIs, REST e gateway de API
  • Gerenciamento de logs em escala (Elasticsearch, OpenSearch, Loki ou equivalente)
  • Construção e manutenção de pipelines de CI/CD
  • Prática de definição de SLI e SLO, e uso de error budget para orientar decisão
  • Configuração como código (Ansible ou equivalente)
  • Inglês para leitura de documentação técnica