Analista SRE Sênior

Grupo Easy

🏢 remoto🎯 senior
Atuar como SRE Sênior na sustentação e evolução de serviços críticos de produção (incluindo IoT e integrações), conduzindo diagnósticos complexos, automações e prevenções. Requer autonomia técnica, colaboração com equipes multidisciplinares e espanhol fluente para comunicação diária com clientes e equipes. Responsabilidades Principais: - Gestão de Incidentes: Conduzir criticamente incidentes de produção, acionamentos e comunicação de riscos. - Troubleshooting: Investigar falhas em aplicações, APIs, bancos, integrações e infraestrutura correlacionando logs, métricas e rastreamentos. - Análise de Causa Raiz: Elaborar RCA pós-incidente e acompanhar ações preventivas/corretivas. - Observabilidade e SLOs: Evoluir painéis, alertas acionáveis, SLIs, SLOs e error budgets. - Automação e Resiliência: Automatizar rotinas de recuperação, reduzir tarefas manuais e avaliar riscos de mudanças. - Capacidade e Documentação: Analisar consumo de recursos, gargalos e manter runbooks atualizados. Local de atuação: Remoto Contratação: PJ ou Cooperado Tempo de Projeto: Indeterminado Escala: 5x2 (folgas fixas) Início previsto: Imediato

Requisitos

  • Sólida experiência em SRE, ambientes críticos, AWS/GCP e redes (Unix/Linux, DNS, HTTP/HTTPS, TLS)
  • Kubernetes (diagnóstico de pods/escalabilidade), Terraform, Ansible, Git e ArgoCD
  • Diagnóstico de APIs REST, aplicações Java, fundamentos de SQL/NoSQL e automação em Python/Shell
  • Datadog, Dynatrace, Kibana e/ou Grafana; Jira para incidentes/mudanças; Azure DevOps para pipelines de CI/CD
  • Espanhol fluente para reuniões, condução de incidentes e comunicação oral/escrita com o cliente

Diferenciais

  • Vivência em telecomunicações, IoT, Apigee, OpenShift e testes de resiliência