Analista SRE Sênior
Grupo Easy
🏢 remoto🎯 senior
Atuar como SRE Sênior na sustentação e evolução de serviços críticos de produção (incluindo IoT e integrações), conduzindo diagnósticos complexos, automações e prevenções. Requer autonomia técnica, colaboração com equipes multidisciplinares e espanhol fluente para comunicação diária com clientes e equipes.
Responsabilidades Principais:
- Gestão de Incidentes: Conduzir criticamente incidentes de produção, acionamentos e comunicação de riscos.
- Troubleshooting: Investigar falhas em aplicações, APIs, bancos, integrações e infraestrutura correlacionando logs, métricas e rastreamentos.
- Análise de Causa Raiz: Elaborar RCA pós-incidente e acompanhar ações preventivas/corretivas.
- Observabilidade e SLOs: Evoluir painéis, alertas acionáveis, SLIs, SLOs e error budgets.
- Automação e Resiliência: Automatizar rotinas de recuperação, reduzir tarefas manuais e avaliar riscos de mudanças.
- Capacidade e Documentação: Analisar consumo de recursos, gargalos e manter runbooks atualizados.
Local de atuação: Remoto
Contratação: PJ ou Cooperado
Tempo de Projeto: Indeterminado
Escala: 5x2 (folgas fixas)
Início previsto: ImediatoRequisitos
- Sólida experiência em SRE, ambientes críticos, AWS/GCP e redes (Unix/Linux, DNS, HTTP/HTTPS, TLS)
- Kubernetes (diagnóstico de pods/escalabilidade), Terraform, Ansible, Git e ArgoCD
- Diagnóstico de APIs REST, aplicações Java, fundamentos de SQL/NoSQL e automação em Python/Shell
- Datadog, Dynatrace, Kibana e/ou Grafana; Jira para incidentes/mudanças; Azure DevOps para pipelines de CI/CD
- Espanhol fluente para reuniões, condução de incidentes e comunicação oral/escrita com o cliente
Diferenciais
- Vivência em telecomunicações, IoT, Apigee, OpenShift e testes de resiliência