Site Reliability Engineer (SRE)

TrustPanel

🏢 remoto
A TrustPanel é uma plataforma B2B SaaS voltada ao mercado de certificação digital no Brasil. Atendemos escritórios de contabilidade, escritórios de advocacia e empresas que precisam gerenciar certificados digitais com governança, auditoria e controle de acesso. O ESCOPO Buscamos um profissional autônomo para estruturar a frente de confiabilidade e performance da plataforma. O trabalho tem um bloco inicial de implantação e, depois disso, espaço para continuidade em regime de acompanhamento. - Testes de carga, estresse e escalabilidade - Desenhar e executar testes que estabeleçam a linha de base de capacidade da plataforma, identificar gargalos e traduzir os resultados em recomendações concretas de arquitetura e tuning. - Observabilidade e monitoramento - Construir a stack de métricas, logs e traces. Criar painéis operacionais e definir SLIs, SLOs e uma política de alertas acionáveis, cada alerta com dono e runbook, sem ruído. - Alta disponibilidade - Mapear e eliminar pontos únicos de falha, definir e testar RTO/RPO, revisar política de backup e restore, e implantar deploy sem downtime com rollback confiável. - Infraestrutura e automação - Evoluir infraestrutura como código, pipelines de CI/CD e a orquestração de containers. REQUISITOS OBRIGATÓRIOS - Experiência comprovada como SRE, DevOps ou Engenheiro de Infraestrutura em SaaS de produção - Docker e Kubernetes em produção, não apenas laboratório - Balanceamento de carga e proxy reverso: Traefik, Nginx, HAProxy ou ALB/NLB - OpenSearch ou Elasticsearch: operação de cluster, dimensionamento, gestão de índices e monitoramento de saúde - PostgreSQL e Redis em produção: replicação, pooling, cache e tuning - Testes de carga com k6, JMeter, Gatling ou Locust - Prometheus e Grafana: dashboards e alertas desenhados do zero - AWS, Linux, redes (DNS, TLS, roteamento) e scripting - Infraestrutura como código (Terraform, Ansible ou equivalente) e CI/CD DIFERENCIAIS - OpenTelemetry e tracing distribuído - Ambientes com requisitos regulatórios: LGPD, ISO 27001, SOC 2 - Cloudflare - Experiência em ambientes multi-tenant - Noções de PKI, TLS ou certificados digitais PERFIL QUE BUSCAMOS Autonomia de verdade. Você organiza seu tempo e responde por entregas, não por horário. Pragmatismo. Queremos a solução que resolve o problema no nosso estágio, não a mais sofisticada no papel. Capacidade de documentar. O trabalho é de estruturação, e o time interno precisa conseguir operar depois. COMO SE CANDIDATAR Envie currículo ou LinkedIn para vagas@trustpanel.com.br com o assunto "SRE PJ — TrustPanel", informando disponibilidade semanal e valor/hora. Para se destacar, conte em poucos parágrafos sobre um incidente de produção que você resolveu: o que quebrou, como descobriu, o que fez para estancar e o que mudou depois para não se repetir.

Requisitos

  • Experiência comprovada como SRE, DevOps ou Engenheiro de Infraestrutura em SaaS de produção
  • Docker e Kubernetes em produção, não apenas laboratório
  • Balanceamento de carga e proxy reverso: Traefik, Nginx, HAProxy ou ALB/NLB
  • OpenSearch ou Elasticsearch: operação de cluster, dimensionamento, gestão de índices e monitoramento de saúde
  • PostgreSQL e Redis em produção: replicação, pooling, cache e tuning
  • Testes de carga com k6, JMeter, Gatling ou Locust
  • Prometheus e Grafana: dashboards e alertas desenhados do zero
  • AWS, Linux, redes (DNS, TLS, roteamento) e scripting
  • Infraestrutura como código (Terraform, Ansible ou equivalente) e CI/CD

Diferenciais

  • OpenTelemetry e tracing distribuído
  • Ambientes com requisitos regulatórios: LGPD, ISO 27001, SOC 2
  • Cloudflare
  • Experiência em ambientes multi-tenant
  • Noções de PKI, TLS ou certificados digitais