SRE Pleno
Florianópolis - Brazil
Job Summary
Estamos com uma posição estratégica em nosso time: SRE Pleno. Você vai atuar em um projeto estruturante de observabilidade construindo em conjunto com a liderança técnica os processos e a maturidade de SRE do time além de contribuir diretamente para a confiabilidade dos serviços que sustentam nossa operação em produção hoje rodando em nuvem (AWS) e on-premises atendendo múltiplos clientes em diversas regiões do mundo.
Buscamos alguém que atue de forma preventiva: que identifique riscos antes que se tornem incidentes reduza a recorrência de problemas e transforme cada causa raiz em aprendizado para o time.
Responsabilidades:
- Prevenir incidentes em produção identificando riscos operacionais pontos de falha e alertas ruidosos antes que se tornem problemas.
- Participar da construção da plataforma de observabilidade (logs métricas e tracing) contribuindo na definição de processos SLIs SLOs e error budgets.
- Conduzir análises de causa raiz e liderar postmortems documentando aprendizados e acompanhando planos de ação até o fechamento.
- Resolver incidentes críticos com troubleshooting em ambientes de produção na AWS e on-premises.
- Identificar oportunidades de FinOps e contribuir para a previsibilidade de custos em nuvem.
- Colaborar com o time de develop na melhoria contínua da confiabilidade e do desempenho das aplicações.
- Apoiar demandas de escalabilidade e criação de nova infraestrutura com foco em automação.
- Contribuir para a evolução da maturidade de SRE do time (práticas documentação e cultura de incidentes).
- Experiência sólida com troubleshooting em ambientes produtivos e sistemas distribuídos.
- Experiência com AWS em produção (EC2 redes balanceamento de carga IAM); vivência com ambientes on-premises é um diferencial.
- Conhecimento em Docker/Docker Compose (containers em produção).
- Vivência com ferramentas de observabilidade e monitoramento (ex: Grafana Prometheus Datadog SigNoz ou similares) e OpenTelemetry (logs métricas e tracing).
- Compreensão de práticas de SRE: SLI/SLO error budgets gestão e resolução de incidentes e postmortem.
- Conhecimentos sólidos em Linux redes e protocolos (HTTP TCP/IP DNS).
- Boa comunicação autonomia e resiliência para atuar em momentos críticos de incidentes incluindo eventual interação direta com o cliente.
Diferenciais:
- Experiência com automação (Python Bash Terraform Ansible ou similares).
- Familiaridade com práticas de DevOps: CI/CD e infraestrutura como código (IaC).
About Company
A melhor solução para mapeamento e documentação de redes. CONHEÇA NOSSOS PLANOS Projeto. Operação. Gestão. Organização, tecnologia e escala para o seu provedor. Conheça a melhor solução para documentação de redes de fibra óptica. Solução A organização que dá resultado. Software focado ... View more