Enter a job title or keyword

SRE Pleno

OZmap


Job Location:

Florianópolis - Brazil

Monthly Salary: Not provided by the employer
Posted: 6 September 2026 (9 days ago)
Application Deadline: 4 December 2026
Vacancies: 1 Vacancy

Job Summary

Estamos com uma posição estratégica em nosso time: SRE Pleno. Você vai atuar em um projeto estruturante de observabilidade construindo em conjunto com a liderança técnica os processos e a maturidade de SRE do time além de contribuir diretamente para a confiabilidade dos serviços que sustentam nossa operação em produção hoje rodando em nuvem (AWS) e on-premises atendendo múltiplos clientes em diversas regiões do mundo.

Buscamos alguém que atue de forma preventiva: que identifique riscos antes que se tornem incidentes reduza a recorrência de problemas e transforme cada causa raiz em aprendizado para o time.

Responsabilidades:

  • Prevenir incidentes em produção identificando riscos operacionais pontos de falha e alertas ruidosos antes que se tornem problemas.
  • Participar da construção da plataforma de observabilidade (logs métricas e tracing) contribuindo na definição de processos SLIs SLOs e error budgets.
  • Conduzir análises de causa raiz e liderar postmortems documentando aprendizados e acompanhando planos de ação até o fechamento.
  • Resolver incidentes críticos com troubleshooting em ambientes de produção na AWS e on-premises.
  • Identificar oportunidades de FinOps e contribuir para a previsibilidade de custos em nuvem.
  • Colaborar com o time de develop na melhoria contínua da confiabilidade e do desempenho das aplicações.
  • Apoiar demandas de escalabilidade e criação de nova infraestrutura com foco em automação.
  • Contribuir para a evolução da maturidade de SRE do time (práticas documentação e cultura de incidentes).
Requirements
  • Experiência sólida com troubleshooting em ambientes produtivos e sistemas distribuídos.
  • Experiência com AWS em produção (EC2 redes balanceamento de carga IAM); vivência com ambientes on-premises é um diferencial.
  • Conhecimento em Docker/Docker Compose (containers em produção).
  • Vivência com ferramentas de observabilidade e monitoramento (ex: Grafana Prometheus Datadog SigNoz ou similares) e OpenTelemetry (logs métricas e tracing).
  • Compreensão de práticas de SRE: SLI/SLO error budgets gestão e resolução de incidentes e postmortem.
  • Conhecimentos sólidos em Linux redes e protocolos (HTTP TCP/IP DNS).
  • Boa comunicação autonomia e resiliência para atuar em momentos críticos de incidentes incluindo eventual interação direta com o cliente.

Diferenciais:

  • Experiência com automação (Python Bash Terraform Ansible ou similares).
  • Familiaridade com práticas de DevOps: CI/CD e infraestrutura como código (IaC).

About Company

Company Logo

A melhor solução para mapeamento e documentação de redes. CONHEÇA NOSSOS PLANOS Projeto. Operação. Gestão. Organização, tecnologia e escala para o seu provedor. Conheça a melhor solução para documentação de redes de fibra óptica. Solução A organização que dá resultado. Software focado ... View more

View Profile View Profile