Engenharia de Dados | Remota 134797
Job Summary
O que buscamos:
Profissional para atuar em projeto estratégico de migração do Data Warehouse legado para um Enterprise Lakehouse em Databricks com foco na reconstrução de pipelines atualmente implementados em DataStage e Azure Synapse. A pessoa será responsável por reimplementar pipelines nativamente em PySpark e Spark SQL apoiando a modernização da plataforma de dados e garantindo paridade entre o ambiente legado e o novo ecossistema Lakehouse.
Responsabilidades:
Reconstruir pipelines do Data Warehouse legado em Databricks utilizando PySpark e Spark SQL;
Implementar as camadas bronze silver e gold seguindo os padrões da arquitetura medalhão;
Aplicar padrões de ingestão CDC e batch conforme diretrizes do projeto;
Executar waves de reconstrução por domínio em coexistência com o DW legado até o cutover;
Implementar regras de negócio e transformações com testes automatizados;
Realizar reconciliação e validação de paridade entre os dados do ambiente legado e do Lakehouse;
Otimizar performance e custos dos pipelines por meio de particionamento OPTIMIZE Z-ORDER e dimensionamento de workloads;
Contribuir com a documentação técnica das regras migradas;
Apoiar a priorização e execução das waves de migração;
Requisitos e Qualificações:
Conhecimento avançado em PySpark e Python;
Experiência com desenvolvimento de pipelines batch em larga escala;
Conhecimento avançado em SQL;
Experiência com modelagem de dados relacional e dimensional;
Experiência com Databricks e Delta Lake em ambiente produtivo;
Conhecimento em arquitetura medalhão (bronze silver e gold);
Experiência com Delta Live Tables Lakeflow e Asset Bundles;
Vivência em migração ou reconstrução de pipelines ETL;
Experiência com tradução de regras de negócio de plataformas legadas para Spark;
Conhecimento em ingestão CDC e batch a partir de bancos relacionais;
Experiência com AWS (S3 Glue EMR Athena Lambda DMS e Step Functions);
Conhecimento em Azure Synapse (SQL Pools e Pipelines);
Experiência com qualidade e reconciliação de dados;
Conhecimento em testes automatizados e controles de Data Quality;
Experiência com Git e CI/CD aplicados à engenharia de dados;
Diferenciais:
Conhecimento em DataStage para leitura de jobs e apoio à engenharia reversa;
Experiência em programas de migração de Data Warehouse para Lakehouse;
Conhecimento em Unity Catalog (permissões lineage e contratos de dados);
Experiência no mercado financeiro ou de crédito;
Certificações Databricks Data Engineer Associate ou Professional;
Descrição comportamental:
Procuramos uma pessoa que:
- Goste de trabalhar em equipe e seja colaborativa em suas atribuições;
- Tenha coragem para se desafiar e ir além abraçando novas oportunidades de crescimento;
- Transforme ideias em soluções criativas e busque qualidade em toda sua rotina;
- Tenha habilidades de resolução de problemas;
- Possua habilidade e se sinta confortável para trabalhar de forma independente e gerenciar o próprio tempo;
- Tenha interesse em lidar com situações adversas e inovadoras no âmbito tecnológico.
Big enough to deliver small enough to care.
#VempraGFT
#LetsGoBeyond
#ProudToBeGFT
About Company
We see opportunity in technology. In domains such as cloud, AI, mainframe modernisation, DLT and IoT, we blend established practice with new thinking to help our clients stay ahead.