G
Engenharia de Dados Sênior | Híbrido/SP - 136504
GFT Technologies SE - Job Offerings
Alphaville - Barueri · br
1d ago
87%
Strong
Job description
O que buscamos? Um(a) Engenheiro(a) de Dados Sênior para atuar com desenvolvimento e arquitetura de plataformas de dados. A posição envolve a construção e operação de pipelines, bem como a responsabilidade arquitetural sobre a plataforma, incluindo modelagem de data Lake, padrões de ingestão, governança de camadas e otimização de performance e custo. É essencial a execução técnica, com foco na confiabilidade dos dados que suportam painéis executivos, relatórios e obrigações regulatórias em um ambiente regulado, exigindo rastreabilidade e reprodutibilidade. Responsabilidades Saber trabalhar na estrutura de hub-spoke Projetar, construir e manter pipelines de ingestão e transformação orquestrados em Apache Airflow, com padrões consistentes de retry, idempotência, alerta e SLA. Desenvolver e evoluir modelos de transformação em dbt sobre o data warehouse, organizando as camadas (staging → intermediate → marts) com testes e documentação. Implementar ingestões de fontes heterogêneas: bancos transacionais, APIs de terceiros (custodiantes, distribuidores, provedores de mercado), arquivos regulatórios e planilhas operacionais. Instrumentar observabilidade dos dados: freshness, volumetria, quebras de contrato, reconciliação entre origem e destino. Definir e defender o modelo de dados do warehouse (dimensional, Data Vault ou híbrido — com justificativa), incluindo chaves, granularidade, historização (SCD) e tratamento de correções retroativas. Estabelecer padrões de distribuição, ordenação e particionamento no MPP (DISTKEY, SORTKEY, compressão em Redshift; equivalentes em outras engines) e garantir que sejam seguidos. Fazer o desenho de camadas e contratos de dados entre times: o que é fonte da verdade, quem pode escrever onde, o que é exposto para BI e o que é interno. Conduzir tuning de performance e custo: análise de planos, filas/WLM, concorrência, manutenção (VACUUM/ANALYZE ou equivalente), rewrite de queries e materializações. Avaliar e recomendar tecnologias (formatos de tabela, lakehouse, streaming, catálogo, ferramentas de qualidade) com análise de trade-off explícita, incluindo custo e custo de saída. Trabalhar com dados vetorizados Implementar controles de qualidade automatizados e reconciliações que sustentem números usados em relatórios a clientes e em respostas a reguladores. Garantir linhagem e rastreabilidade ponta a ponta: de um número no painel até a origem e a versão do código que o produziu. Aplicar controles de acesso, segregação por sensibilidade e conformidade com LGPD e com as normas aplicáveis ao setor (CVM, BACEN, BSM, políticas internas de compliance). Documentar decisões arquiteturais (ADRs) e manter o dicionário de dados vivo. Atuar como referência técnica para engenheiros(as) pleno e júnior: code review, pareamento, definição de padrões e mentoria. Traduzir demandas de negócio (Wealth Management, Comercial, Risco, Compliance, Operações) em desenho de dados sustentável — inclusive dizendo "não" a atalhos que criam dívida. Participar do planejamento técnico e estimar com honestidade escopo, risco e prazo. Requisitos obrigatórios Experiencia comprovada em engenharia de dados com responsabilidade arquitetural (saber desenhar o modelo, não só implementar de outra pessoa). Histórico comprovado de ter levado ao ar e operado em produção uma plataforma de dados analítica — com incidentes, plantão e consequências reais. SQL avançado de verdade: window functions, CTEs recursivas, leitura de plano de execução, diagnóstico de skew e de spill em disco. Python para engenharia de dados: código modular, testável e versionado (não apenas notebooks). Familiaridade com pandas/polars, tipagem e testes automatizados. Apache Airflow em produção: autoria de DAGs, sensores, backfill, gestão de dependências e de falhas. Data warehouse MPP em nuvem — Redshift preferencialmente; Snowflake, BigQuery ou Databricks são aceitos com disposição para se aprofundar em Redshift. DBT ou ferramenta equivalente de transformação versionada, com testes. Modelagem dimensional (Kimball) com domínio real: fato vs. dimensão, granularidade, SCD tipos 1/2, tabelas ponte, snapshots. Git e cultura de code review; CI/CD aplicado a dados. Modelagem e diagnóstico de performance: saber explicar por que uma query está lenta e provar a correção com números antes e depois. Rigor com correção numérica. Comunicação escrita clara/documentação. Autonomia para investigar do dashboard até a origem sem pedir permissão a cada passo. Disponibilidade de atuação hibrida 2 a 3x presencial - Região Vila Olimpia Diferenciais (desejáveis) Experiência no mercado financeiro: investimentos, wealth management, custódia, renda fixa/variável, fundos, cálculo de rentabilidade (TIR/TWR), posição e movimentação. Vivência com dados regulatórios: CVM, BACEN, BSM, ANBIMA — inclusive prazos e formatos de entrega. Infra como código (Terraform), AWS (S3, Glue, Lambda, IAM, Step Functions). Formatos de tabela abertos (Iceberg, Delta) e arquitetura lakehouse. Streaming / CDC (Kafka, Debezium, Kinesis). Ferramentas de qualidade e catálogo (Great Expectations, Soda, DataHub, OpenMetadata). Experiência com camada semântica e ferramentas de BI (Power BI, Metabase, Looker). Ter conduzido uma migração relevante (legado → moderno, on-prem → nuvem, ou planilha/VBA → pipeline versionado) com validação de paridade. Descrição comportamental: Procuramos uma pessoa que: Goste de trabalhar em equipe e seja colaborativa em suas atribuições; Tenha coragem para se desafiar e ir além, abraçando novas oportunidades de crescimento; Transforme ideias em soluções criativas e busque qualidade em toda sua rotina; Tenha habilidades de resolução de problemas ; Possua habilidade e se sinta confortável para trabalhar de forma independente e gerenciar o próprio tempo ; Tenha interesse em lidar com situações adversas e inovadoras no âmbito tecnológico. Big enough to deliver – small enough to care. #VempraGFT #LetsGoBeyond #ProudToBeGFT