Capitani Group logo

Cientista de dados Senior

Capitani Group
1 hour ago
Full-time
On-site
São Paulo, São Paulo, Brazil

Sobre o Cargo


A missão do cargo é conduzir projetos de machine learning de alto impacto para o negócio, com ênfase em risco transacional, pagamentos e moderação de conteúdo.


Responsabilidades


  • Definir hipóteses, conduzir projetos analíticos e desenhar experimentos para resolver desafios de risco transacional, pagamentos, saques e moderação de conteúdo.
  • Desenvolver, colocar em produção e monitorar modelos, priorizando time-to-value: começar por baselines simples e iterar conforme o impacto.
  • Atuar como elo entre áreas técnicas e de negócio, traduzindo desafios para soluções data-driven.
  • Apoiar decisões de produto e crescimento por meio de experimentação (testes A/B) e inferência causal, sustentando uma cultura orientada a dados.
  • Desenvolver modelos de Trust & Safety, antifraude e análise de pagamentos para proteger a plataforma, criadores e usuários, e apoiar decisões de negócio com base em dados.
  • Garantir que soluções analíticas tratem dados pessoais e sensíveis em conformidade com a LGPD e com as políticas de privacidade e segurança da informação da empresa.


Qualificações


  • Formação Acadêmica: Graduação em Estatística, Matemática, Ciência da Computação, Engenharia, Física ou áreas correlatas.


Habilidades Necessárias


  • Profundo domínio de estatística, modelagem e frameworks avançados de machine learning, além de experiência em análise causal.
  • Vivência em deploy, monitoramento, automação e ajuste de modelos em ambientes de grande escala.
  • Domínio de Python para ciência de dados (pandas, NumPy, scikit-learn) e de frameworks de gradient boosting (XGBoost, LightGBM), além de SQL avançado em bancos relacionais (ex.: SQL Server, PostgreSQL) e versionamento de código com Git.
  • Modelagem para risco e fraude: classificação em cenários desbalanceados, calibração de score, detecção de anomalias e feature engineering sobre comportamento transacional (velocity, agregações por janela e padrões entre contas).
  • Experiência com ambientes de dados em nuvem (AWS e/ou Azure), data warehouse (ex.: Snowflake) e bancos relacionais e NoSQL (ex.: MongoDB), atuando sobre grandes volumes de dados.
  • Práticas de MLOps: versionamento e deploy de modelos, pipelines de CI/CD, monitoramento de performance e de drift e observabilidade de modelos em produção (ex.: Datadog).
  • Cultura de experimentação: desenho e análise de testes A/B em larga escala e inferência causal para sustentar decisões de produto e crescimento.
  • NLP e/ou visão computacional aplicados a conteúdo: classificação, moderação e Trust & Safety.
  • Aplicação de ciência de dados a problemas típicos de plataformas digitais: churn, LTV, monetização, detecção de fraude, prevenção a chargebacks, detecção de anomalias e séries temporais.
  • Tratamento de dados pessoais e sensíveis em conformidade com a LGPD, aplicando privacy by design, anonimização/pseudonimização e boas práticas de governança e segurança da informação.
  • Capacidade de comunicação, resiliência e influência sobre temas técnicos junto a áreas de negócio.


Habilidades Preferenciais


  • Vivência em plataformas de mídia social, creator economy, marketplaces de duas pontas, plataformas de assinatura, fintech ou antifraude.
  • Experiência com GenAI / LLMs aplicados a produto (ex.: RAG, embeddings, agentes).
  • Experiência com sistemas de recomendação e personalização (filtragem colaborativa, modelos de ranking, embeddings e busca) aplicados a feed, descoberta de conteúdo e engajamento.
  • Experiência com frameworks de deep learning (PyTorch ou TensorFlow), especialmente aplicados a NLP e visão computacional para moderação de conteúdo.
  • Pós-graduação ou especialização em áreas quantitativas ou de ciência de dados.
  • Experiência com dados em streaming / processamento em tempo real e ferramentas de orquestração de pipelines.
  • Inglês técnico para leitura de documentação e artigos.