A Arthur Reis

Arthur Reis Engenheiro de Dados e IA

Databricks · Azure · Microsoft Fabric

Engenheiro de Dados e IA especializado em Databricks, Azure e Microsoft Fabric. Construo plataformas de dados modernas, arquiteturas lakehouse, pipelines de alta performance e frameworks de qualidade de dados, e exploro IA aplicada com sistemas multi-agente. Compartilho o que aprendo em palestras, vídeos no Youtube, blogs, no LinkedIn e em projetos open source.

Arthur Reis
5+ Anos de experiência
14 Certificações
14 Projetos core
6 Palestras
Sobre

Quem é Arthur

Engenheiro de Dados e IA especializado em Databricks, Azure e Microsoft Fabric. Construo plataformas de dados modernas, arquiteturas lakehouse, pipelines de alta performance e frameworks de qualidade de dados, e exploro IA aplicada com sistemas multi-agente. Compartilho o que aprendo em palestras, vídeos no Youtube, blogs, no LinkedIn e em projetos open source.

  • Engenharia de Dados
  • SQL & Spark
  • Qualidade & Governança
  • IA & Agentes
Tech Stack

Ferramentas & tecnologias

Engenharia de Dados

Microsoft Fabric Databricks Azure PySpark Delta Lake Azure Data Factory AWS GCP Snowflake

SQL & Spark

SQL Spark SQL Python DAX R

Qualidade & Governança

Unity Catalog DQX Great Expectations Data Contracts Power BI

IA & Agentes

Multi-agent Systems RAG Prompt Engineering Mosaic AI MCP
Trajetória

Experiência

  1. set. de 2025 — Atual

    Engenheiro de Dados Consultor · Power Tuning

    Brasil · Remoto

    Estratégia e modernização de plataformas de dados nacionais e internacionais com Microsoft Fabric e Databricks.

    • Design e deploy de Data Platform para multinacional brasileira usando Microsoft Fabric e Databricks, alinhando soluções técnicas a objetivos de negócio e governança.
    • Arquitetura e deploy de workflows de dados via Infrastructure as Code (IaC) com Azure Data Factory, garantindo pipelines escaláveis, mantíveis e auditáveis.
    • Design e implementação de Lakehouse completo e produtos de IA usando Databricks e Azure.
    • Implementação de Databricks Genie Spaces como interface de analytics conversacional sobre os dados da plataforma.
    Microsoft Fabric Databricks Azure Azure Data Factory PySpark SQL Python
  2. mar. de 2026 — Atual

    Engenheiro de Dados · AB InBev (Miners)

    Brasil · Remoto

    Projetos de Engenharia de Dados e IA com foco em Databricks, GitHub e Airflow.

    • Manutenção de pipelines de dados no Databricks e no Airflow.
    • Migração e refatoração de código Spark e SQL.
    • Criação de um sistema multi-agente para acelerar migrações usando Databricks Genie.
    • Criação de um sistema multi-agente para revisão de PRs usando OpenAI e GitHub Actions.
    Databricks Apache Airflow GitHub Actions PySpark SQL Databricks Genie OpenAI
  3. mai. de 2025 — set. de 2025

    Engenheiro de Dados · Kumulus

    Brasil · Remoto

    Estratégia de dados, design de plataformas e implementação para clientes nacionais e internacionais.

    • Liderança de estratégia de plataforma de dados e design de arquitetura Lakehouse para multinacional americana, definindo padrões de governança, modelos de dados e estrutura alinhada aos objetivos do cliente.
    • Contribuição à modernização de plataforma de dados para organização governamental dos EUA, mapeando maturidade de dados e conduzindo adoção junto a stakeholders internacionais.
    • Design e implementação de soluções Lakehouse para duas empresas brasileiras, incluindo frameworks de governança e controles de qualidade de dados.
    • Mentoria e supervisão de Engenheiros de Dados Júnior, contribuindo para a definição de topologia de equipe.
    • Implantação de Microsoft Copilot para aumentar a produtividade das equipes de dados nos clientes.
    Databricks Azure Python SQL Delta Lake
  4. abr. de 2024 — mai. de 2025

    Engenheiro de Dados · Paytime

    Brasil · Remoto

    Responsável pela estratégia de dados end-to-end da empresa, do zero: infraestrutura, governança, qualidade e analytics.

    • Design e implementação do Data Lakehouse (Databricks, Spark, SQL, MongoDB, AWS) como base para produtos de dados e analytics self-service.
    • Estabelecimento de práticas de governança: pipelines de testes de qualidade, padrões de documentação e políticas de controle de acesso.
    • Design e entrega dos primeiros produtos de dados da empresa: dashboards interativos em Power BI para stakeholders de negócio.
    • Implementação de serviços de dados na AWS (S3, Lambda, Glue, IAM) para infraestrutura segura e escalável.
    • Exploração e implementação de Databricks Genie Spaces para analytics conversacional sobre os dados da empresa.
    Databricks Apache Spark AWS MongoDB Power BI Python SQL
  5. set. de 2023 — mar. de 2024

    Analista de Dados · Piwi

    Brasil · Remoto

    Gestão da estratégia de dados end-to-end da empresa, da ingestão ao analytics.

    • Liderança do desenvolvimento do Lakehouse da empresa no GCP, definindo a estratégia de arquitetura e gestão escalável de dados.
    • Design e lançamento dos primeiros produtos de analytics com Looker Studio, habilitando BI self-service.
    • Desenvolvimento de pipelines de extração e limpeza de dados em Python, SQL e MongoDB.
    GCP Python SQL MongoDB Looker Studio
  6. mar. de 2022 — jan. de 2023

    Analista de Dados · Secretaria Estadual de Educação do ES

    Espírito Santo · Brasil

    Suporte a decisões baseadas em dados para políticas educacionais públicas no Espírito Santo.

    • Análise de dados e relatórios estratégicos sobre escolas indígenas, quilombolas e rurais para subsidiar decisões de política educacional.
    • Produção de materiais educativos e condução de treinamentos sobre práticas de dados para equipes escolares.
    Power BI Python SQL Excel
  7. mar. de 2018 — nov. de 2022

    Pesquisador / Analista de Dados · UFES — Universidade Federal do Espírito Santo

    Vitória, ES · Brasil

    Pesquisa de mestrado e doutorado com foco em análise histórica de dados e modelagem de redes sociais.

    • ETL em documentos históricos e construção de pipelines de dados com Python.
    • Análise de redes sociais (Twitter) via integração com API usando Python.
    • Visualizações e dashboards em Power BI para comunicar resultados a stakeholders acadêmicos.
    • Desenvolvimento do site www.jornaisdaindependencia.com.br.
    Python R Power BI SQL Excel
Projetos

Projetos em destaque

Projetos profissionais e pessoais

ago. de 2026 — Atual

Fabric Foundry Agentic System

Sistema multi-agente que executa tarefas de ETL no Microsoft Fabric a partir de work items do Azure DevOps, com agentes hospedados no Azure AI Foundry. Três agentes por papel seguem o fluxo Receber → Refinar → Realizar → Analisar: o PM transforma o ticket em especificação com critérios de aceite, o Engineer executa via Fabric REST API com permissões escopadas por cenário e o QA valida o resultado de forma independente, com acesso somente leitura.

Cenários de Bronze, Silver, Gold e modelo semântico, com seleção de modelo por papel guiada pelo Azure AI Evaluation SDK.

Azure AI Foundry Microsoft Fabric Multi-agent Azure DevOps
jun. de 2026 — Atual AB InBev

OpenAI Agents

Sistema multi-agente que gera recomendações de revisão em Pull Requests usando modelos da OpenAI (ChatGPT), integrado ao fluxo do GitHub via GitHub Actions. Agentes especializados analisam as mudanças de código Spark e SQL e publicam sugestões direto no PR, acelerando o ciclo de revisão do time.

OpenAI Multi-agent GitHub Actions Python
mai. de 2026 — jul. de 2026 Power Tuning

Migração Databricks: Azure para AWS

Migração de uma plataforma Databricks do Azure para a AWS: recriação da governança no Unity Catalog (metastore, storage credentials e external locations no S3), cópia das tabelas Delta com validação de contagem e consistência, e redeploy de jobs e workflows via Databricks Asset Bundles. O cutover foi planejado por domínio para minimizar a indisponibilidade para as áreas de negócio.

Databricks AWS Unity Catalog Delta Lake DABs
fev. de 2026 — Atual

data-agents-copilot

Sistema de despacho automático que roteia tarefas de dados (SQL, PySpark, pipelines, governança) para 15 agentes IA especializados. Executado via CLI, Chainlit web, ou diretamente no VS Code Chat.

Fork do projeto original data-agents de Thomaz Rossito — adaptado para operar com GitHub Copilot Chat API, adicionando governança automática de nomenclatura, workflows colaborativos multi-agente, Knowledge Base estruturada, sistema de memória episódica e protocolo QA peer-to-peer.

Python Multi-agent LLM Databricks Fabric
jan. de 2026 — mar. de 2026 Power Tuning

CI/CD para Vibe Coding com GitHub

Template corporativo e esteira de CI/CD para que áreas de negócio criem aplicações web internas via Vibe Coding, conversando com agentes de IA sem tocar em código ou terminal. O time de dados provisiona a infraestrutura (repositório, banco e variáveis de ambiente) e as regras de arquitetura ficam versionadas em AGENTS.md/CLAUDE.md para qualquer agente seguir.

Governança embutida no fluxo: RLS obrigatório em todas as tabelas, chaves privilegiadas fora do código da aplicação e auditoria de conformidade antes do deploy em produção.

Stack: Next.js, TypeScript, Tailwind CSS, Supabase, GitHub, Vercel.

CI/CD GitHub Vibe Coding Supabase Next.js
jan. de 2026 — mai. de 2026 Power Tuning

Databricks Platform Refactoring & Optimization

Projeto de refactoring e otimização de uma plataforma de dados baseada em Databricks, com foco em performance, manutenibilidade e cumprimento de SLA crítico de 15 minutos. Após redesign completo do framework e otimizações em PySpark, SQL e arquitetura, a solução atingiu o SLA e se tornou mais escalável, estável e fácil de manter.

Databricks PySpark SQL Delta Lake
jul. de 2025 — set. de 2025

Otimização de ETL no Databricks

Otimização de pipelines ETL críticos no Databricks aplicando BroadcastJoin, CLUSTER BY, OPTIMIZE e leitura incremental. Os pipelines passaram por reduções de até 94% no tempo de execução, com impacto direto no consumo de DBU e nas janelas de processamento.

Databricks PySpark Spark SQL Delta Lake
set. de 2025 — jan. de 2026 Power Tuning

Lakehouse no Azure

Concepção e implementação de um Lakehouse corporativo para grande empresa brasileira com arquitetura medalhão (Bronze, Silver e Gold), integrando múltiplas fontes com destaque para o ERP Protheus. Workspaces segregados por domínio de negócio integrados a um workspace central de Engenharia. Cargas orquestradas via Azure Data Factory com pipelines parametrizados e controlados por SLA.

Microsoft Fabric Azure Data Factory Delta Lake Medallion
mai. de 2025 — ago. de 2025 Kumulus

App Modernization

Migração completa de Data Warehouse On-Premise para arquitetura Lakehouse no Microsoft Fabric: modelagem dimensional, pipelines de ingestão e transformação, migração de procedures SQL para Lakehouse e publicação de relatórios em Power BI com conexão ao Lakehouse.

Stack: Microsoft Fabric, OneLake, Data Factory, PySpark, Synapse Data Warehouse, Power BI, T-SQL, Delta Lake.

Microsoft Fabric PySpark Power BI T-SQL
fev. de 2025 — jul. de 2025 Paytime

Implementação e testes de IA

Integração dos dados da empresa com a IA do Databricks (Genie) para acelerar processos e fomentar a cultura Data-Driven. Realização de testes e difusão da utilização da ferramenta em toda a empresa.

Databricks Genie AI Analytics
mar. de 2025 — mar. de 2025 Paytime

Migração de dados do MongoDB para o Databricks

Migração de banco de dados MongoDB para Databricks utilizando MongoDB Data Federation, AWS S3 e rotinas de carga incremental com Spark. O resultado foi uma rotina regular de atualização dos dados mais robustos da empresa, inclusive transações com milhões de linhas.

MongoDB Databricks Spark AWS S3
nov. de 2024 — mar. de 2025 Paytime

Desenvolvimento do Lakehouse

Implementação de um Lakehouse no Databricks integrando toda a base de dados de uma Fintech com SQL, Spark, Databricks e AWS. O resultado foi o aumento de performance nas análises e na atualização de relatórios e painéis.

Databricks Spark SQL AWS Delta Lake
out. de 2024 — jan. de 2025 Paytime

Portal de Dashboards

Criação de Portal de Dashboards que reduziu o custo de licenças Power BI de R$ 45/licença para R$ 5/licença. A redução de custos e a potência da plataforma levaram à extensão do Portal para mais de 500 clientes da empresa, transformando-o em um produto de dados.

Power BI Databricks SQL
nov. de 2023 — dez. de 2023 Piwi

Definição de gêneros usando IA

Classificação automática de gênero em banco de dados legado usando a biblioteca gender_guesser.detector do Python. O resultado foi o preenchimento da tabela com assertividade de aproximadamente 87% (calculada a partir de corpus reduzido).

Python AI Data Quality
Blog

Artigos no Medium

Escrevendo sobre engenharia de dados e IA

How Delta Lake works: follow an update from Parquet to your next query

A practical walkthrough of data files, transaction commits, data skipping, and checkpoints — with a SQL lab. You update customer 150 from pending to confirmed. …

11 de out. de 2026

Choosing a Delta Lake Layout: When to Partition, Use Liquid Clustering, and Run OPTIMIZE

Use cases, limits, SQL experiments, and a practical decision process for Databricks engineers. An orders table is partitioned by date. That sounds reasonable — …

01 de out. de 2026

Databricks Genie: A Practical Guide from Tables to Tested Answers

Build a focused sales analytics assistant with explicit business rules, reference SQL, and benchmarks. A query can execute successfully and still answer the wro…

25 de set. de 2026

Diagnosing Fabric Data Warehouse with the SQL DW Operations Skill: Investigating Workloads Without…

Diagnosing Fabric Data Warehouse with the SQL DW Operations Skill: Investigating Workloads Without Leaving Copilot When a warehouse starts showing signs of slow…

17 de set. de 2026

Além das respostas: como as novas funcionalidades do Genie One transformam insights em ação

Introdução Existe um padrão que qualquer pessoa que trabalha com dados reconhece: você faz uma pergunta para uma ferramenta de BI ou para um assistente de IA, r…

31 de ago. de 2026

Autenticação segura em notebooks do Microsoft Fabric com Workspace Identity e Connection Objects

Se você trabalha com notebooks no Microsoft Fabric, provavelmente já passou pela situação clássica: durante o desenvolvimento, tudo funciona perfeitamente porqu…

01 de jun. de 2026
Comunidade

Palestras & eventos

MVP Conf 2026

IA e Qualidade de Dados no Databricks: construindo testes usando DQX e IA

26 de setembro de 2026São Paulo, SP · Brasil

Trilha Data Platform. Por que qualidade de dados importa mais do que nunca na era da IA, e como construir testes no Databricks com DQX e DQX Forge — de regras escritas à mão a regras geradas por IA, contratos de dados, métricas e quarentena.

Data & AI Saturday #1156 Vitória

IA e Qualidade de Dados no Databricks

19 de setembro de 2026Vitória, ES · Brasil

Fundamentos de qualidade de dados (DAMA-DMBOK, contratos de dados, data quality vs. observability) e, na prática, testes no Databricks com DQX e o DQX Forge, com geração de regras assistida por IA e demo ao vivo.

Data & AI Saturday #1156 Vitória

Acelerando a carreira em Engenharia de Dados com o Microsoft Learn Student Ambassadors

19 de setembro de 2026Vitória, ES · Brasil

Com Edilson Santos. Como funciona o programa Microsoft Student Ambassadors, como entrar e evoluir nele, e como usar os benefícios (créditos Azure, certificações e comunidade) para construir portfólio e acelerar a carreira em dados — com demo na Azure.

SQL Saturday #1132 Belo Horizonte

Criando um processo de qualidade no Databricks com IA

22 de agosto de 2026Belo Horizonte, MG · Brasil

Como estruturar um processo de qualidade de dados no Databricks: planejamento em 5 etapas, métricas, anti-patterns e testes com DQX e DQX Forge, usando IA para gerar regras a partir de profiling e contratos de dados.

SQL Saturday #1139 Joinville

Qualidade de Dados no Databricks

11 de abril de 2026Joinville, SC · Brasil

Frameworks de qualidade de dados, contratos de dados, métricas e anti-patterns — ISO-25012 e DAMA DMBOK aplicados na arquitetura medallion.

SQL Saturday #1129 Vitória

Arquiteturas modernas de dados: Snowflake, Databricks e um pouco de IA

06 de dezembro de 2025Vitória, ES · Brasil

Comparativo entre arquiteturas modernas de dados — Snowflake e Databricks — e como a IA está transformando a forma de construir e operar plataformas de dados.

Comunidade Databricks

Certificações Databricks no Brasil

Um raio-x dos profissionais certificados em Databricks no Brasil: certificações mais comuns, empresas com mais certificados e o ranking completo.

838
Profissionais certificados
1.416
Certificações
371
Empresas
Explorar o dashboard
Contato

Vamos conversar

Aberto a projetos, palestras e trocas técnicas.

arthurfr23@gmail.com