"Engenharia de Dados não é sobre mover bytes, é sobre eficiência sob pressão."
Especialista em pipelines de processamento massivo e sistemas backend de alta vazão. Minha abordagem foca em extrair o máximo de performance do hardware disponível, utilizando concorrência avançada e arquiteturas otimizadas para transformar caos de dados legados em sistemas resilientes e elegantes.
- 87M+ de registros: Processados, enriquecidos e persistidos em menos de 3 horas.
- Concorrência: Implementação de pipelines assíncronos (Python/Asyncio) e Multi-threading (Java/JVM).
- Escala: Transformação de GBs de dados brutos não estruturados em ativos estratégicos para BI e Analytics.
Arquitetura de alta performance para a base de dados da Receita Federal.
- Benchmark: Processamento de 87 milhões de linhas em ~180 minutos.
- Tech: Python (Asyncio/Aiohttp), PyArrow (Parquet Colunar), PostgreSQL (Bulk Load COPY).
- Diferencial: Ingestão paralela com extração em memória e enriquecimento em tempo real, eliminando gargalos de I/O de disco.
Streaming de eventos e analytics em tempo real para operações de alta demanda.
- Tech: Node.js, Socket.IO, Redis (Bull Queue), PostgreSQL/MySQL, Fastify.
- Diferencial: Controle de backpressure com filas assíncronas para batch inserts, garantindo zero perda de dados sob picos de tráfego, com dashboard analítico integrado.
Engine de classificação de Telecom em Java para máxima vazão.
- Tech: Java (Maven), Multi-threading, DuckDB, Google Libphonenumber.
- Diferencial: Processamento paralelo de arquivos CSV massivos consultando base local de 55M+ registros, atingindo 100% de acerto e superando limitações de linguagens interpretadas.
Plataforma Full-Stack para análise financeira da Agência Nacional de Saúde.
- Tech: FastAPI, Vue.js 3, Redis (Caching), MySQL.
- Desafio: Automação do ciclo de vida do dado, do scraping de PDFs complexos até dashboards de Pareto para milhões de registros contábeis.
| Categoria | Tecnologias |
|---|---|
| Data Engineering | Python (Pandas/PyArrow/Asyncio) ETL/ELT Web Scraping Big Data |
| Backend & Concurrency | Java (Maven/Threads) Node.js (Fastify/Socket.IO) FastAPI PHP |
| Databases | PostgreSQL (Expert) MySQL DuckDB SQL Server Parquet |
| Infra & Observability | Docker Redis Prometheus Grafana Linux/Bash PM2 |
| BI & Analytics | Power BI (DAX) Looker Studio Data Storytelling |
Aberto a desafios remotos, arquitetura de dados de alta escala e consultorias de otimização de pipelines.
"A determinação mantém o percurso quando a empolgação acaba."