Trilha Especialização: Dados & Engenharia de IA (ML, RAG e MLOps)
Do Módulo 0 ao Projeto Final (Fases 1 a 7): Python, Pandas, PostgreSQL, ETL Bronze-Silver-Gold, Parquet, Data Quality, dbt, Scikit-Learn, PyTorch, MLflow, LLMs, Vector DBs, RAG Verificável, Agentes, FastAPI Serving e LLMOps.
Módulo 0 — Ambiente Profissional de Dados
Python, Jupyter, Git, Docker, Linux, pyproject.toml, Ruff e Type Hints.
Módulo 1 — Matemática Aplicada
Álgebra Linear, Matrizes, Produto Escalar, Probabilidade, Estatística e Gradientes.
1.1 Vetores, Matrizes & Produto Escalar
O produto escalar mede a projeção e alinhamento entre vetores. É a base matemática da similaridade de cosseno em busca vetorial.
Módulo 2 — Python para Dados
NumPy, Vetorização, Pandas Series/DataFrames, Agregações e Performance.
2.1 Manipulação de DataFrames com Pandas
Operações vetorizadas em NumPy e Pandas executam em C O(1) de overhead, sendo até 100x mais rápidas que for-loops tradicionais.
Módulo 3 — SQL do Básico ao Avançado
CTEs, Window Functions, Views, Indexes, EXPLAIN e Particionamento.
3.1 CTEs & Window Functions (ROW_NUMBER, LAG, LEAD)
Utilize OVER (PARTITION BY ... ORDER BY ...) para calcular médias móveis, rankings e diferenças temporais sem agrupamento destrutivo.
Módulo 4 — Modelagem de Dados
OLTP vs OLAP, Star Schema, Snowflake Schema, Fatos, Dimensões e Data Contracts.
4.1 Modelagem Dimensional Star Schema (Fatos & Dimensões)
Desnormalize dados para análise criando Tabela Fato (eventos numéricos) conectada a Tabelas Dimensão (entidades de contexto).
Módulo 5 — Coleta e Ingestão
CSV, JSON, Parquet, Ingestão por API, Webhooks, Batch e Streaming.
5.1 Pipelines de Ingestão Resilientes com Checkpoints
Construa consumidores de API e arquivos que registram a posição do último registro (checkpoint) para retomada segura após falhas.
Módulo 6 — ETL e ELT
Arquitetura Medallion: Camadas Bronze, Silver e Gold, Deduplicação e Lineage.
6.1 Arquitetura Medallion: Bronze (Raw) -> Silver (Clean) -> Gold (Business)
Bronze: dados brutos exatamente como recebidos. Silver: limpos e deduplicados. Gold: agregados e modelados para o negócio.
Módulo 7 — Formatos e Armazenamento
Apache Parquet, Armazenamento Colunar, Particionamento e Data Lakehouse.
7.1 Formato Colunar Parquet & Particionamento por Data
Parquet armazena dados por colunas com compressão Snappy, permitindo ler apenas as colunas necessárias e reduzindo I/O em 90%.
Módulo 8 — Qualidade de Dados
Completude, Unicidade, Schema Validation, Data Profiling e Quarentena.
8.1 Data Contracts & Gatekeeper de Quarentena
Implemente um gate de qualidade que envia registros com esquema inválido ou nulos proibidos para quarentena isolada.
Módulo 9 — Orquestração
DAGs, Dependências, Airflow, Dagster, Prefect, Backfill e Sensores.
9.1 Construção de DAGs Idempotentes
Defina tarefas encadeadas com retentativas automáticas e parametrização por data de execução (execution_date).
Módulo 10 — Processamento Distribuído
Apache Spark, PySpark DataFrames, Particionamento e Memory Tuning.
10.1 PySpark & Processamento de Datasets Massivos
PySpark adota avaliação preguiçosa (Lazy Evaluation), otimizando o plano de execução antes de acionar a leitura física.
Módulo 11 — Streaming de Dados
Apache Kafka, Event Time vs Processing Time, Consumer Groups e DLQ.
11.1 Arquitetura Orientada a Eventos com Kafka
Kafka organiza eventos em log contínuo imutável por partições, distribuindo a leitura entre múltiplos trabalhadores.
Módulo 12 — Data Warehouse e Analytics
dbt (data build tool), Camada Semântica, Modelos Incrementais e Snapshots.
12.1 Transformações SQL Modulares com dbt
Escreva modelos SQL modulares refatorados como SELECTs simples. O dbt cuida da criação de views, tabelas e testes de qualidade.
Módulo 13 — Governança e Segurança de Dados
Classificação de Dados, Catalogação, Lineage, Pseudonimização e LGPD.
13.1 Anonymization & Data Lineage para LGPD
Aplique hash salgado sobre PII (dados pessoais) e rastreie a origem dos dados desde o sistema de origem até o relatório final.
Módulo 14 — Fundamentos de Machine Learning
Supervisionado vs Não Supervisionado, Overfitting, Underfitting e Bias/Variance.
14.1 Trade-off de Bias vs Variância
Overfitting ocorre quando o modelo memoriza o ruído do conjunto de treino. Evita-se com validação cruzada e regularização.
Módulo 15 — Preparação dos Dados
Train/Val/Test Split, Feature Engineering, Scikit-learn Pipelines e Data Leakage.
15.1 Scikit-learn Pipelines & Prevenção de Vazamento de Dados
Nunca aplique fit_transform no dataset inteiro! Use Scikit-learn Pipeline para rodar transformações apenas no conjunto de treino.
Módulo 16 — Modelos Clássicos
Regressão, Árvores de Decisão, Random Forest, XGBoost e Time Series Forecasting.
16.1 Algoritmos de Gradient Boosting (XGBoost / LightGBM)
Gradient Boosting cria árvores de decisão em sequência, onde cada nova árvore corrige os erros residuais da árvore anterior.
Módulo 17 — Avaliação de Modelos
Precision, Recall, F1, ROC-AUC, RMSE, Cross-Validation e Business Metrics.
17.1 Matriz de Confusão & Ajuste de Threshold de Decisão
Em detecção de anomalias/fraudes, aumentar o Recall é mais crítico que a Precision. Ajuste a régua de threshold conforme o impacto financeiro.
Módulo 18 — Experimentação
MLflow Tracking, Experimentos Reproduzíveis, Métricas, Artefatos e Registro.
18.1 Rastreabilidade de Experimentos com MLflow
Registre cada corrida de treino (mlflow.log_params, mlflow.log_metrics) salvando binários do modelo como artefatos reproduzíveis.
Módulo 19 — Redes Neurais
Perceptrons, Funções de Ativação, Backpropagation, Loss e Gradient Descent.
19.1 Backpropagation & Otimizadores (AdamW)
Backpropagation calcula as derivadas parciais do erro em relação a cada peso da rede neural atualizando os parâmetros via gradiente.
Módulo 20 — PyTorch
Tensors, Autograd, Dataset, DataLoader, nn.Module e Training Loops.
20.1 Módulos Customizados & DataLoader PyTorch
Defina a arquitetura estendendo nn.Module, instancie DataLoaders com lotes paralelos e execute zero_grad(), backward() e step().
Módulo 21 — NLP, Visão e Séries Temporais
Tokenização, Word Embeddings, Transformers, CNNs e Time Series Backtesting.
21.1 Arquiteturas Transformer & Mecanismo de Atenção
Transformers calculam o peso de atenção entre todas as palavras de uma sequência simultaneamente eliminando o gargalo sequencial de LSTMs.
Módulo 22 — Treinamento Distribuído
Data Parallelism (DDP), Model Parallelism, GPU VRAM e Checkpoints.
22.1 Distributed Data Parallel (DDP) em Múltiplas GPUs
Copie o modelo em N GPUs e divida os lotes de dados sincronizando gradientes via operação AllReduce.
Módulo 23 — Fundamentos de LLMs
Tokens, Context Window, Temperature, Top-p, Quantização (GGUF/AWQ) e LLMs Abertas.
23.1 Parâmetros de Inferência: Temperature & Top-p
Temperature=0.0 torna a escolha do próximo token determinística. Valores altos aumentam a criatividade mas elevam o risco de alucinações.
Módulo 24 — Engenharia de Prompts
System Prompts, Few-Shot, CoT, Saídas JSON Estruturadas e Prompt Injection.
24.1 Saídas JSON Estruturadas & Proteção contra Prompt Injection
Exija a validação da resposta da LLM contra um schema Pydantic e separe estritamente instruções do sistema dos dados não confiáveis do usuário.
Módulo 25 — Embeddings e Busca Vetorial
Vector Databases, Similaridade de Cosseno, Chunking, HNSW e Busca Híbrida.
25.1 Embeddings & Busca Vetorial com HNSW
Transforme blocos de texto em vetores de alta dimensão e utilize o índice HNSW (Hierarchical Navigable Small World) para busca semântica sub-milissegundo.
Módulo 26 — RAG (Retrieval-Augmented Generation)
RAG Pipeline, Ingestão, Parsing, Chunking, Embeddings, Reranking e Citações.
26.1 Arquitetura RAG com Fontes Verificáveis & Reranking
Recupere os N trechos mais relevantes do banco vetorial, re-ordene com Cross-Encoder (Reranking) e obrigue a LLM a citar os documentos originais.
Módulo 27 — Agentes e Uso de Ferramentas
Tool Calling, Workflows Determinísticos, Agentes Autônomos e Human-in-the-Loop.
27.1 Tool Calling & Workflows Determinísticos com IAs
Permita que a LLM selecione funções Python (ex: consultar_banco(id)) validando a sintaxe dos argumentos antes de executar.
Módulo 28 — Fine-Tuning e Adaptação
Prompting vs RAG vs Fine-tuning, Supervised Fine-Tuning (SFT) e LoRA/QLoRA.
28.1 Adaptação de Baixa Ordem (LoRA / QLoRA)
LoRA congela os pesos originais do modelo e treina apenas pequenas matrizes de adaptação reduzindo a memória VRAM necessária.
Módulo 29 — Serving de Modelos
Batch vs Online Inference, FastAPI Model Serving, Warm-up e Batching.
29.1 Serving Assíncrono de Modelos com FastAPI
Carregue modelos pesados durante a inicialização da aplicação (lifespan) servindo requisições de inferência via chamadas async.
Módulo 30 — Registro e Ciclo de Vida
MLflow Model Registry, Aliases, Versões, Staging, Production e Rollback.
30.1 Gestão de Ciclo de Vida no MLflow Model Registry
Associe aliases (ex: @champion, @candidate) às versões de modelos no registry permitindo rollback instantâneo sem redeploy de código.
Módulo 31 — Avaliação de Sistemas Generativos
Golden Datasets, LLM-as-Judge, Groundedness, Faithfulness e RAG Triad.
31.1 Avaliação Automatizada RAG Triad (Ragas / TruLens)
Avalie a qualidade das respostas geradas usando métricas de fidelidade às fontes (Faithfulness) e relevância do contexto recuperado.
Módulo 32 — Observabilidade de IA
Tracing OpenTelemetry, Custos por Token, Latência, Erros e Dashboard LLMOps.
32.1 Tracing de Chamadas LLM & Rastreamento de Custos
Rastreie o consumo de tokens de entrada e saída por requisição exibindo dashboards de custo financeiro e latência p95.
Módulo 33 — Monitoramento e Drift
Data Drift, Concept Drift, Kolmogorov-Smirnov Test, Retreinamento e Shadow Mode.
33.1 Detecção de Data Drift & Decay do Modelo em Produção
Compare distribuições estatísticas das variáveis de produção contra o conjunto de treino usando Evidently AI / Evidently Data.
Módulo 34 — Segurança de Sistemas de IA
Prompt Injection, Data Poisoning, Output Guardrails e Threat Modeling.
34.1 Mitigação de Indirect Prompt Injection & Guardrails
Aplique validadores de saída (NeMo Guardrails) para filtrar tentativas de instrução oculta em documentos processados.
Módulo 35 — Privacidade, Ética e Governança
LGPD, Model Cards, Explicabilidade (SHAP/LIME), Bias e Audit Trails.
35.1 Explicabilidade com SHAP Values & Model Cards
Gere valores SHAP (Shapley Additive exPlanations) para explicar quais variáveis mais impactaram a decisão do modelo.
Módulo 36 — Infraestrutura e Custos (FinOps)
FinOps para IA, GPU VRAM, Cost-per-Token, Quantização e Unit Economics.
36.1 Calculadora FinOps & Otimização de Custos de Inferência
Calcule o custo exato por chamada de inferência combinando cache de respostas e modelos quantizados (vLLM / Ollama).
Módulo 37 — Produto de Dados e IA
JTBD, Métrica de Produto, Feedback Loops, Data Moats e Build vs Buy.
37.1 Proposta de Valor & Construção de Moats de Dados
Crie loops de feedback onde cada uso do produto gera novos dados rotulados melhorando continuamente os modelos proprietários.
Módulo 38 — Arquitetura de Plataforma
Data Lakehouse + ML Registry + Serving + Observability + ADRs.
38.1 Desenho de Plataforma Inteligente End-to-End
Documente a arquitetura unindo a camada de dados (Postgres/Parquet), modelos de previsão, assistente RAG e barramento de eventos.
Módulo 39 — Projeto Final: Plataforma Inteligente Logística
Construção da Plataforma Inteligente de Operações Logísticas integrando os 40 módulos das 7 Fases.
39.1 Projeto Final: Plataforma Inteligente de Operações Logísticas
Aprenda requisitos integrados da plataforma de ia logística com conceitos práticos e exercícios aplicados.