Pular para o conteúdo
Trilha Especialização: Dados & Engenharia de IA (ML, RAG e MLOps)
🤖

Trilha Especialização: Dados & Engenharia de IA (ML, RAG e MLOps)

Do Módulo 0 ao Projeto Final (Fases 1 a 7): Python, Pandas, PostgreSQL, ETL Bronze-Silver-Gold, Parquet, Data Quality, dbt, Scikit-Learn, PyTorch, MLflow, LLMs, Vector DBs, RAG Verificável, Agentes, FastAPI Serving e LLMOps.

Capítulos 40
Progresso 0/40 aulas
Concluído 0%
🛠️
CAPÍTULO 1

Módulo 0 — Ambiente Profissional de Dados

1 aulas

Python, Jupyter, Git, Docker, Linux, pyproject.toml, Ruff e Type Hints.

📐
CAPÍTULO 2

Módulo 1 — Matemática Aplicada

1 aulas

Álgebra Linear, Matrizes, Produto Escalar, Probabilidade, Estatística e Gradientes.

🔒

1.1 Vetores, Matrizes & Produto Escalar

O produto escalar mede a projeção e alinhamento entre vetores. É a base matemática da similaridade de cosseno em busca vetorial.

Bloqueada
🐍
CAPÍTULO 3

Módulo 2 — Python para Dados

1 aulas

NumPy, Vetorização, Pandas Series/DataFrames, Agregações e Performance.

🔒

2.1 Manipulação de DataFrames com Pandas

Operações vetorizadas em NumPy e Pandas executam em C O(1) de overhead, sendo até 100x mais rápidas que for-loops tradicionais.

Bloqueada
🗄️
CAPÍTULO 4

Módulo 3 — SQL do Básico ao Avançado

1 aulas

CTEs, Window Functions, Views, Indexes, EXPLAIN e Particionamento.

🔒

3.1 CTEs & Window Functions (ROW_NUMBER, LAG, LEAD)

Utilize OVER (PARTITION BY ... ORDER BY ...) para calcular médias móveis, rankings e diferenças temporais sem agrupamento destrutivo.

Bloqueada
🏗️
CAPÍTULO 5

Módulo 4 — Modelagem de Dados

1 aulas

OLTP vs OLAP, Star Schema, Snowflake Schema, Fatos, Dimensões e Data Contracts.

🔒

4.1 Modelagem Dimensional Star Schema (Fatos & Dimensões)

Desnormalize dados para análise criando Tabela Fato (eventos numéricos) conectada a Tabelas Dimensão (entidades de contexto).

Bloqueada
📥
CAPÍTULO 6

Módulo 5 — Coleta e Ingestão

1 aulas

CSV, JSON, Parquet, Ingestão por API, Webhooks, Batch e Streaming.

🔒

5.1 Pipelines de Ingestão Resilientes com Checkpoints

Construa consumidores de API e arquivos que registram a posição do último registro (checkpoint) para retomada segura após falhas.

Bloqueada
🔄
CAPÍTULO 7

Módulo 6 — ETL e ELT

1 aulas

Arquitetura Medallion: Camadas Bronze, Silver e Gold, Deduplicação e Lineage.

🔒

6.1 Arquitetura Medallion: Bronze (Raw) -> Silver (Clean) -> Gold (Business)

Bronze: dados brutos exatamente como recebidos. Silver: limpos e deduplicados. Gold: agregados e modelados para o negócio.

Bloqueada
💾
CAPÍTULO 8

Módulo 7 — Formatos e Armazenamento

1 aulas

Apache Parquet, Armazenamento Colunar, Particionamento e Data Lakehouse.

🔒

7.1 Formato Colunar Parquet & Particionamento por Data

Parquet armazena dados por colunas com compressão Snappy, permitindo ler apenas as colunas necessárias e reduzindo I/O em 90%.

Bloqueada
🛡️
CAPÍTULO 9

Módulo 8 — Qualidade de Dados

1 aulas

Completude, Unicidade, Schema Validation, Data Profiling e Quarentena.

🔒

8.1 Data Contracts & Gatekeeper de Quarentena

Implemente um gate de qualidade que envia registros com esquema inválido ou nulos proibidos para quarentena isolada.

Bloqueada
CAPÍTULO 10

Módulo 9 — Orquestração

1 aulas

DAGs, Dependências, Airflow, Dagster, Prefect, Backfill e Sensores.

🔒

9.1 Construção de DAGs Idempotentes

Defina tarefas encadeadas com retentativas automáticas e parametrização por data de execução (execution_date).

Bloqueada
CAPÍTULO 11

Módulo 10 — Processamento Distribuído

1 aulas

Apache Spark, PySpark DataFrames, Particionamento e Memory Tuning.

🔒

10.1 PySpark & Processamento de Datasets Massivos

PySpark adota avaliação preguiçosa (Lazy Evaluation), otimizando o plano de execução antes de acionar a leitura física.

Bloqueada
📡
CAPÍTULO 12

Módulo 11 — Streaming de Dados

1 aulas

Apache Kafka, Event Time vs Processing Time, Consumer Groups e DLQ.

🔒

11.1 Arquitetura Orientada a Eventos com Kafka

Kafka organiza eventos em log contínuo imutável por partições, distribuindo a leitura entre múltiplos trabalhadores.

Bloqueada
📊
CAPÍTULO 13

Módulo 12 — Data Warehouse e Analytics

1 aulas

dbt (data build tool), Camada Semântica, Modelos Incrementais e Snapshots.

🔒

12.1 Transformações SQL Modulares com dbt

Escreva modelos SQL modulares refatorados como SELECTs simples. O dbt cuida da criação de views, tabelas e testes de qualidade.

Bloqueada
🔐
CAPÍTULO 14

Módulo 13 — Governança e Segurança de Dados

1 aulas

Classificação de Dados, Catalogação, Lineage, Pseudonimização e LGPD.

🔒

13.1 Anonymization & Data Lineage para LGPD

Aplique hash salgado sobre PII (dados pessoais) e rastreie a origem dos dados desde o sistema de origem até o relatório final.

Bloqueada
🧠
CAPÍTULO 15

Módulo 14 — Fundamentos de Machine Learning

1 aulas

Supervisionado vs Não Supervisionado, Overfitting, Underfitting e Bias/Variance.

🔒

14.1 Trade-off de Bias vs Variância

Overfitting ocorre quando o modelo memoriza o ruído do conjunto de treino. Evita-se com validação cruzada e regularização.

Bloqueada
🧹
CAPÍTULO 16

Módulo 15 — Preparação dos Dados

1 aulas

Train/Val/Test Split, Feature Engineering, Scikit-learn Pipelines e Data Leakage.

🔒

15.1 Scikit-learn Pipelines & Prevenção de Vazamento de Dados

Nunca aplique fit_transform no dataset inteiro! Use Scikit-learn Pipeline para rodar transformações apenas no conjunto de treino.

Bloqueada
📊
CAPÍTULO 17

Módulo 16 — Modelos Clássicos

1 aulas

Regressão, Árvores de Decisão, Random Forest, XGBoost e Time Series Forecasting.

🔒

16.1 Algoritmos de Gradient Boosting (XGBoost / LightGBM)

Gradient Boosting cria árvores de decisão em sequência, onde cada nova árvore corrige os erros residuais da árvore anterior.

Bloqueada
🎯
CAPÍTULO 18

Módulo 17 — Avaliação de Modelos

1 aulas

Precision, Recall, F1, ROC-AUC, RMSE, Cross-Validation e Business Metrics.

🔒

17.1 Matriz de Confusão & Ajuste de Threshold de Decisão

Em detecção de anomalias/fraudes, aumentar o Recall é mais crítico que a Precision. Ajuste a régua de threshold conforme o impacto financeiro.

Bloqueada
🧪
CAPÍTULO 19

Módulo 18 — Experimentação

1 aulas

MLflow Tracking, Experimentos Reproduzíveis, Métricas, Artefatos e Registro.

🔒

18.1 Rastreabilidade de Experimentos com MLflow

Registre cada corrida de treino (mlflow.log_params, mlflow.log_metrics) salvando binários do modelo como artefatos reproduzíveis.

Bloqueada
🧠
CAPÍTULO 20

Módulo 19 — Redes Neurais

1 aulas

Perceptrons, Funções de Ativação, Backpropagation, Loss e Gradient Descent.

🔒

19.1 Backpropagation & Otimizadores (AdamW)

Backpropagation calcula as derivadas parciais do erro em relação a cada peso da rede neural atualizando os parâmetros via gradiente.

Bloqueada
🔥
CAPÍTULO 21

Módulo 20 — PyTorch

1 aulas

Tensors, Autograd, Dataset, DataLoader, nn.Module e Training Loops.

🔒

20.1 Módulos Customizados & DataLoader PyTorch

Defina a arquitetura estendendo nn.Module, instancie DataLoaders com lotes paralelos e execute zero_grad(), backward() e step().

Bloqueada
👁️
CAPÍTULO 22

Módulo 21 — NLP, Visão e Séries Temporais

1 aulas

Tokenização, Word Embeddings, Transformers, CNNs e Time Series Backtesting.

🔒

21.1 Arquiteturas Transformer & Mecanismo de Atenção

Transformers calculam o peso de atenção entre todas as palavras de uma sequência simultaneamente eliminando o gargalo sequencial de LSTMs.

Bloqueada
🖥️
CAPÍTULO 23

Módulo 22 — Treinamento Distribuído

1 aulas

Data Parallelism (DDP), Model Parallelism, GPU VRAM e Checkpoints.

🔒

22.1 Distributed Data Parallel (DDP) em Múltiplas GPUs

Copie o modelo em N GPUs e divida os lotes de dados sincronizando gradientes via operação AllReduce.

Bloqueada
🤖
CAPÍTULO 24

Módulo 23 — Fundamentos de LLMs

1 aulas

Tokens, Context Window, Temperature, Top-p, Quantização (GGUF/AWQ) e LLMs Abertas.

🔒

23.1 Parâmetros de Inferência: Temperature & Top-p

Temperature=0.0 torna a escolha do próximo token determinística. Valores altos aumentam a criatividade mas elevam o risco de alucinações.

Bloqueada
✍️
CAPÍTULO 25

Módulo 24 — Engenharia de Prompts

1 aulas

System Prompts, Few-Shot, CoT, Saídas JSON Estruturadas e Prompt Injection.

🔒

24.1 Saídas JSON Estruturadas & Proteção contra Prompt Injection

Exija a validação da resposta da LLM contra um schema Pydantic e separe estritamente instruções do sistema dos dados não confiáveis do usuário.

Bloqueada
🔍
CAPÍTULO 26

Módulo 25 — Embeddings e Busca Vetorial

1 aulas

Vector Databases, Similaridade de Cosseno, Chunking, HNSW e Busca Híbrida.

🔒

25.1 Embeddings & Busca Vetorial com HNSW

Transforme blocos de texto em vetores de alta dimensão e utilize o índice HNSW (Hierarchical Navigable Small World) para busca semântica sub-milissegundo.

Bloqueada
📚
CAPÍTULO 27

Módulo 26 — RAG (Retrieval-Augmented Generation)

1 aulas

RAG Pipeline, Ingestão, Parsing, Chunking, Embeddings, Reranking e Citações.

🔒

26.1 Arquitetura RAG com Fontes Verificáveis & Reranking

Recupere os N trechos mais relevantes do banco vetorial, re-ordene com Cross-Encoder (Reranking) e obrigue a LLM a citar os documentos originais.

Bloqueada
🛠️
CAPÍTULO 28

Módulo 27 — Agentes e Uso de Ferramentas

1 aulas

Tool Calling, Workflows Determinísticos, Agentes Autônomos e Human-in-the-Loop.

🔒

27.1 Tool Calling & Workflows Determinísticos com IAs

Permita que a LLM selecione funções Python (ex: consultar_banco(id)) validando a sintaxe dos argumentos antes de executar.

Bloqueada
🎛️
CAPÍTULO 29

Módulo 28 — Fine-Tuning e Adaptação

1 aulas

Prompting vs RAG vs Fine-tuning, Supervised Fine-Tuning (SFT) e LoRA/QLoRA.

🔒

28.1 Adaptação de Baixa Ordem (LoRA / QLoRA)

LoRA congela os pesos originais do modelo e treina apenas pequenas matrizes de adaptação reduzindo a memória VRAM necessária.

Bloqueada
🚀
CAPÍTULO 30

Módulo 29 — Serving de Modelos

1 aulas

Batch vs Online Inference, FastAPI Model Serving, Warm-up e Batching.

🔒

29.1 Serving Assíncrono de Modelos com FastAPI

Carregue modelos pesados durante a inicialização da aplicação (lifespan) servindo requisições de inferência via chamadas async.

Bloqueada
📦
CAPÍTULO 31

Módulo 30 — Registro e Ciclo de Vida

1 aulas

MLflow Model Registry, Aliases, Versões, Staging, Production e Rollback.

🔒

30.1 Gestão de Ciclo de Vida no MLflow Model Registry

Associe aliases (ex: @champion, @candidate) às versões de modelos no registry permitindo rollback instantâneo sem redeploy de código.

Bloqueada
🧪
CAPÍTULO 32

Módulo 31 — Avaliação de Sistemas Generativos

1 aulas

Golden Datasets, LLM-as-Judge, Groundedness, Faithfulness e RAG Triad.

🔒

31.1 Avaliação Automatizada RAG Triad (Ragas / TruLens)

Avalie a qualidade das respostas geradas usando métricas de fidelidade às fontes (Faithfulness) e relevância do contexto recuperado.

Bloqueada
📊
CAPÍTULO 33

Módulo 32 — Observabilidade de IA

1 aulas

Tracing OpenTelemetry, Custos por Token, Latência, Erros e Dashboard LLMOps.

🔒

32.1 Tracing de Chamadas LLM & Rastreamento de Custos

Rastreie o consumo de tokens de entrada e saída por requisição exibindo dashboards de custo financeiro e latência p95.

Bloqueada
📉
CAPÍTULO 34

Módulo 33 — Monitoramento e Drift

1 aulas

Data Drift, Concept Drift, Kolmogorov-Smirnov Test, Retreinamento e Shadow Mode.

🔒

33.1 Detecção de Data Drift & Decay do Modelo em Produção

Compare distribuições estatísticas das variáveis de produção contra o conjunto de treino usando Evidently AI / Evidently Data.

Bloqueada
🛡️
CAPÍTULO 35

Módulo 34 — Segurança de Sistemas de IA

1 aulas

Prompt Injection, Data Poisoning, Output Guardrails e Threat Modeling.

🔒

34.1 Mitigação de Indirect Prompt Injection & Guardrails

Aplique validadores de saída (NeMo Guardrails) para filtrar tentativas de instrução oculta em documentos processados.

Bloqueada
⚖️
CAPÍTULO 36

Módulo 35 — Privacidade, Ética e Governança

1 aulas

LGPD, Model Cards, Explicabilidade (SHAP/LIME), Bias e Audit Trails.

🔒

35.1 Explicabilidade com SHAP Values & Model Cards

Gere valores SHAP (Shapley Additive exPlanations) para explicar quais variáveis mais impactaram a decisão do modelo.

Bloqueada
💰
CAPÍTULO 37

Módulo 36 — Infraestrutura e Custos (FinOps)

1 aulas

FinOps para IA, GPU VRAM, Cost-per-Token, Quantização e Unit Economics.

🔒

36.1 Calculadora FinOps & Otimização de Custos de Inferência

Calcule o custo exato por chamada de inferência combinando cache de respostas e modelos quantizados (vLLM / Ollama).

Bloqueada
💡
CAPÍTULO 38

Módulo 37 — Produto de Dados e IA

1 aulas

JTBD, Métrica de Produto, Feedback Loops, Data Moats e Build vs Buy.

🔒

37.1 Proposta de Valor & Construção de Moats de Dados

Crie loops de feedback onde cada uso do produto gera novos dados rotulados melhorando continuamente os modelos proprietários.

Bloqueada
🏗️
CAPÍTULO 39

Módulo 38 — Arquitetura de Plataforma

1 aulas

Data Lakehouse + ML Registry + Serving + Observability + ADRs.

🔒

38.1 Desenho de Plataforma Inteligente End-to-End

Documente a arquitetura unindo a camada de dados (Postgres/Parquet), modelos de previsão, assistente RAG e barramento de eventos.

Bloqueada
🏆
CAPÍTULO 40

Módulo 39 — Projeto Final: Plataforma Inteligente Logística

1 aulas

Construção da Plataforma Inteligente de Operações Logísticas integrando os 40 módulos das 7 Fases.

🔒

39.1 Projeto Final: Plataforma Inteligente de Operações Logísticas

Aprenda requisitos integrados da plataforma de ia logística com conceitos práticos e exercícios aplicados.

Bloqueada