Bienvenido a la documentación de la píldora extendida de Machine Learning del bootcamp. Este módulo te guía paso a paso desde la carga de datos hasta la comparación de modelos ensemble, usando el dataset Palmer Penguins como caso práctico. Encontrarás explicaciones conceptuales, código real listo para ejecutar y un reto de aplicación con solución incluida.Documentation Index
Fetch the complete documentation index at: https://mintlify.com/HelenDiMo/pildora-bootcamp-preprocesamiento/llms.txt
Use this file to discover all available pages before exploring further.
Introducción
Qué cubre este módulo, qué aprenderás y cómo está organizado el material.
Quickstart
Instala las dependencias y ejecuta el pipeline completo en minutos.
Preprocesamiento
Outliers, feature engineering, encoding y split train/test con scikit-learn.
Algoritmos Ensemble
Random Forest, XGBoost y cómo elegir entre ellos para tu problema.
Demo Interactiva
App Streamlit con animaciones de código en vivo y ejecución paso a paso.
Ética y Buenas Prácticas
Sesgos algorítmicos, caja negra y qué revisar antes de llevar un modelo a producción.
El pipeline de extremo a extremo
Este módulo recorre las siguientes etapas en orden:Cargar y explorar datos
Carga el dataset Palmer Penguins con
seaborn, inspecciona nulos y distribuciones con df.describe().Tratar outliers
Detecta valores extremos con el método IQR y aplica capping (winsorizing) para preservar todas las filas.
Ingeniería de características
Crea la feature derivada
bill_ratio = bill_length_mm / bill_depth_mm para añadir poder discriminativo.Preprocesar y dividir
Imputa nulos, codifica variables categóricas con
OneHotEncoder y divide en train/test estratificado.Recursos del módulo
Notebooks
Live coding demo y reto de aplicación (con solución) para practicar cada bloque.
Demo en vivo
Abre la app Streamlit desplegada en la nube sin instalar nada.
Presentación teórica
Consulta la presentación Genially con los conceptos teóricos del módulo.