El módulo incluye dos notebooks Jupyter complementarios: un live coding demo que recorre el pipeline completo de preprocesamiento y modelos ensemble siguiendo el mismo orden que la app Streamlit, y un notebook de reto donde los estudiantes implementan los pasos clave conDocumentation Index
Fetch the complete documentation index at: https://mintlify.com/HelenDiMo/pildora-bootcamp-preprocesamiento/llms.txt
Use this file to discover all available pages before exploring further.
# TODO: Implementar aquí como guía. Para quien quiera corregir su solución o estudiar la implementación de referencia, también se incluye la versión con la solución completa.
Notebooks disponibles
| Archivo | Descripción | Para quién |
|---|---|---|
notebooks/live_coding_demo.ipynb | Demo completa del pipeline (mismo flujo que el módulo) | Referencia y aprendizaje guiado |
notebooks/reto_notebook_bloque3_tips_v2.ipynb | Reto con bloques TODO para completar | Estudiantes del bootcamp |
notebooks/reto_notebook_bloque3_tips_SOLUCION_v2.ipynb | Solución completa del reto | Corrección y autoevaluación |
Abrir en Google Colab
Cualquier notebook del repositorio puede abrirse directamente en Google Colab desde GitHub, sin necesidad de clonar ni descargar nada. Solo XGBoost requiere instalación manual porque no viene preinstalado en el entorno de Colab.Ejecutar localmente
Instala las dependencias necesarias y abre el notebook de demo directamente desde la raíz del proyecto:El reto de aplicación
El notebook de reto (reto_notebook_bloque3_tips_v2.ipynb) sigue la misma estructura de cinco pasos que el pipeline completo, pero deja la implementación vacía con comentarios # TODO: Implementar aquí. Los estudiantes deben completar cada bloque por su cuenta antes de compararlo con la solución.
Implementar cap_outliers
Implementa la función
cap_outliers desde cero usando IQR, o impórtala desde el módulo correspondiente y llámala sobre bill_length_mm con el DataFrame cargado.Crear bill_ratio
Crea la nueva columna
bill_ratio como cociente entre bill_length_mm y bill_depth_mm, añadiéndola directamente al DataFrame.Construir el ColumnTransformer
Construye el objeto
preprocessor usando ColumnTransformer con SimpleImputer(strategy='median') para columnas numéricas y un Pipeline con SimpleImputer(strategy='most_frequent') más OneHotEncoder(handle_unknown='ignore') para las categóricas.Entrenar y evaluar Random Forest
Ensambla el
Pipeline completo con el preprocesador y RandomForestClassifier, entrénalo sobre X_train / y_train y evalúa accuracy y classification report sobre el conjunto de test.notebooks/reto_notebook_bloque3_tips_SOLUCION_v2.ipynb.
El notebook de live coding demo (
live_coding_demo.ipynb) reproduce las secciones 1–8 de la app Streamlit en el mismo orden. Úsalo como referencia paso a paso si la app no está disponible o si prefieres trabajar directamente con celdas de código.