Skip to main content

Documentation Index

Fetch the complete documentation index at: https://mintlify.com/HelenDiMo/pildora-bootcamp-preprocesamiento/llms.txt

Use this file to discover all available pages before exploring further.

El módulo incluye dos notebooks Jupyter complementarios: un live coding demo que recorre el pipeline completo de preprocesamiento y modelos ensemble siguiendo el mismo orden que la app Streamlit, y un notebook de reto donde los estudiantes implementan los pasos clave con # TODO: Implementar aquí como guía. Para quien quiera corregir su solución o estudiar la implementación de referencia, también se incluye la versión con la solución completa.

Notebooks disponibles

ArchivoDescripciónPara quién
notebooks/live_coding_demo.ipynbDemo completa del pipeline (mismo flujo que el módulo)Referencia y aprendizaje guiado
notebooks/reto_notebook_bloque3_tips_v2.ipynbReto con bloques TODO para completarEstudiantes del bootcamp
notebooks/reto_notebook_bloque3_tips_SOLUCION_v2.ipynbSolución completa del retoCorrección y autoevaluación

Abrir en Google Colab

Cualquier notebook del repositorio puede abrirse directamente en Google Colab desde GitHub, sin necesidad de clonar ni descargar nada. Solo XGBoost requiere instalación manual porque no viene preinstalado en el entorno de Colab.
1. Ve a https://colab.research.google.com
2. Selecciona File > Open notebook > GitHub
3. Introduce: HelenDiMo/pildora-bootcamp-preprocesamiento
4. Selecciona el notebook deseado
5. Ejecuta la celda de instalación: !pip install xgboost -q

Ejecutar localmente

Instala las dependencias necesarias y abre el notebook de demo directamente desde la raíz del proyecto:
pip install jupyter pandas seaborn scikit-learn xgboost matplotlib
jupyter notebook notebooks/live_coding_demo.ipynb

El reto de aplicación

El notebook de reto (reto_notebook_bloque3_tips_v2.ipynb) sigue la misma estructura de cinco pasos que el pipeline completo, pero deja la implementación vacía con comentarios # TODO: Implementar aquí. Los estudiantes deben completar cada bloque por su cuenta antes de compararlo con la solución.
1

Implementar cap_outliers

Implementa la función cap_outliers desde cero usando IQR, o impórtala desde el módulo correspondiente y llámala sobre bill_length_mm con el DataFrame cargado.
2

Crear bill_ratio

Crea la nueva columna bill_ratio como cociente entre bill_length_mm y bill_depth_mm, añadiéndola directamente al DataFrame.
3

Construir el ColumnTransformer

Construye el objeto preprocessor usando ColumnTransformer con SimpleImputer(strategy='median') para columnas numéricas y un Pipeline con SimpleImputer(strategy='most_frequent') más OneHotEncoder(handle_unknown='ignore') para las categóricas.
4

Entrenar y evaluar Random Forest

Ensambla el Pipeline completo con el preprocesador y RandomForestClassifier, entrénalo sobre X_train / y_train y evalúa accuracy y classification report sobre el conjunto de test.
5

Entrenar y evaluar XGBoost con LabelEncoder

Aplica LabelEncoder a las etiquetas de entrenamiento y test, construye el Pipeline con XGBClassifier, entrénalo y evalúa las métricas decodificando las predicciones con le.inverse_transform para recuperar los nombres originales de especie.
La solución completa de todos los bloques está disponible en notebooks/reto_notebook_bloque3_tips_SOLUCION_v2.ipynb.
Ejecuta las celdas siempre de arriba a abajo en orden secuencial. Usa Kernel › Restart & Run All en Jupyter o Runtime › Run all en Colab para garantizar un estado limpio desde el principio y evitar errores de variables no definidas.
El notebook de live coding demo (live_coding_demo.ipynb) reproduce las secciones 1–8 de la app Streamlit en el mismo orden. Úsalo como referencia paso a paso si la app no está disponible o si prefieres trabajar directamente con celdas de código.

Build docs developers (and LLMs) love