Los errores documentados en esta guía fueron recogidos de participantes reales del bootcamp mientras ejecutaban los notebooks y la app Streamlit del módulo. Cada entrada incluye el error exacto tal como aparece en el traceback, la causa más habitual que lo provoca y la solución concreta que debes aplicar. Si tu error no aparece aquí, revisa primero que estás ejecutando las celdas en orden y que tu entorno tiene todas las dependencias instaladas.Documentation Index
Fetch the complete documentation index at: https://mintlify.com/HelenDiMo/pildora-bootcamp-preprocesamiento/llms.txt
Use this file to discover all available pages before exploring further.
Errores frecuentes
ModuleNotFoundError: No module named 'xgboost'
ModuleNotFoundError: No module named 'xgboost'
NameError: name 'X_train' is not defined
NameError: name 'X_train' is not defined
X_train sin haber ejecutado antes las celdas que lo definen. Esto ocurre cuando se salta directamente a una sección del notebook o se reinicia el kernel sin volver a ejecutar desde el principio.Solución: Ejecuta todas las celdas en orden, de arriba a abajo. En Jupyter o VSCode usa Run All; en Google Colab usa Runtime > Run all o Kernel > Restart & Run All. Nunca ejecutes una celda de modelado sin haber ejecutado antes las de carga de datos, preprocesamiento y split.seaborn.load_dataset('penguins') falla o se queda colgado
seaborn.load_dataset('penguins') falla o se queda colgado
seaborn.load_dataset() descarga el CSV directamente desde el contenido raw de GitHub en el momento de la llamada. Si no hay conexión a internet, o si un firewall o proxy corporativo bloquea el acceso a raw.githubusercontent.com, la descarga falla o se queda colgada indefinidamente.Solución: Comprueba tu conexión a internet. Si estás en una red con restricciones (universidad, empresa), solicita el archivo CSV local como alternativa al formador para cargarlo directamente con pd.read_csv().ValueError: Input contains NaN al entrenar el modelo
ValueError: Input contains NaN al entrenar el modelo
RandomForestClassifier().fit(X_train, y_train), saltándose el pipeline completo. El dataset Palmer Penguins contiene valores nulos en varias columnas; el SimpleImputer del preprocesador es quien los gestiona. Sin él, el modelo recibe NaN y lanza el error.Solución: Entrena siempre a través del pipeline completo (rf_pipeline o xgb_pipeline), que incluye el preprocessor con el imputer integrado:build_preprocessor(num_cols, cat_cols) y encapsula el SimpleImputer tanto para columnas numéricas (estrategia median) como para columnas categóricas (estrategia most_frequent).ValueError por categorías desconocidas en test
ValueError por categorías desconocidas en test
OneHotEncoder recibió durante la predicción una categoría en el conjunto de test que no existía en el conjunto de entrenamiento. Esto puede ocurrir si el split produce una partición en la que alguna categoría de island o sex queda exclusivamente en test.Solución: Asegúrate de que el OneHotEncoder tenga el parámetro handle_unknown='ignore' configurado. La función build_preprocessor() del módulo ya lo incluye correctamente:KeyError: 'columna_x'
KeyError: 'columna_x'
num_cols o cat_cols. Python distingue entre mayúsculas y minúsculas, y los nombres del dataset usan guiones bajos específicos.Solución: Ejecuta df.columns para verificar los nombres exactos. Los nombres correctos de las columnas del pipeline son:- Numéricas (
num_cols):bill_length_mm,bill_depth_mm,flipper_length_mm,body_mass_g,bill_ratio - Categóricas (
cat_cols):island,sex - Target:
species
Accuracy = 1.0 genera dudas
Accuracy = 1.0 genera dudas
ModuleNotFoundError al importar seaborn o sklearn
ModuleNotFoundError al importar seaborn o sklearn
venv o conda), asegúrate de haberlo activado antes de instalar y antes de lanzar Jupyter o la app Streamlit.Errores específicos de la app Streamlit
Además de los errores de entorno y código, la app Streamlit tiene comportamientos específicos que pueden confundir si no se conoce su estructura.Sección bloqueada con 'Primero debes cargar el dataset en la sección 1'
Sección bloqueada con 'Primero debes cargar el dataset en la sección 1'
st.session_state, algo que solo ocurre cuando se pulsa el botón “Cargar Dataset” en la Sección 1.Solución: Vuelve a la Sección 1 en el menú lateral y haz clic en Cargar Dataset. Una vez cargado correctamente, el resto de secciones estarán disponibles.Los resultados desaparecen al cambiar de sección
Los resultados desaparecen al cambiar de sección
st.session_state para persistir resultados entre secciones (modelos entrenados, métricas, predicciones), pero si la página se recarga en el navegador o la app se reinicia, todo el estado se pierde.Solución: Si los resultados desaparecen, comienza de nuevo desde la Sección 1 y ejecuta cada sección en orden. No es necesario recargar la página salvo que la app deje de responder.