preprocess command transforms raw input data into a format suitable for model training, with support for normalization, resizing, augmentation, and dataset splitting.
Usage
Options
Examples
Basic preprocessing
Normalize data
Resize images
Apply data augmentation
Split dataset
Combined preprocessing
Use configuration file
Configuration File
Create a JSON configuration file for complex preprocessing pipelines:Data Splitting
When using--split, the data is divided into separate directories:
Two-way split (train/val)
Three-way split (train/val/test)
Split ratios must sum to 1.0. For example:
0.8,0.2 or 0.7,0.15,0.15Preprocessing Configuration Output
The preprocessing settings are saved topreprocess_config.json in the output directory:
Error Handling
Input not found
Invalid resize format
Invalid split ratio
Preprocessing error
Use Cases
1. Prepare images for training
2. Augment training data
3. Create train/val/test splits
4. Standardize dataset
5. Complex pipeline with config
Best Practices
1. Always split your data
Create proper train/val/test splits:2. Use configuration files for reproducibility
Store preprocessing settings in version control:3. Normalize numerical data
Always normalize for better training performance:4. Resize images consistently
Use standard image sizes for vision models:5. Augment only training data
Split first, then augment only the training set:Pipeline Example
Complete preprocessing pipeline for image classification:See Also
- Dataset command - Manage datasets
- Run command - Train with preprocessed data
- Init command - Initialize projects with data structure