Skip to main content
The preprocess command transforms raw input data into a format suitable for model training, with support for normalization, resizing, augmentation, and dataset splitting.

Usage

Options

Examples

Basic preprocessing

Normalize data

Resize images

Apply data augmentation

Split dataset

Combined preprocessing

Use configuration file

Configuration File

Create a JSON configuration file for complex preprocessing pipelines:
Then use it:

Data Splitting

When using --split, the data is divided into separate directories:

Two-way split (train/val)

Creates:

Three-way split (train/val/test)

Creates:
Split ratios must sum to 1.0. For example: 0.8,0.2 or 0.7,0.15,0.15

Preprocessing Configuration Output

The preprocessing settings are saved to preprocess_config.json in the output directory:
This allows you to reproduce the preprocessing pipeline later.

Error Handling

Input not found

Invalid resize format

Invalid split ratio

Preprocessing error

Use Cases

1. Prepare images for training

2. Augment training data

3. Create train/val/test splits

4. Standardize dataset

5. Complex pipeline with config

Best Practices

1. Always split your data

Create proper train/val/test splits:

2. Use configuration files for reproducibility

Store preprocessing settings in version control:

3. Normalize numerical data

Always normalize for better training performance:

4. Resize images consistently

Use standard image sizes for vision models:

5. Augment only training data

Split first, then augment only the training set:

Pipeline Example

Complete preprocessing pipeline for image classification:

See Also