Skip to main content
The optimize command improves model performance by applying optimization techniques such as quantization, pruning, knowledge distillation, and hyperparameter tuning.

Usage

Options

Optimization Techniques

Examples

Auto optimization

Quantize to int8

Quantize to fp16

Prune model

Optimize with calibration data

Use configuration file

Configuration File

Create a JSON configuration for complex optimization:
Then use it:

Quantization Precision

int8 (8-bit Integer)

  • Best for: Edge deployment, mobile devices
  • Size reduction: ~75%
  • Speed improvement: 2-4x
  • Accuracy loss: 1-3%

fp16 (16-bit Float)

  • Best for: GPU deployment
  • Size reduction: ~50%
  • Speed improvement: 1.5-2x
  • Accuracy loss: less than 1%

fp8 (8-bit Float)

  • Best for: Modern GPUs (H100, A100)
  • Size reduction: ~75%
  • Speed improvement: 2-3x
  • Accuracy loss: less than 2%

Pruning Levels

Higher pruning levels (>0.5) may significantly impact model accuracy. Always validate performance after pruning.

Optimization Results

The command outputs detailed optimization metrics:

Error Handling

Model not found

Invalid quantization precision

Invalid pruning level

Optimization failed

Use Cases

1. Deploy to mobile devices

2. Reduce inference costs

3. Speed up real-time inference

4. Compress models for storage

5. Automated optimization pipeline

Best Practices

1. Use calibration data

Provide representative data for better quantization:

2. Start with conservative settings

Begin with less aggressive optimization:

3. Validate after optimization

Always check model performance:

4. Keep original model

Never overwrite your original model:

5. Document optimization settings

Save optimization configuration:

Optimization Workflow

See Also