The optimize command improves model performance by applying optimization techniques such as quantization, pruning, knowledge distillation, and hyperparameter tuning.
Usage
Options
Optimization Techniques
Examples
Auto optimization
Quantize to int8
Quantize to fp16
Prune model
Optimize with calibration data
Use configuration file
Configuration File
Create a JSON configuration for complex optimization:
Then use it:
Quantization Precision
int8 (8-bit Integer)
- Best for: Edge deployment, mobile devices
- Size reduction: ~75%
- Speed improvement: 2-4x
- Accuracy loss: 1-3%
fp16 (16-bit Float)
- Best for: GPU deployment
- Size reduction: ~50%
- Speed improvement: 1.5-2x
- Accuracy loss: less than 1%
fp8 (8-bit Float)
- Best for: Modern GPUs (H100, A100)
- Size reduction: ~75%
- Speed improvement: 2-3x
- Accuracy loss: less than 2%
Pruning Levels
Higher pruning levels (>0.5) may significantly impact model accuracy. Always validate performance after pruning.
Optimization Results
The command outputs detailed optimization metrics:
Error Handling
Model not found
Invalid quantization precision
Invalid pruning level
Optimization failed
Use Cases
1. Deploy to mobile devices
2. Reduce inference costs
3. Speed up real-time inference
4. Compress models for storage
5. Automated optimization pipeline
Best Practices
1. Use calibration data
Provide representative data for better quantization:
2. Start with conservative settings
Begin with less aggressive optimization:
3. Validate after optimization
Always check model performance:
4. Keep original model
Never overwrite your original model:
5. Document optimization settings
Save optimization configuration:
Optimization Workflow
See Also