Model-Optimizer
Une bibliothèque unifiée de techniques d'optimisation de modèles SOTA telles que la quantification, la distillation, l'élagage, la recherche d'architecture neuronale, le décodage spéculatif, etc. Elle compresse les modèles d'apprentissage en profondeur pour les cadres de déploiement en aval tels que TensorRT-LLM, TensorRT, vLLM, etc. afin d'optimiser la vitesse d'inférence.
Le problème qu’il résout
Une bibliothèque unifiée de techniques d'optimisation de modèles SOTA telles que la quantification, la distillation, l'élagage, la recherche d'architecture neuronale, le décodage spéculatif, etc. Elle compresse les modèles d'apprentissage en profondeur pour les cadres de déploiement en aval tels que TensorRT-LLM, TensorRT, vLLM, etc. afin d'optimiser la vitesse d'inférence.
Notes de la communauté