Inférence et déploiement
Quantization
La représentation des poids, activations ou caches avec une précision numérique réduite. Elle diminue mémoire, bande passante et calcul, au prix de compromis de précision et de matériel.
Termes clés
- precision
- INT8
- INT4
- weight-only
Liens dans le projet
Technologies liées
Articles liés
Contexte historique
Sources primaires
Cette carte est une sélection éditoriale, non une prétention à l’exhaustivité.