Français
← Retour aux technologies de l’IA

Inférence et déploiement

Quantization

La représentation des poids, activations ou caches avec une précision numérique réduite. Elle diminue mémoire, bande passante et calcul, au prix de compromis de précision et de matériel.

Période de référence
2015 / LLM PTQ 2022
Dernière vérification

Termes clés

  • precision
  • INT8
  • INT4
  • weight-only

Liens dans le projet

Sources primaires

  1. Deep Compression
  2. GPTQ
  3. Transformers quantization documentation

Cette carte est une sélection éditoriale, non une prétention à l’exhaustivité.