ALes poids ne sont pas toute la mémoire.
Le calcul brut est : paramètres × nombre de bits ÷ 8. Les formats quantifiés stockent aussi des échelles et des métadonnées, et certains tenseurs gardent une précision plus élevée. La majoration réglable est une hypothèse. Si vous les avez, la taille réelle des fichiers du modèle est un meilleur point de départ.
BUn long contexte coûte en plus.
Pour un transformer classique avec cache d'attention complet, nous calculons : 2 × couches × têtes KV × dimension de tête × jetons × séquences parallèles × octets par valeur du cache. Les jetons d'entrée et générés partagent le même budget de contexte. Les fenêtres glissantes, MLA, architectures hybrides et autres peuvent s'écarter nettement.
CPlusieurs GPU ne font pas un seul grand bloc de mémoire.
Une capacité totale suffisante ne signifie pas que le modèle peut être réparti sur n'importe quelles cartes. Le moteur, la répartition des couches, les interconnexions et les tampons par GPU comptent aussi. En cas de délestage vers le CPU, la mémoire vive s'ajoute et la bande passante peut limiter le débit. Les modèles MoE dont tous les experts sont en mémoire demandent plus que les seuls paramètres actifs.