MINESHOP / OUTILS01 — IA LOCALE

D'ABORD CALCULER. ENSUITE CHOISIR LE MATÉRIEL.

De combien de mémoire
a besoin votre LLM ?

Le nombre de paramètres n'est qu'un début. Ce planificateur sépare les poids du modèle, la mémoire de contexte et la réserve d'exécution, pour que votre choix de matériel reste vérifiable.

Gratuit · Sans inscription · Calcul sur votre appareil

Vos hypothèses

01 / SAISIE

Transformers denses illustratifs, pas la configuration garantie d'un modèle précis. Vérifiez les valeurs dans la configuration du modèle.

Ajuster l'architecture et le cache KV

Un cache KV quantifié doit être pris en charge par le moteur d'inférence ; les métadonnées et les tampons temporaires ne sont pas modélisés séparément ici.

Ce que signifie ce chiffre.

A

Les poids ne sont pas toute la mémoire.

Le calcul brut est : paramètres × nombre de bits ÷ 8. Les formats quantifiés stockent aussi des échelles et des métadonnées, et certains tenseurs gardent une précision plus élevée. La majoration réglable est une hypothèse. Si vous les avez, la taille réelle des fichiers du modèle est un meilleur point de départ.

B

Un long contexte coûte en plus.

Pour un transformer classique avec cache d'attention complet, nous calculons : 2 × couches × têtes KV × dimension de tête × jetons × séquences parallèles × octets par valeur du cache. Les jetons d'entrée et générés partagent le même budget de contexte. Les fenêtres glissantes, MLA, architectures hybrides et autres peuvent s'écarter nettement.

C

Plusieurs GPU ne font pas un seul grand bloc de mémoire.

Une capacité totale suffisante ne signifie pas que le modèle peut être réparti sur n'importe quelles cartes. Le moteur, la répartition des couches, les interconnexions et les tampons par GPU comptent aussi. En cas de délestage vers le CPU, la mémoire vive s'ajoute et la bande passante peut limiter le débit. Les modèles MoE dont tous les experts sont en mémoire demandent plus que les seuls paramètres actifs.

DE L'ESTIMATION AU SYSTÈME

Choisir le matériel en connaissance de cause.

Fixez d'abord le modèle, la quantification, le contexte et le nombre d'utilisateurs, puis comparez les offres. Par exemple, la station de travail IA Mineshop accepte jusqu'à trois GPU NVIDIA RTX 6000 Pro et jusqu'à 256 Go de RAM ECC ; chaque unité est assemblée à la main sur commande. Ce calculateur est fourni par le revendeur de matériel Mineshop.

Voir la station de travail IA Mineshop ↗

Méthode, limites et sources

Toutes les valeurs sont en Gio (2³⁰ octets). Les indications des fabricants en Go ne sont pas automatiquement la même unité. Le calculateur estime la mémoire d'inférence, pas l'entraînement, les états de l'optimiseur ni un nombre de jetons par seconde garanti. Les encodeurs de vision, les activations non modélisées et les tampons du moteur doivent être ajoutés. La majoration de 15 % et la réserve de 2 Gio sont des hypothèses de départ modifiables, pas des constantes universelles.

Pas de cookies, pas de polices externes, pas d'outil d'analyse et aucune transmission de vos saisies par ce calculateur. L'hébergeur peut traiter des données techniques d'accès. Mis à jour : 29 septembre 2026.