AGewichte sind nicht der gesamte Speicher.
Die Rohrechnung lautet: Parameter × Bitbreite ÷ 8. Quantisierungsformate speichern zusätzliche Skalen und Metadaten; manche Tensoren behalten eine höhere Präzision. Der einstellbare Aufschlag ist eine Annahme. Wenn vorhanden, ist die tatsächliche Größe der Modelldateien der bessere Ausgangspunkt.
BLanger Kontext kostet extra.
Für einen gewöhnlichen Transformer mit vollständigem Attention-Cache rechnen wir: 2 × Layer × KV-Heads × Head-Dimension × Token × parallele Sequenzen × Byte je Cache-Wert. Eingabe und erzeugte Token teilen sich das Kontextbudget. Sliding-Window, MLA, hybride und andere Architekturen können deutlich abweichen.
CMehrere GPUs sind kein großer Speicherblock.
Eine passende Gesamtkapazität bedeutet nicht, dass das Modell auf beliebige Karten verteilt werden kann. Backend, Layer-Verteilung, Verbindungen und pro-GPU-Buffer entscheiden mit. Bei CPU-Offload kommt Arbeitsspeicher hinzu; Bandbreite kann den Durchsatz begrenzen. MoE-Modelle mit allen Experten im Speicher benötigen mehr als nur die aktiven Parameter.