MINESHOP / WERKZEUGE01 — LOKALE KI

ERST RECHNEN. DANN HARDWARE WÄHLEN.

Wie viel Speicher
braucht dein LLM?

Parameter sind nur der Anfang. Dieser Planer trennt Modellgewichte, Kontextspeicher und Laufzeitreserve — damit deine Hardwareplanung nachvollziehbar bleibt.

Kostenlos · Keine Anmeldung · Berechnung auf deinem Gerät

Deine Annahmen

01 / EINGABE

Illustrative dichte Transformer, keine zugesicherte Konfiguration eines bestimmten Modells. Werte mit der Modell-Konfiguration abgleichen.

Architektur & KV-Cache anpassen

Quantisierter KV-Cache benötigt Backend-Unterstützung; Metadaten und temporäre Buffer sind hier nicht separat modelliert.

Was die Zahl bedeutet.

A

Gewichte sind nicht der gesamte Speicher.

Die Rohrechnung lautet: Parameter × Bitbreite ÷ 8. Quantisierungsformate speichern zusätzliche Skalen und Metadaten; manche Tensoren behalten eine höhere Präzision. Der einstellbare Aufschlag ist eine Annahme. Wenn vorhanden, ist die tatsächliche Größe der Modelldateien der bessere Ausgangspunkt.

B

Langer Kontext kostet extra.

Für einen gewöhnlichen Transformer mit vollständigem Attention-Cache rechnen wir: 2 × Layer × KV-Heads × Head-Dimension × Token × parallele Sequenzen × Byte je Cache-Wert. Eingabe und erzeugte Token teilen sich das Kontextbudget. Sliding-Window, MLA, hybride und andere Architekturen können deutlich abweichen.

C

Mehrere GPUs sind kein großer Speicherblock.

Eine passende Gesamtkapazität bedeutet nicht, dass das Modell auf beliebige Karten verteilt werden kann. Backend, Layer-Verteilung, Verbindungen und pro-GPU-Buffer entscheiden mit. Bei CPU-Offload kommt Arbeitsspeicher hinzu; Bandbreite kann den Durchsatz begrenzen. MoE-Modelle mit allen Experten im Speicher benötigen mehr als nur die aktiven Parameter.

VON DER SCHÄTZUNG ZUM SYSTEM

Hardware mit Kontext auswählen.

Modell, Quantisierung, Kontext und Nutzerzahl festlegen — erst danach Angebote vergleichen. Dieser Rechner wird vom Hardwarehändler Mineshop bereitgestellt.

KI-Workstations bei Mineshop ansehen ↗

Methodik, Grenzen & Quellen

Alle Werte sind in GiB (2³⁰ Byte). Herstellerangaben in GB sind nicht automatisch dieselbe Einheit. Der Rechner schätzt Inferenzspeicher, nicht Training, Optimizer-Zustände oder garantierte Token/s. Vision-Encoder, nicht modellierte Aktivierungen und Backend-Buffer müssen zusätzlich berücksichtigt werden. 15 % Aufschlag und 2 GiB Reserve sind veränderbare Startannahmen, keine allgemeingültigen Konstanten.

Keine Cookies, keine externen Schriftarten, keine Analytik und keine Übermittlung deiner Eingaben durch diesen Rechner. Der Hosting-Anbieter kann technische Zugriffsdaten verarbeiten. Stand: 25. September 2026.