Hardware Lab
Labs · Hardware Lab

VRAM, Modellgröße und Quantisierung

Modellgröße und numerische Präzision beeinflussen den Speicherbedarf erheblich. Schiebe die Regler und sieh zu, ab wann welche Hardware-Klasse gebraucht wird.

01

VRAM-Simulator

Wähle Modellgröße und Quantisierung — der geschätzte Speicherbedarf reagiert sofort.

Modellgröße
Quantisierung

Kaum Qualitätsverlust, aber der größte Speicherbedarf. Gängige Formate: Voller Trainingsformat-Nachfolger.

Geschätzter Speicherbedarf17 GB
RTX 4090
L40S
A100 80GB
H100 80GB
Passt auf eine Consumer-GPU (z. B. RTX 4090)
7B-Modell in FP16 · reiner Gewichtsspeicher plus ca. 20 % für Laufzeit-Overhead
Warum steigt der Bedarf so schnell?
Ein 70B-Modell hat zehnmal mehr Gewichte als ein 7B-Modell — und jedes Gewicht braucht in FP16 zwei Byte Speicher. Deshalb wächst der VRAM-Bedarf linear mit der Modellgröße.
Der Hebel: Quantisierung
Von FP16 auf 4 Bit zu wechseln viertelt den Speicherbedarf nahezu — bei überschaubarem Qualitätsverlust. Das ist der Grund, warum ein 70B-Modell überhaupt auf einer einzelnen GPU läuft.
02

Quantisierungs-Demo

Das Prinzip hinter dem Hebel, der große Modelle überhaupt bezahlbar macht.

FP16Referenzformat, kaum Qualitätsverlust
16 Bit / Gewicht
8 BitHalber Speicher, Qualität bleibt fast gleich
8 Bit / Gewicht
4 BitViertel des Speichers, Verlust wird spürbar
4 Bit / Gewicht

Quantisierung reduziert die Genauigkeit, mit der Modellgewichte gespeichert werden. Dadurch sinkt der Speicherbedarf fast proportional zur Bit-Anzahl — von 16 auf 4 Bit ist ungefähr ein Viertel des Platzes.

Gängige Formate

Dateiformat für CPU- und gemischten Betrieb, verbreitet bei llama.cpp und Ollama.

4-Bit-Quantisierung speziell für GPU-Inferenz mit geringem Qualitätsverlust.

8-Bit-Fließkomma, nativ von modernen GPUs unterstützt — spart Speicher und erhöht Durchsatz.