VRAM, Modellgröße und Quantisierung
Modellgröße und numerische Präzision beeinflussen den Speicherbedarf erheblich. Schiebe die Regler und sieh zu, ab wann welche Hardware-Klasse gebraucht wird.
VRAM-Simulator
Wähle Modellgröße und Quantisierung — der geschätzte Speicherbedarf reagiert sofort.
Kaum Qualitätsverlust, aber der größte Speicherbedarf. Gängige Formate: Voller Trainingsformat-Nachfolger.
Quantisierungs-Demo
Das Prinzip hinter dem Hebel, der große Modelle überhaupt bezahlbar macht.
Quantisierung reduziert die Genauigkeit, mit der Modellgewichte gespeichert werden. Dadurch sinkt der Speicherbedarf fast proportional zur Bit-Anzahl — von 16 auf 4 Bit ist ungefähr ein Viertel des Platzes.
Dateiformat für CPU- und gemischten Betrieb, verbreitet bei llama.cpp und Ollama.
4-Bit-Quantisierung speziell für GPU-Inferenz mit geringem Qualitätsverlust.
8-Bit-Fließkomma, nativ von modernen GPUs unterstützt — spart Speicher und erhöht Durchsatz.