Performance Lab
Labs · Performance Lab

TTFT, Tokens/s und Concurrency erleben

Zwei Systeme, zwei völlig unterschiedliche Charakteristiken. Starte das Rennen und finde heraus, warum TTFT und Tokens/s zwei verschiedene Dinge messen.

01

Das Renn-Experiment

Beide Systeme beantworten dieselbe Frage gleichzeitig — schau genau hin, wann welches zuerst reagiert.

System A0 ms
Noch nicht gestartet.
System B0 ms
Noch nicht gestartet.
02

Concurrency-Simulator

Mehr parallele Nutzer erhöhen die Anforderungen an die Infrastruktur — auch wenn sich am Modell nichts ändert.

Gleichzeitige Nutzer
Feste Infrastruktur: 2 GPUs à 40 parallele Anfragen (80 gesamt)
40
GPU-Auslastung
50%
Warteschlange
0Anfragen
TTFT
400ms
Durchsatz
880Tok/s
Kosten / Std.
6 €
2 GPUs empfohlen
Infrastruktur im grünen Bereich
Die vorhandene Kapazität reicht für die aktuelle Last. Schiebe den Regler weiter nach rechts, um zu sehen, was bei einer Lastspitze passiert.

Vereinfachtes Lernmodell, keine reale Kapazitätsplanung. Die „empfohlenen Kosten“ zeigen, wie viele GPUs nötig wären, um die TTFT bei dieser Last stabil zu halten.