Self-hosted

0GPU tok/s
Resident batch
0 / 0 sequences0%
VRAM
Per request0 tok/s
Queue0
Wait for 1st token
Full response
GPU utilization0%
Timed out0

Datacenter node

0GPU tok/s
Resident batch
0 / 0 sequences0%
VRAM (per GPU)
Per request0 tok/s
Queue0
Wait for 1st token
Full response
GPU utilization0%
Timed out0
Throughputnode / home
Responsehome / node
Paused
Model
Home
Node
Prompt 512
Output 400
Ctx 2048
Shape
Load 2.0 req/s
Try
View
queued prefill (reading your prompt) decoding (writing tokens) free KV slot timed out 1 spark = 60 tokens