vllm serve /work/models/gemma-4-26B-A4B-it-qat-q4_0-w4a16-ct --tensor-parallel-size 1 \ --max-model-len 2048 --max-num-seqs 16 --max-logprobs 32 --generation-config vllm \ --limit-mm-per-prompt '{"image":0,"audio":0,"video":0}' --enable-prefix-caching