docker run -d --name vllm --privileged --net=host --shm-size 10gb vllm/vllm-tpu:nightly \ vllm serve google/gemma-4-12B-it --tensor-parallel-size 1 --max-model-len 2048 --max-num-seqs 16 \ --max-logprobs 32 --generation-config vllm --limit-mm-per-prompt '{"image":0,"audio":0}' --enable-prefix-caching