git clone https://github.com/ggml-org/llama.cpp ~/llama.cpp cd ~/llama.cpp git checkout 95ef7fc cmake -B build -DGGML_CUDA=ON -DCMAKE_CUDA_ARCHITECTURES=75 -DCMAKE_BUILD_TYPE=Release cmake --build build --config Release -j --target llama-server ls build/bin/llama-server