[](https://hamel.dev/notes/llm/inference/inference.html#cb1-1)python3 -m mlc_llm.build \ [](https://hamel.dev/notes/llm/inference/inference.html#cb1-2)--hf-path meta-llama/Llama-2-7b-chat-hf \ [](https://hamel.dev/notes/llm/inference/inference.html#cb1-3)--target cuda --quantization q4f16_1