torchrun --nproc_per_node=1 \ --no-python \ nsys profile \ --capture-range=cudaProfilerApi \ --capture-range-end=stop \ --trace=cuda,nvtx,nccl,osrt \ --output=ddp-1gpu \ python train.py