>>> torch._scaled_mm(a4, b4, scale_a=s, scale_b=s, out_dtype=torch.bfloat16) NotImplementedError: Block-wise scaling for Float8_e8m0fnu is only supported on gfx950,gfx1250