for epoch in range(200): pred = model(x) loss = loss_fn(pred, y) optimizer.zero_grad() # clear last step's gradients loss.backward() # compute this step's gradients optimizer.step() # apply the update rule