Next-token prediction: Loss is calculated across every token position Text classification: Loss is calculated using only the final sequence position __ __