@@ -861 +861 @@ - hidden_states = inputs_embeds + position_embeds.to(inputs_embeds.device) + hidden_states = inputs_embeds + position_embeds @@ -867,3 +867 @@ - causal_mask = self._update_causal_mask( - attention_mask, inputs_embeds, cache_position, past_key_values, output_attentions - ) + causal_mask = None @@ -877 +875 @@ - if encoder_attention_mask is None: + if not _use_sdpa and encoder_attention_mask is None: @@ -880,3 +878 @@ - encoder_attention_mask = _prepare_4d_attention_mask_for_sdpa( - mask=encoder_attention_mask, dtype=inputs_embeds.dtype, tgt_len=input_shape[-1] - ) + pass