# Example pre-allocation for keys and values max_seq_len = 1024 # maximum expected sequence length cache_k = torch.zeros( (batch_size, num_heads, max_seq_len, head_dim), device=device ) cache_v = torch.zeros( (batch_size, num_heads, max_seq_len, head_dim), device=device )