import gensim from gensim.utils import simple_preprocess def sent_to_words(sentences): for sentence in sentences: yield(gensim.utils.simple_preprocess(str(sentence), deacc=True)) # deacc=True removes punctuations data = papers.paper_text_processed.values.tolist() data_words = list(sent_to_words(data)) print(data_words[:1][0][:30])