from bertopic import BERTopic from umap import UMAP from sklearn.feature_extraction.text import CountVectorizer from nltk.corpus import stopwords import nltk from nltk import word_tokenize from nltk.stem import WordNetLemmatizer import pandas as pd import re nltk.download('stopwords') # create a list of speeches docs = data['text'].tolist()