该问题与以下内容完全相同: > How to prevent splitting specific words or phrases and numbers in NLTK? 2个
可以通过使用nltk.tokenize删除一些不必要的停用词来对字符串进行令牌化.但是,如何在删除其他停用词的同时将包含停用词的短语令牌化为单个令牌呢?
例如:
输入:特朗普是美国总统.
输出:[“特朗普”,“美国总统”]
如何获得仅删除“是”和第一个“ the”但不删除“ of”和第二个“ the”的结果?
最佳答案
您可以使用nltk的Multi-Word Expression Tokenizer,它可以将多单词表达式合并为单个标记.您可以创建一个包含多词表达式的词典,并向其添加条目,如下所示:
from nltk.tokenize import MWETokenizer
mwetokenizer = MWETokenizer([('President','of','the','United','States')],separator=' ')
mwetokenizer.add_mwe(('President','France'))
请注意,MWETokenizer将带标记文本的列表作为输入,然后对其进行重新标记.因此,首先标记该句子.使用word_tokenize(),然后将其输入MWETokenizer:
from nltk.tokenize import word_tokenize
sentence = "Trump is the President of the United States,and Macron is the President of France."
mwetokenized_sentence = mwetokenizer.tokenize(word_tokenize(sentence))
# ['Trump','is','President of the United States',','and','Macron','President of France','.']
然后,过滤掉停用词以获得最终过滤的标记化句子:
from nltk.corpus import stopwords
stop_words = set(stopwords.words('english'))
filtered_sentence = [token for token in mwetokenizer.tokenize(word_tokenize(sentence)) if token not in stop_words]
print(filtered_sentence)
输出:
['Trump','.']
版权声明:本文内容由互联网用户自发贡献,该文观点与技术仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌侵权/违法违规的内容, 请发送邮件至 dio@foxmail.com 举报,一经查实,本站将立刻删除。