集搜客GooSeeker网络爬虫
标题:
根据词间距离条件筛选分析知乎话题文本
[打印本页]
作者:
Fuller
时间:
2024-7-16 09:26
标题:
根据词间距离条件筛选分析知乎话题文本
根据词语间距筛选共现词的原因有二:
1. 基于原始文本自动分词得到的结果,词的数量很大,很多词没有分析价值,除了增加处理的难度,而且会干扰分析结果的合理性。
2. 如果被分析的文本长短不一,甚至相差悬殊,例如,知乎网站上的回答,有些回答是一篇相当长篇幅的文章。在这样的长文本中,词语共现的可能性极大
本Jupyter Notebook根据词语间距筛选共现关系,下载源代码请点击:[attach]16215[/attach]
欢迎光临 集搜客GooSeeker网络爬虫 (https://www.gooseeker.com/doc/)
Powered by Discuz! X3.2