集搜客GooSeeker网络爬虫

标题: 根据词间距离条件筛选分析知乎话题文本 [打印本页]

作者: Fuller    时间: 2024-7-16 09:26
标题: 根据词间距离条件筛选分析知乎话题文本
根据词语间距筛选共现词的原因有二:
1. 基于原始文本自动分词得到的结果,词的数量很大,很多词没有分析价值,除了增加处理的难度,而且会干扰分析结果的合理性。
2. 如果被分析的文本长短不一,甚至相差悬殊,例如,知乎网站上的回答,有些回答是一篇相当长篇幅的文章。在这样的长文本中,词语共现的可能性极大

本Jupyter Notebook根据词语间距筛选共现关系,下载源代码请点击:[attach]16215[/attach]






欢迎光临 集搜客GooSeeker网络爬虫 (https://www.gooseeker.com/doc/) Powered by Discuz! X3.2