阅读背景:

文本去重第一步:基于内容的文本相似性计算

来源:互联网 


为何要计算文档相似性

      在今年年初的时候,我开始尝试做文本的自动聚类,当时是从网上,找到的一个K-Means算法,稍作了修改。从测试结果来看,分类效果不太好,究其原因,我认为有两个,一个是词库的问题,停用词词库太小,没有噪音词库,也没有近义词词库,最关键的是切出来的词,统计的TFIDF权重不准确,第二个原因则是计算某文档与目标类别的相似度的算法不够合理。第一个问题经过两天多的尝试,于昨日解决了,剩下了第二个问题,真是让人头疼。      在今年年初的时候,我开始尝试做文本的自动聚类,当时是从网上,找到的




你的当前访问异常,请进行认证后继续阅读剩余内容。

分享到: