阅读背景:

使用ES对中文文章进行分词,并进行词频统计排序

来源:互联网 

前言:首先有这样一个需求,须要统计一篇10000字的文章,须要统计里面哪些词涌现的频率比拟高,这里面比拟主要的是如何对文章中的一段话进行分词,例如“北京是×××的首都”,“北京”,“×××”,“中华”,“华人”,“人民”,“共和国”,“首都”这些是一个词,须要切分出来,而“京是”“民共”这些就不是成心义的词,所以不能分出来。这些分词的规矩如果自己去写,是一件很麻烦的事,应用开源的IK分词,便可以够很容易的做到。并且可以依据分词的模式来决议分词的颗粒度。:首先有这样一个需求,须要统计一篇10000字的文章,须要统计里面哪些词涌现的频率比拟高,这里面




你的当前访问异常,请进行认证后继续阅读剩余内容。

分享到: