阅读背景:

自然语言处理(2)——学习分类文本之有监督分类

来源:互联网 

文档分类,其实就是根据文档的特征,统计每一个文档中的特征集,从而进行分类

这些特征的选择,可以选择高频词,词的后缀,也可以根据上下文语境,可以结合这个词和这个词的上一个词进行特征提取,还可以使用连续分类器,既考虑已知的标注集,又根据该集合预测新的标注,并加入到历史标注集中,有种半监督的意味。这




你的当前访问异常,请进行认证后继续阅读剩余内容。

分享到: