阅读背景:

Keras学习(六)-imdb电影影评数据处理(自然语言处理)_宋建国的博客

来源:互联网 

1.处理流程

  • 建立token字典:因为深度学习模型是无法处理文字的,必须将文字对应成可以计算的数字,所以需要将“影评文字”对应成为“数字列表”建立一一对应关系,本训练中提取最常用的前2000个高频词语进行建立token字典,因为最常用的词语对情感分析是最为重要的。同时为保持所用影评的“数字列表”的长度都是统一的(放入模型中的参数必须规格统一),采取取长补短法,短的在前面填0,长的截取前面的元素。建立token字典:因为深度学习模型是无法处理文



你的当前访问异常,请进行认证后继续阅读剩余内容。

分享到: