1.3.3语言模型的评估: Perplexity
我们 如何来评估一种语言模型呢? 比如现在有二元模型和三元模型,怎么比较这两种模型哪个更优秀呢. 一种常见的思想是在测试数据集进行最大似然估计。 既然测试数据集已经在这儿了, 那么利用二元模型和三元模型训练得到的各个词的概率来计算在测试数据集中出现的句子的概率, 那么得到的概率大的模型肯定是优秀的。 我们 如何来评估一种语
1.3.3语言模型的评估: Perplexity
我们 如何来评估一种语言模型呢? 比如现在有二元模型和三元模型,怎么比较这两种模型哪个更优秀呢. 一种常见的思想是在测试数据集进行最大似然估计。 既然测试数据集已经在这儿了, 那么利用二元模型和三元模型训练得到的各个词的概率来计算在测试数据集中出现的句子的概率, 那么得到的概率大的模型肯定是优秀的。 我们 如何来评估一种语