参数训练(parameter training),理学-计算机科学技术-人工智能-自然语言处理-机器翻译-统计机器翻译-参数训练,利用数据自动训练机器翻译模型的参数。随着互联网的蓬勃发展和大数据时代的来临,数据驱动的方法成为机器翻译学术界和工业界的研究热点。数据驱动的机器翻译主张为翻译过程建立概率模型,将翻译知识表示为模型参数,并从数据中自动学习模型参数。参数训练主要使用两种数据集:训练集和开发集。训练集主要用于模型参数的估计,开发集主要用于超参数的选择。数据驱动的机器翻译主要分为统计机器翻译(SMT)和神经机器翻译(NMT)两类方法,其参数训练方法具有显著差异。统计机器翻译利用离散的符号来表示翻译过程中的语言结构,主要分为生成式模型和判别式模型。生成式模型利用语言结构(如词语对齐、短语切分、句法规则等)定义翻译过程,其模型参数是概率分布。由于在翻译过程中语言结构并未在训练数据上观测到,因此被定义为生成式模型中的隐变量。生成式模型的标准训练准则是最大似然(maximum likelihood),即计算一组参数使得模型在训练集上的似然值最大。