CAJ | 학술논문

全词消歧(All-Words Word Sense Disambiguation)可以看作一个序列标注问题,该文提出了两种基于序列标注的全词消歧方法,它们分别基于隐马尔可夫模型(Hidden Markov Model,HMM)和最大熵马尔可夫模型(Maximum Entropy Markov Model,MEMM).首先,我们用HMM对全词消歧进行建模.然后,针对HMM只能利用词形观察值的缺点,我们将上述HMM模型推广为MEMM模型,将大量上下文特征集成到模型中.对于全词消歧这类超大状态问题,在HMM和MEMM模型中均存在数据稀疏和时间复杂度过高的问题,我们通过柱状搜索Viterbi算法和平滑策略来解决.最后,我们在Senseval-2和Senseval-3的数据集上进行了评测,该文提出的MEMM方法的F1值为0.654,超过了该评测上所有的基于序列标注的方法.
전사소기(All-Words Word Sense Disambiguation)가이간작일개서렬표주문제,해문제출료량충기우서렬표주적전사소기방법,타문분별기우은마이가부모형(Hidden Markov Model,HMM)화최대적마이가부모형(Maximum Entropy Markov Model,MEMM).수선,아문용HMM대전사소기진행건모.연후,침대HMM지능이용사형관찰치적결점,아문장상술HMM모형추엄위MEMM모형,장대량상하문특정집성도모형중.대우전사소기저류초대상태문제,재HMM화MEMM모형중균존재수거희소화시간복잡도과고적문제,아문통과주상수색Viterbi산법화평활책략래해결.최후,아문재Senseval-2화Senseval-3적수거집상진행료평측,해문제출적MEMM방법적F1치위0.654,초과료해평측상소유적기우서렬표주적방법.