IBM翻訳モデルは仏英翻訳を前提としているが,本研究では日英翻訳を扱っているため,日英翻訳を前提に説明する.なお,以下の説明は藤原ら[7]の論文より引用した.
原言語の日本語文を
,目的言語の英語文を
として定義する.IBM翻訳モデルにおいて,日本語文
と英語文
の翻訳モデル
を計算するため,アライメント
を用いる.以下にIBMモデルの基本的な計算式を示す.
| (5) |
ここで,アライメント
は,
と
の単語の対応を意味している.
IBM翻訳モデルにおいて,各日単語に対応する英単語は1つであるのに対して,各英単語に対応する日単語は0からn個あると仮定する.また,日単語と適切な英単語が対応しない場合,英語文の先頭に
という空単語があると仮定し,日単語と対応させる.
model1
式(3)は以下の式に置き換えられる.
![]() |
(6) |
は日本語文の文長を示す.また,
は日本語文の1単語目から
-1単語目までのアライメントである.
そして
は日本語文の1番目から
-1番目までの単語を示す.
ここで,Model1では以下を仮定している.
以上の仮定を用いて,式(4)は簡略化することができる.以下に式を示す.
![]() |
(7) | ||
![]() |
(8) | ||
![]() |
(9) |
model1において,翻訳確率
の初期値が0でない場合, EMアルゴリズムを用いて最適解を推定する.EMアルゴリズムの手順を以下に示す.
![]() |
(10) |
![]() |
(11) |
![]() |
(12) | ||
![]() |
(13) |
model2
model1において,アライメントの確率は英語文の長さ
にのみ依存する.
そこでmodel2では,英語文の長さ
に加え,
単語目のアライメント
,
日本語文の長さ
に依存するとし,以下の式で表す.
| (14) |
![]() |
(15) | ||
![]() |
(16) |
model2において,対訳文中の英単語
と日単語
が対応付けされる回数の期待値である
と,日単語の位置
と英単語の位置
が対応付けられる回数の期待値
が存在する.以下に,期待値
と
を求める式を示す.
![]() |
(17) | ||
![]() |
(18) |
model3
model1およびmodel2において,日単語と英単語の対応は1対1の場合のみを考慮していた.
しかし,model3では,1つの単語が複数の単語に対応する場合や,単語の翻訳位置の距離についても考慮する.
また,モデル3では単語の位置を絶対位置として考えている.モデル3では以下のパラメータを用いる.
![]() |
(19) |
したがって,model3は以下の式によって表される.
![]() |
(20) | ||
![]() |
|||
![]() |
(21) |
モデル3では,全ての単語対応を考慮して計算するため,計算量が膨大となる.そのため,期待値は近似によって求められる.
model4
model3とmodel4の違いは,単語の位置の考慮の仕方である.model3において,単語の位置は絶対位置で考慮していた.それに対して,model4では単語の位置を相対位置で考慮する.また,各単語ごとの位置も考慮している.model4では,単語位置の歪みの確率である
を以下の2通りで考慮する.
| (22) |
| (23) |
model5
モデル4では,単語の位置に関して直前の単語のみを考慮している. そのため,複数の単語が同じ位置に生じたり,単語が存在しない位置に生成されるという問題がある. モデル5では,この問題を避けるために,単語を空白部分に配置するように制約が施されている.