GIZA++よりIBM翻訳モデルを推定することで最尤な単語確率を得る.これを日英,英日の両方向に対して行う.日本語文“私たちは映画を見に行く”とその対訳英語文“We go to watch the movie”を例にあげ,日英方向の単語対応の例を表
に,英日方向の単語対応の例を表
に示す.また●は単語が対応した箇所を示す.
次に,両方向の対応付けからヒューリスティックスなルールにより,1 対多の対応を認めた単語対応の計算を行う.ここで,ヒューリスティックとは人間の日々の意思決定類似した直感的かつ発見的な思考方法である.基本のヒューリスティックとして"intersection"と"union" がある.intersection は,日英方向と英日方向の両方向に単語対応が存在する場合にその単語対応を残す.union は日英方向と英日方向のどちらか一方に単語対応が存在する場合にその単語対応を残す.intersection の例を表
に,union の例を表
に示す.
またintersection とunion の中間のヒューリスティックスとして"grow" と"grow-diag"がある.これら2 つのヒューリスティックスではintersection の単語対応とunion の単語対応を用いる.grow は縦横方向,grow-diag は縦横対角方向に,intersection の単語対応からunion の単語対応が存在する場合にその単語対応も用いる.grow の例を表
に,grow-diag の例を表
に示す.
grow-diag の最終処理として"final" と"final-and" がある.final は少なくとも一方の言語に対応がない場合に,union の単語対応を追加し,final-and は両言語単語に対応がない場合に,union の単語対応を追加する方法である.grow-diag-final の例を表
に,grow-diag-final-and の例を表
に示す.
得られた単語対応うち,矛盾しない全ての対訳句を得る.このとき,対訳句に対して翻訳確率を計算し,対訳句に確率値を付与することでフレーズテーブルを作成する.