そこで本研究では,
-gramモデルの代わりに交差エントロピーの拡張であるHigh order Joint Probabilityを使用する手法を提案する.
-gramが近隣の情報を利用しているのに対し,High order Joint Probabilityは遠隔の情報を利用できる.したがって,文法的な情報を利用できる.そのため分野依存性が少なく,別分野の言語データを追加しても翻訳精度が向上すると考える.機械翻訳機には相対的意味論に基づく変換主導型パターンベース統計機械翻訳(TDPBSMT)を用いる.言語モデルにはTri-gramとHigh order Joint Probabilityを用いる.対訳学習文とテスト文には,電子辞書から抜き出した文(辞書文)で単文を用いる.追加データにはwikipediaから抜き出した文(Wikipedia文)を用いる.
その結果,自動評価と人手評価の結果より,対訳学習文とは別分野のデータを追加データとして用いた場合,High order Joint Probabilityの方がTri-gramよりも翻訳精度が良いことが確認できた.また,追加実験として追加データを利用しない実験と,追加データに対訳学習文と同一分野のデータを追加する実験を行った.追加データには辞書文から抽出した複文を用いた.追加データを利用しない場合と追加データに対訳学習文と同一分野のデータを追加する場合のどちらについても,High order Joint Probabilityの方がTri-gramよりも翻訳精度が良いことが確認できた.
本論文の構成は以下の通りである. まず,2章で統計翻訳システムの概要について述べる. 3章では,従来手法について述べる. 4章では,提案手法について述べる. 5章では,相対的意味論に基づく変換主導型パターンベース統計機械翻訳(TDPBSMT)について述べる. 6章では,評価方法について述べる. 7章では,実験に用いるデータやツールといった実験環境について述べる. 8章では,実験の結果を示す.9章では,追加実験について示す. そして,10章で考察を行い, 最後に11章で結論を述べ,まとめる.