提案手法の手順

提案手法の手順を以下に示す.また,手順の例を図3.1に示す.

手順1
複数文書に含まれる文を句点区切りで抽出する.
手順2
文のベクトルを計算する.
手順3
文ベクトルを基に文をWard法による階層クラスタリングでクラスタリングする.
手順4
階層クラスタリングによって得られた各クラスタ数でのクラスタリング結果を基に表に整理する.ここで,クラスタリングの際に,情報がどの文書に含まれていたかは考慮されないため,1つのセルに複数の情報が含まれる場合がある.クラスタ数$k$での表の埋まり具合を式(3.1)から,情報の密集度を式(3.2)からそれぞれ求める.$\vert c_{k,i}\vert$はクラスタ数$k$での表の$i$番目の列に含まれる文の総数,$d_{k,i,j}$はクラスタ数$k$での表の$i$番目の列の$j$番目の文のベクトル,$C_k$はクラスタ数$k$での表の列の総数,$cosine(x,y)$は$x$,$y$のコサイン類似度を求める関数を表す.
\begin{displaymath}
\scalebox{1}{$\displaystyle
cover_k = \frac{クラスタ数k...
...修遼笋泙辰討い襯札襪凌�}{クラスタ数kでの表のセルの総数}
$}
\end{displaymath} (3.1)


$\displaystyle density_k = \min_{j \neq h}(cosine(d_{k,i,j},d_{k,i,h})) $     (3.2)
$\displaystyle i = 1, \cdots, C_k  j,h = 1, \cdots, \vert c_k,i\vert$      

ここで,全てのクラスタ数での$cover_k$の集合を$COVER$,$max(COVER)$を集合$COVER$の最大値,$min(COVER)$は集合$COVER$の最小値とする. 各クラスタでの$cover_k$を式(3.3)で$0〜1$の範囲に正規化する.

\begin{displaymath}
\scalebox{1}{$\displaystyle
norm(cover_k) = \frac{cover_k-min(COVER)}{max(COVER)-min(COVER)}
$}
\end{displaymath} (3.3)

同様に,全てのクラスタ数での$density_k$の集合を$DENSITY$,$max(DENSITY)$を集合$DENSITY$の最大値,$min(DENSITY)$は集合$DENSITY$の最小値とする. 各クラスタでの$density_k$を式(3.4)で$0〜1$の範囲に正規化する.

\begin{displaymath}
\scalebox{1}{$\displaystyle
norm(density_k) = \frac{density_k-min(DENSITY)}{max(DENSITY)-min(DENSITY)}
$}
\end{displaymath} (3.4)

クラスタ数$k$での表の$Score_k$を式(3.5)より求める.$Score_k$が最大となるときのクラスタ数$k$を最適なクラスタ数として採用する.

\begin{displaymath}
\scalebox{1}{$\displaystyle
Score_k = norm(cover_k) \times norm(density_k)
$}
\end{displaymath} (3.5)

手順5
手順4で採用されたクラスタ数でのクラスタリングの結果を,行を文書,列をクラスタとする表に整理する.
手順6
表の各列について,項目名を付与する.

図: 提案手法の手順の例
\includegraphics[clip,width=16cm]{.././EPS/makingTableExample_teian.eps}