入力データとその準備について(Word vs. Excel) #1382
お使いのKH CoderのバージョンKH Coder3. -Beta.03i ご質問の内容をお書きください■お使いのOS ■分析しようとしているのは何語のテキストですか? ■ご質問の内容 KH Coderを使用させていただいている者です。 テキストデータの準備形式について、初歩的な質問で恐縮ですがご教示いただけますと幸いです。 ・「総抽出語数」と「異なり語数」の数値が、Excelファイルにした場合、いずれも減少している ・共起ネットワーク分析や、抽出語リスト分析の結果はWordファイルとExcelファイルとで一致している。 自分なりに原因を考えたところ、Wordファイルでは「参加者ID」(01,02,03...)も入力していたのに対し、Excelでは「テキストデータ」のみをセルに入力したことで、それらのノイズが除外され、語数が減少したのではないかと推測しております。 そこでお伺いしたいのですが、 お忙しいところ恐縮ですが、ご回答いただけますと幸いです。よろしくお願いいたします。 |
Replies: 1 comment
|
KH Coderを開発している樋口です。書き込みありがとうございます。
おそらくはお書きいただいた通りかと思われます。 Excelファイルの場合は、分析対象列の内容だけがテキストとして認識されます。他の列に入力されているID番号とか、例えばジェンダー・年代のような変数は、テキストとして認識されません。一方でWordファイルの場合は、入力されているすべての文字列がテキストと認識されます。またWordからテキストに変換する際に、罫線などの書式が、記号等に置き換えられる場合があり、この場合はそれらの記号もテキストとして認識されます。 ただ、実用上の問題は生じないかと思います。ID番号や変数、記号などが増えると、その「文」「段落」の長さが少し実際よりも長く認識されるでしょう。しかし、それによって分析結果が大きく変わることは考えにくいです。例えば、共起ネットワーク作成時に共起の強さを測る(デフォルトの)Jaccard係数は、上記のような形で文・段落の長さが伸びても、計算結果にはいっさい変化が生じません。Euclidやコサイン係数では、わずかに変化が生じますが、本当にわずかです。したがって実用上の問題はありませんが、おすすめはExcel・CSVということになります。 なおKH Coder 3 Beta版のサポート(積極的な改修)は終了していますので、たとえば人に見せたり論文に載せるような重要な分析については、KH Coder 3正式版のご利用をお勧めしております。Beta版のなかでも相当古いバージョンをお使いいただいているようですので。 |
KH Coderを開発している樋口です。書き込みありがとうございます。
おそらくはお書きいただいた通りかと思われます。
Excelファイルの場合は、分析対象列の内容だけがテキストとして認識されます。他の列に入力されているID番号とか、例えばジェンダー・年代のような変数は、テキストとして認識されません。一方でWordファイルの場合は、入力されているすべての文字列がテキストと認識されます。またWordからテキストに変換する際に、罫線などの書式が、記号等に置き換えられる場合があり、この場合はそれらの記号もテキストとして認識されます。
ただ、実用上の問題は生じないかと思います。ID番号や変数、記号などが増えると、その「文」「段落」の長さが少し実際よりも長く認識されるでしょう。しかし、それによって分析結果が大きく変わることは考えにくいです。例えば、共起ネットワーク作成時に共起の強さを測る(デフォルトの)Jaccard係数は、上記のような形で文・段落の長さが伸びても、計算結果にはいっさい変化が生じません。Euclidやコサイン係数では、わずかに変化が生じますが、本当にわずかです。したがって実用上の問題はありませんが、おすすめはExcel・CSVということになります。
なおKH Coder 3 Beta版のサポート(積極的な改修)は終了…