ブラウザ実行モード: データはブラウザ内で処理され、サーバーにはアップロードされません。
速度と安定性: 処理速度はデバイスとブラウザに依存します。大量のバッチ作業では、デスクトップ版の方が安定する場合があります。
ツールを読み込み中です。お待ちください...
ツールを読み込み中です。お待ちください...
オンラインツールを読み込めない、または実行できない場合は、デスクトップツールをお試しください。 https://tools.yikeaigc.com/
ツール使用状況
旧バージョンに戻す
より強力で安定した機能を備えたデスクトップ版があります。
デスクトップ版を開く
先にテキストを選択し、分析パラメータを設定してから処理を開始してください。すぐ試す場合はサンプルデータを読み込めます。複数ファイルは先頭20件のみ表示されますが、分析時はすべて処理されます。
1入力方法を選択
2テキストファイルを追加
クリックしてファイルを選択、またはここにドラッグ
TXT、TEXT、MD、CSV、SRT、LOG に対応。ファイル内容はブラウザ内で読み取り・分析されます。
2テキスト貼り付け
テキストが未入力です。
2サンプルを読み込む
サンプルデータは現在の選択内容を置き換えます。
3選択内容の状態
文書数0
推定サイズ0 KB
テキスト選択待ち
TXT ファイルを追加、テキストを貼り付け、またはサンプルデータを読み込んでください。
分析対象のテキストが未追加です。
1分かち書きルール
2重み付けアルゴリズム
3BM25 パラメータ
一般的な値:K1 は約 1.2~2.0、B は約 0.75。値は BM25 スコア順位に影響します。
4フィルターと並べ替え
5カスタム辞書
1タスク確認
分析開始待ち
ファイルと設定を確認し、開始をクリックしてください。処理中はページを開いたままにしてください。
2処理進捗
進捗 0%
開始待ち...
分析結果はまだありません。先に前の手順を完了し、分析を開始してください。
| 順位 | 語句 | 範囲 | 語頻度 | 文書数 | カバー率 | 密度 | TF-IDF | BM25 | 初出位置 |
|---|
手順
ソフトウェア使用方法
- テキスト内容を選択:「ファイルを選択」をクリックしてTXT、MD、CSV、SRT、LOGなどのテキストファイルを一括インポートできます。また、「テキストを貼り付け」に切り替えて内容を直接入力することもできます。操作の流れを試したい場合は、サンプルデータを読み込めます。
- ファイル一覧を確認:ファイルを一括選択すると、画面には最初の20件のファイルが表示され、残りのファイルは件数で提示されます。実際の分析時にはすべてのファイルが処理対象になります。
- 分かち書きルールを設定:中国語の分かち書き方式、語長の下限、中国語複合語の長さを選択します。固定の業界用語がある場合は、「カスタム保持語」に1行につき1語を入力できます。
- 重み付けアルゴリズムを設定:
- 語頻度統計:語句の出現回数、文書カバー数、キーワード密度を集計します。
- TF-IDF重み:語頻度と逆文書頻度に基づいて、語句の識別力を評価します。
- BM25重み:語頻度、文書頻度、文書長を組み合わせて関連性スコアを計算します。
- フィルターオプションを調整:ストップワードフィルター、数字の保持、英字の大文字小文字の区別を有効にでき、表示結果数とデフォルトの並び替え方法も設定できます。
- 設定を保存:「設定を保存」をクリックするとよく使うパラメータが保存され、次回ツールを開いたときに自動で復元されます。再設定が必要な場合は「デフォルトに戻す」をクリックできます。
- 分析を開始:「分析を開始」ページに移動後、「分析を開始して次へ」をクリックすると、ツールがテキストを読み込み、分かち書き、語頻度の集計、重み計算を行います。
- 結果を表示・ダウンロード:分析完了後、結果表でキーワードを検索し、現在のCSV結果をダウンロードできます。一括ファイルの場合はZIP圧縮ファイルをダウンロードでき、単一文書レポートは元のファイル名でエクスポートされます。同名ファイルは数字が自動で付与されて区別されます。
よくある質問
A:TF-IDFは、文書群の中からテーマをより区別しやすい語を見つけるのに適しています。ある語が現在の文書で多く出現し、他の文書では少ない場合、通常は高いTF-IDF値になります。
A:BM25は、情報検索の場面でよく使われる関連性の計算方法と考えられます。語頻度と逆文書頻度を基に、語頻度の飽和と文書長の正規化を加えるため、長さの異なる文書間でキーワードの重みを比較するのにより適しています。
回答:一般的な中国語コンテンツでは2〜3文字に設定できます。テキスト内に業界用語、製品名、ロングテールキーワードが多い場合は2〜4文字に設定し、重要な語句をカスタム保持語に追加してください。
回答:ストップワードは通常、「的、了、在、我们、可以」など、出現頻度は高いものの情報量が少ない語です。除外すると、結果表にテーマ語、ビジネス用語、キーワードの手がかりが表示されやすくなります。
回答:ZIP圧縮ファイルには、コーパス全体の集計表と単一ドキュメントのレポートが含まれます。単一ドキュメントのレポートはできるだけ元のファイル名を維持します。例:「文档A.csv」。同名ファイルがある場合は、「文档A_1.csv」「文档A_2.csv」などの名前が自動生成されます。
回答:キーワード密度は、現在の集計範囲内で特定の語が出現する割合を示します。密度が高いほどその語が頻繁に出現していることを意味しますが、一般的な語をテーマ語と誤認しないよう、TF-IDF、BM25、ドキュメントカバー率とあわせて判断する必要があります。