ツールを読み込み中です。お待ちください...
ツールを読み込み中です。お待ちください...
オンラインツールを読み込めない、または実行できない場合は、デスクトップツールをお試しください。 https://tools.yikeaigc.com/
ツール使用状況
旧バージョンに戻すスマート文章類似度チェッカー
複数のAIアルゴリズムによる専門的な文章類似度分析ツール
コサイン類似度
Jaccard係数
最長共通部分列
N-gramマッチ
編集距離
意味的類似度
📄 ここにファイルをドラッグ
📄 ここにファイルをドラッグ
🔧 検出設定
📊 検出結果
テキスト類似度を分析中...
手順
ソフトウェア使用方法
- テキスト内容の入力:左側の「原文テキスト」欄に参照テキストを入力し、右側の「比較テキスト」欄に検出対象のテキストを入力します。「ファイルを選択してアップロード」ボタンをクリックして、txt形式のテキストファイルをアップロードすることもできます。
- 検出アルゴリズムの選択:パラメータ設定パネルで使用する類似度検出アルゴリズムを選択します:
- コサイン類似度:ベクトル空間モデルに基づく類似度計算
- Jaccard係数:集合の和集合と積集合の比率による類似度指標
- 最長共通部分列:動的計画法で系列の類似性を計算
- N-gramマッチング:文字/語彙の断片に基づくマッチングアルゴリズム
- 編集距離:文字列の編集操作に基づく距離指標
- 意味的類似度:単語ベクトルに基づく意味理解アルゴリズム
- 検出パラメータの調整:
- 類似度しきい値:類似度判定のパーセンテージしきい値(0-100%)を設定します
- N-gram長:N-gramアルゴリズムの文字断片の長さを設定します
- 最小マッチ長:最小一致文字数を設定します
- 無視オプション:句読点や大文字・小文字を無視するかどうかを選択します
- 言語モード:中国語、英語、または中英混在モードを選択します
- ファイルの一括処理:複数のtxtファイルを同時にアップロードして一括検出できます。画面には最初の20個のファイルが表示されますが、アップロードされたすべてのファイルが処理されます。
- 検出開始:「検出開始」ボタンをクリックすると、システムが選択したアルゴリズムでテキストの類似度分析を行います。
- 結果の確認:検出完了後、各アルゴリズムの検出結果や可視化グラフを含む詳細な類似度レポートを確認します。
- 結果のエクスポート:「結果をエクスポート」ボタンをクリックすると、検出レポートと元データをZIPファイルとしてまとめてダウンロードできます。
よくある質問
A:各アルゴリズムは計算原理が異なります。コサイン類似度は単語頻度の分布、Jaccard係数は語彙の重なり度、LCSアルゴリズムは文字列の並び、N-gramは断片の一致、編集距離は文字の修正コスト、意味的類似度は意味理解に注目します。複数のアルゴリズム結果を総合して判断することをおすすめします。
答:しきい値設定の目安:70%以上は高い類似度、50-70%は中程度の類似度、30-50%は低い類似度、30%以下はほぼ類似していないことを示します。学術的な検出では60-70%、コンテンツのオリジナリティ検出では40-50%に設定することをおすすめします。
答:N-gramの長さは検出精度に影響します:長さ2-3は文字レベルの類似性検出に適し、長さ4-5は語彙レベルの類似性検出に適し、長さ6-8はフレーズレベルの類似性検出に適しています。中国語テキストには3-4、英語テキストには4-5の使用をおすすめします。
答:いいえ。すべてのテキスト類似度検出はお使いのデバイス上でローカルに完了し、テキスト内容やファイルがサーバーにアップロードされることはありません。データのプライバシーと安全性を完全に保護します。
答:現在、TXT形式のプレーンテキストファイルに対応しています。Word、PDFなどの形式の文書は、先にTXT形式に変換するか、テキスト内容を入力欄に直接コピーして検出することをおすすめします。
回答:テキスト類似度検出には計算リソースを消費します。推奨事項:1)同時に使用するアルゴリズムの数を減らす;2)長いテキストは分割して検出する;3)1回の検出テキストの長さを10万文字以内に抑える;4)メモリを使用している他のプログラムを終了する。
回答:エクスポートされたZIPファイルには、相似度検出レポート.txt(人間が読める詳細レポート)と検出データ.json(機械可読な構造化データ)が含まれます。レポートには、各アルゴリズムの類似度パーセンテージ、平均値、詳細な説明などの情報が含まれます。