テキストファイル名類似度フィルタリングツール
ファイル名の類似度に基づいてTXT/HTMLファイルをグループ化し、文字数や文数などのコンテンツ指標に基づいて各グループ内の最適なファイルを自動的に保持し、効率的な重複排除を実現します。
ブラウザ実行モード: データはブラウザ内で処理され、サーバーにはアップロードされません。
速度と安定性: 処理速度はデバイスとブラウザに依存します。大量のバッチ作業では、デスクトップ版の方が安定する場合があります。
ツールを読み込み中です。お待ちください...
ツールを読み込み中です。お待ちください...
オンラインツールを読み込めない、または実行できない場合は、デスクトップツールをお試しください。 https://tools.yikeaigc.com/
ツール使用状況
旧バージョンに戻す
処理ヒント:開始前に「絞り込み設定」で類似度しきい値、アルゴリズム、保持ルールを確認してください。ファイルはこのページ内でのみ読み込み・圧縮され、サーバーへはアップロードされません。
1テキストファイルを選択
クリックして選択、または TXT / HTML ファイルをここにドラッグ
一括選択に対応。画面では先頭20件のみ表示し、絞り込み時は全ファイルを処理します
2サンプルデータ
選択済みファイル
0
合計サイズ
0 KB
テキスト種類
0
プレビュー可能数
0
3ファイルプレビュー
まだファイルが選択されていません。先にサンプルデータを読み込み、設定効果を確認してから自分のファイルを処理できます。
| 番号 | ファイル名 | 種類 | サイズ | 更新日時 |
|---|
1グループ化ルール
76%
数値が高いほど、ファイル名が近い場合のみ同じグループになります。
総合アルゴリズムは、日本語・英語・番号付きの混在ファイル名に適しています。
リンクグループ化は緩め、代表ファイルグループ化はより安定です。
2保持ルール
指標は類似グループ内でのみ比較され、元ファイルは変更されません。
保持基準のスコアが同じ場合に使用します。
読み取り後の本文が空のプレースホルダーファイルの除外に適しています。
3読み込みと正規化
自動検出は BOM と一般的な中国語エンコードを優先して読み取ります。
空欄の場合は既定のファイル名を使用します。
ページ表示のみ影響し、パッケージ結果には影響しません。
1進行状況と結果
処理待ちです。先にファイルを選択し、パラメータを設定してください。
0%
処理完了後、ここにグループ、保持ファイル、除外ファイル、ダウンロードボタンが表示されます。
対象ファイル
0
類似グループ
0
保持ファイル
0
除外ファイル
0
所要時間
0s
2類似グループプレビュー
グループ結果はありません。
| グループ番号 | 保持ファイル | グループ内数 | 平均類似度 | 保持基準 |
|---|
3絞り込みファイルのプレビュー
絞り込みファイルはありません。
| ファイル名 | グループ番号 | 状態 |
|---|
4処理ログ
開始待ちです。