텍스트 파일명 유사도 필터링 도구
파일명 유사도를 기준으로 TXT/HTML 파일을 그룹화하고, 글자 수와 문장 수 등 콘텐츠 지표에 따라 각 그룹에서 이상적인 파일을 자동으로 보존하여 효율적으로 중복을 제거합니다.
브라우저 실행 모드: 데이터는 브라우저에서 처리되며 서버에 업로드되지 않습니다.
속도와 안정성: 처리 속도는 기기와 브라우저에 따라 달라집니다. 대량 배치 작업에는 데스크톱 버전이 더 안정적일 수 있습니다.
도구를 불러오는 중입니다. 잠시 기다려 주세요...
도구를 불러오는 중입니다. 잠시 기다려 주세요...
온라인 도구가 로드되거나 실행되지 않으면 데스크톱 도구를 사용해 보세요. https://tools.yikeaigc.com/
도구 사용량
이전 버전으로 돌아가기
처리 안내:시작 전 ‘필터 설정’에서 유사도 임계값, 알고리즘, 보존 규칙을 확인하세요. 파일은 현재 페이지에서만 읽고 압축하며 서버에 업로드하지 않습니다.
1텍스트 파일 선택
클릭해 선택하거나 TXT / HTML 파일을 여기로 드래그
일괄 선택 지원, 화면에는 처음 20개만 미리보기하며 필터링 시 전체 파일을 처리합니다
2예시 데이터
선택한 파일
0
전체 크기
0 KB
텍스트 유형
0
미리보기 수
0
3파일 미리보기
아직 파일을 선택하지 않았습니다. 먼저 예시 데이터를 불러와 설정 효과를 확인한 후 내 파일을 처리할 수 있습니다.
| 번호 | 파일명 | 유형 | 크기 | 수정 시간 |
|---|
1그룹 규칙
76%
값이 높을수록 파일명이 더 비슷해야 같은 그룹에 들어갑니다.
종합 알고리즘은 한국어, 영어, 번호가 있는 혼합 파일명에 적합합니다.
링크 그룹은 더 유연하고, 대표 파일 그룹은 더 안정적입니다.
2보존 규칙
지표는 유사 그룹 내부에서만 비교되며 원본 파일은 변경하지 않습니다.
보존 기준 점수가 같을 때 사용합니다.
읽은 후 본문이 비어 있는 자리표시자 파일 제외에 적합합니다.
3읽기 및 정규화
자동 감지는 BOM과 일반 중국어 인코딩을 우선 읽습니다.
비워 두면 기본 파일명을 사용합니다.
페이지 표시만 영향, 패키징 결과에는 영향 없음.
1진행률 및 결과
처리 대기 중. 먼저 파일을 선택하고 매개변수를 설정하세요.
0%
처리 완료 후 여기에 그룹, 보관 파일, 필터링 파일, 다운로드 버튼이 표시됩니다.
참여 파일
0
유사 그룹
0
보관 파일
0
필터링 파일
0
소요 시간
0s
2유사 그룹 미리보기
아직 그룹 결과가 없습니다.
| 그룹 번호 | 보관 파일 | 그룹 내 수 | 평균 유사도 | 보존 기준 |
|---|
3필터링 파일 미리보기
필터링된 파일이 없습니다.
| 파일명 | 그룹 번호 | 상태 |
|---|
4처리 로그
시작 대기 중.