도구를 불러오는 중입니다. 잠시 기다려 주세요...
도구를 불러오는 중입니다. 잠시 기다려 주세요...
온라인 도구가 로드되거나 실행되지 않으면 데스크톱 도구를 사용해 보세요. https://tools.yikeaigc.com/
도구 사용량
이전 버전으로 돌아가기지능형 텍스트 유사도 검사기
여러 AI 알고리즘 기반 전문 텍스트 유사도 분석 도구
코사인 유사도
Jaccard 계수
최장 공통 부분 수열
N-gram 매칭
편집 거리
의미 유사도
📄 파일을 여기로 드래그해 업로드
📄 파일을 여기로 드래그해 업로드
🔧 검사 매개변수 설정
📊 검사 결과
텍스트 유사도 분석 중...
안내
소프트웨어 사용 설명
- 텍스트 내용 입력: 왼쪽 "원본 텍스트" 상자에 참고 텍스트를 입력하고, 오른쪽 "비교 텍스트" 상자에 검사할 텍스트를 입력합니다. "파일 선택 업로드" 버튼을 클릭하여 txt 형식의 텍스트 파일을 업로드할 수도 있습니다.
- 검사 알고리즘 선택: 매개변수 설정 패널에서 사용할 유사도 검사 알고리즘을 선택합니다:
- 코사인 유사도: 벡터 공간 모델 기반의 유사도 계산
- Jaccard 계수: 집합의 교집합과 합집합 비율을 이용한 유사도 측정
- 최장 공통 부분 수열: 동적 계획법 알고리즘으로 시퀀스 유사성 계산
- N-gram 매칭: 문자/어휘 조각 기반의 매칭 알고리즘
- 편집 거리: 문자열 편집 작업의 거리 측정
- 의미 유사도: 단어 벡터 기반의 의미 이해 알고리즘
- 검사 매개변수 조정:
- 유사도 임계값: 유사도 판정의 백분율 임계값 설정(0-100%)
- N-gram 길이: N-gram 알고리즘의 문자 조각 길이 설정
- 최소 매칭 길이: 최소 매칭 문자 수 설정
- 무시 옵션: 문장 부호와 대소문자를 무시할지 선택
- 언어 모드: 중국어, 영어 또는 중영 혼합 모드 선택
- 일괄 파일 처리: 여러 txt 파일을 동시에 업로드하여 일괄 검사를 지원하며, 화면에는 처음 20개 파일만 표시되지만 업로드된 모든 파일을 처리합니다.
- 검사 시작: "검사 시작" 버튼을 클릭하면 시스템이 선택한 알고리즘으로 텍스트 유사도 분석을 수행합니다.
- 결과 확인: 검사 완료 후 각 알고리즘의 검사 결과와 시각화 차트를 포함한 상세 유사도 보고서를 확인합니다.
- 결과 내보내기: "결과 내보내기" 버튼을 클릭하여 검사 보고서와 원본 데이터를 ZIP 파일로 압축해 다운로드합니다.
자주 묻는 질문
답변: 각 알고리즘의 계산 원리가 다릅니다. 코사인 유사도는 단어 빈도 분포에, Jaccard 계수는 어휘 중복도에, LCS 알고리즘은 문자 시퀀스에, N-gram은 조각 매칭에, 편집 거리는 문자 수정 비용에, 의미 유사도는 의미 이해에 중점을 둡니다. 여러 알고리즘 결과를 종합하여 판단하는 것을 권장합니다.
답: 임계값 설정 권장 사항: 70% 이상은 매우 유사함을, 50-70%는 중간 정도의 유사함을, 30-50%는 낮은 유사함을, 30% 이하는 기본적으로 유사하지 않음을 의미합니다. 학술 검사는 60-70%, 콘텐츠 독창성 검사는 40-50%로 설정하는 것을 권장합니다.
답: N-gram 길이는 검사 정확도에 영향을 줍니다. 길이 2-3은 문자 수준 유사성 검사에 적합하고, 길이 4-5는 어휘 수준 유사성 검사에 적합하며, 길이 6-8은 구문 수준 유사성 검사에 적합합니다. 중국어 텍스트는 3-4, 영어 텍스트는 4-5 사용을 권장합니다.
답: 아니요. 모든 텍스트 유사도 검사는 사용자의 기기에서 로컬로 완료되며, 텍스트 내용과 파일은 서버에 업로드되지 않아 데이터 개인정보와 보안을 완전히 보호합니다.
답: 현재 TXT 형식의 일반 텍스트 파일을 지원합니다. Word, PDF 등의 형식 문서는 먼저 TXT 형식으로 변환하거나, 텍스트 내용을 입력란에 직접 복사하여 검사하는 것을 권장합니다.
답변: 텍스트 유사도 검사는 계산 리소스를 소모합니다. 권장 사항: 1) 동시에 사용하는 알고리즘 수를 줄이기; 2) 긴 텍스트는 구간별로 나누어 검사하기; 3) 1회 검사 텍스트 길이를 10만 자 이내로 제한하기; 4) 메모리를 점유하는 다른 프로그램을 종료하기.
답변: 내보낸 ZIP 파일에는 相似度检测报告.txt(사람이 읽을 수 있는 상세 보고서)와 检测数据.json(기계가 읽을 수 있는 구조화된 데이터)이 포함됩니다. 보고서에는 각 알고리즘의 유사도 백분율, 평균값, 상세 설명 등의 정보가 포함됩니다.