브라우저 실행 모드: 데이터는 브라우저에서 처리되며 서버에 업로드되지 않습니다.
속도와 안정성: 처리 속도는 기기와 브라우저에 따라 달라집니다. 대량 배치 작업에는 데스크톱 버전이 더 안정적일 수 있습니다.
도구를 불러오는 중입니다. 잠시 기다려 주세요...
도구를 불러오는 중입니다. 잠시 기다려 주세요...
온라인 도구가 로드되거나 실행되지 않으면 데스크톱 도구를 사용해 보세요. https://tools.yikeaigc.com/
도구 사용량
이전 버전으로 돌아가기
더 강력하고 안정적인 기능의 데스크톱 버전이 제공됩니다.
데스크톱 버전 열기
먼저 텍스트를 선택하고 분석 매개변수를 설정한 뒤 처리를 시작하세요. 빠르게 체험하려면 예시 데이터를 불러오세요. 일괄 파일은 처음 20개만 표시되지만 분석 시 모두 처리됩니다.
1입력 방식 선택
2텍스트 파일 추가
클릭해 파일을 선택하거나 여기로 드래그하세요
TXT, TEXT, MD, CSV, SRT, LOG 지원. 파일 내용은 브라우저에서 읽고 분석됩니다.
2텍스트 붙여넣기
아직 텍스트가 입력되지 않았습니다.
2예시 불러오기
예시 데이터가 현재 선택 내용을 대체합니다.
3선택한 내용 상태
문서 수0
예상 크기0 KB
텍스트 선택 대기 중
먼저 TXT 파일을 추가하거나 텍스트를 붙여넣거나 예시 데이터를 불러오세요.
분석할 텍스트가 아직 추가되지 않았습니다.
1분절 규칙
2가중치 알고리즘
3BM25 매개변수
일반 값: K1 약 1.2-2.0, B 약 0.75. 값은 BM25 점수 순위에 영향을 줍니다.
4필터 및 정렬
5사용자 지정 단어장
1작업 확인
분석 대기 중
파일과 매개변수를 확인한 후 분석을 시작하세요. 처리 중에는 페이지를 열어 두세요.
2처리 진행률
진행률 0%
시작 대기 중...
아직 분석 결과가 없습니다. 먼저 이전 단계를 완료하고 분석을 시작하세요.
| 순위 | 단어 | 범위 | 단어 빈도 | 문서 수 | 커버리지 | 밀도 | TF-IDF | BM25 | 첫 위치 |
|---|
안내
소프트웨어 사용 설명
- 텍스트 내용 선택: “파일 선택”을 클릭해 TXT, MD, CSV, SRT, LOG 등의 텍스트 파일을 일괄 가져오거나, “텍스트 붙여넣기”로 전환해 내용을 직접 입력할 수 있습니다. 흐름을 체험하려면 예시 데이터를 불러올 수 있습니다.
- 파일 목록 확인: 파일을 일괄 선택하면 화면에 처음 20개 파일이 표시되고, 나머지 파일은 개수로 안내됩니다. 실제 분석 시에는 모든 파일이 처리에 참여합니다.
- 분절 규칙 설정: 중국어 단어 분리 방식, 단어 길이 하한, 중국어 조합어 길이를 선택합니다. 고정된 업계 용어가 있는 경우 “사용자 지정 보존어”에 한 줄에 하나씩 입력할 수 있습니다.
- 가중치 알고리즘 구성:
- 단어 빈도 통계: 단어의 출현 횟수, 문서 포함 수, 키워드 밀도를 집계합니다.
- TF-IDF 가중치: 단어 빈도와 역문서 빈도를 기반으로 단어의 구분도를 평가합니다.
- BM25 가중치: 단어 빈도, 문서 빈도, 문서 길이를 결합해 관련성 점수를 계산합니다.
- 필터 옵션 조정: 불용어 필터링, 숫자 보존, 영어 대소문자 구분을 활성화하고, 표시할 결과 수와 기본 정렬 방식을 설정할 수 있습니다.
- 설정 저장: “설정 저장”을 클릭하면 자주 쓰는 매개변수가 보존되며, 다음에 도구를 열 때 자동으로 복원됩니다. 다시 구성해야 할 경우 “기본값 복원”을 클릭할 수 있습니다.
- 분석 시작: “분석 시작” 페이지로 이동한 뒤 “분석 시작 및 다음 단계”를 클릭하면 도구가 텍스트를 읽고, 단어를 분리하고, 단어 빈도를 집계한 뒤 가중치를 계산합니다.
- 결과 확인 및 다운로드: 분석 완료 후 결과 표에서 키워드를 검색하고 현재 CSV 결과를 다운로드할 수 있습니다. 일괄 파일은 ZIP 압축 파일로 다운로드할 수 있으며, 단일 문서 보고서는 원본 파일명으로 내보내지고, 이름이 같은 파일은 자동으로 숫자가 추가되어 구분됩니다.
자주 묻는 질문
답변: TF-IDF는 문서 집합에서 주제를 더 잘 구분하는 단어를 찾아내는 데 적합합니다. 어떤 단어가 현재 문서에는 많이 나타나지만 다른 문서에는 적게 나타날 때 일반적으로 더 높은 TF-IDF 값을 얻습니다.
답변: BM25는 정보 검색 분야에서 자주 사용되는 관련성 계산 방식으로 볼 수 있습니다. 단어 빈도와 역문서 빈도를 기반으로 단어 빈도 포화와 문서 길이 정규화를 더해, 길이가 다른 문서의 키워드 가중치를 비교하는 데 더 적합합니다.
답변: 일반적인 중국어 콘텐츠는 2~3자로 설정할 수 있습니다. 텍스트에 업계 용어, 제품명 또는 롱테일 키워드가 많다면 2~4자로 설정하고, 중요한 단어를 사용자 지정 보존어에 추가하세요.
답변: 불용어는 일반적으로 “的、了、在、我们、可以”처럼 빈도는 높지만 정보량이 낮은 단어입니다. 필터링 후에는 결과 표에서 주제어, 비즈니스 용어, 키워드 단서를 더 쉽게 확인할 수 있습니다.
답변: ZIP 압축 파일에는 말뭉치 전체 표와 개별 문서 보고서가 포함됩니다. 개별 문서 보고서는 가능한 한 원래 파일명을 유지합니다(예: “文档A.csv”). 같은 이름이 있으면 “文档A_1.csv”, “文档A_2.csv”와 같은 이름이 자동으로 생성됩니다.
답변: 키워드 밀도는 현재 통계 범위에서 특정 단어가 나타나는 비율을 의미합니다. 밀도가 높다는 것은 해당 단어가 자주 등장한다는 뜻이지만, 일반적인 단어를 주제어로 잘못 판단하지 않도록 TF-IDF, BM25, 문서 커버리지와 함께 판단해야 합니다.