대량 비디오·오디오 텍스트 변환 도구
동영상 및 오디오 파일을 오프라인에서 일괄적으로 텍스트로 인식하고, 클릭 한 번으로 TXT, SRT, VTT, JSON, LRC, CSV 등 다양한 자막 및 텍스트 형식으로 내보냅니다.
도구를 불러오는 중입니다. 잠시 기다려 주세요...
도구를 불러오는 중입니다. 잠시 기다려 주세요...
온라인 도구가 로드되거나 실행되지 않으면 데스크톱 도구를 사용해 보세요. https://tools.yikeaigc.com/
도구 사용량
이전 버전으로 돌아가기
더 강력하고 안정적인 기능의 데스크톱 버전이 제공됩니다.
데스크톱 버전 열기
Windows 10/11만 지원
대량 비디오·오디오 텍스트 변환 도구(소프트웨어 버전)
오프라인 음성 인식 모델 로드와 비디오·오디오 디코딩에는 많은 컴퓨팅 리소스가 필요합니다. 더 안정적이고 효율적인 처리 경험을 위해 이 기능은 Windows 데스크톱 클라이언트 버전에서만 제공됩니다.
비디오와 오디오 대량 인식 지원, 다양한 주요 형식 지원
TXT, SRT, VTT, JSON, LRC, CSV 원클릭 내보내기
오프라인 로컬 인식, 파일 업로드 없음, 개인정보 보호
클릭하면 소프트웨어 다운로드 페이지로 이동합니다
안내
소프트웨어 사용 설명
- 인식할 파일 추가: "파일 선택" 또는 "폴더 선택" 버튼을 클릭하여 텍스트로 변환할 비디오 또는 오디오 파일을 추가하거나, 파일 및 폴더를 소프트웨어 창으로 직접 끌어다 놓을 수 있습니다. MP4, MKV, MOV, AVI, FLV, WebM, MP3, WAV, FLAC, M4A 등 일반적인 오디오/비디오 형식의 일괄 혼합 추가를 지원합니다.
- 저장 디렉터리 설정: 처리 후 자막과 텍스트를 저장할 위치를 선택하며, 드래그 앤 드롭 설정을 지원합니다. "하위 디렉터리 탐색"을 선택한 경우 "원래 경로 구조 유지"를 계속 선택할 수 있으며, 출력 파일은 원본 폴더의 디렉터리 구조와 일대일로 대응됩니다.
- 출력 형식 선택:
- TXT: 일반 텍스트로, 원고 정리 및 회의록 작성에 적합
- SRT / VTT: 타임스탬프가 포함된 자막 형식으로, 비디오에 바로 삽입하여 사용 가능
- JSON: 구조화된 데이터로, 2차 개발 및 프로그램 처리에 편리
- LRC: 가사 형식으로, 음악 및 오디오북에 적합
- CSV: 표 형식으로, Excel에서 편집 및 교정하기 편리
- 인식 매개변수 구성:
- 모델 경로: 기본적으로 Paraformer 중국어 인식 모델, FSMN 음성 활동 감지 및 CT 구두점 모델을 사용
- 배치 처리 길이: 단일 추론의 최대 오디오 길이를 설정
- VAD 단일 구간 최대 밀리초: 음성 구간 분할의 세분화 정도를 제어
- 핫워드 목록: 고유명사, 인명, 브랜드 용어를 입력하여 인식 정확도 향상
- 건너뛰기/덮어쓰기 전략: 이미 존재하는 출력 파일에 대해 건너뛰기 또는 덮어쓰기를 선택
- 일괄 인식 시작: "인식 시작" 버튼을 클릭하면 소프트웨어가 자동으로 오디오 트랙을 추출하고, 음성 구간을 분할하며, 추론 전사를 수행하고 구두점을 추가합니다. 처리 중에는 로그 영역에서 진행 상황을 확인할 수 있으며, 중지해야 할 경우 "중지" 버튼을 클릭하세요.
- 결과 확인 및 사용: 인식이 완료되면 설정한 저장 디렉터리에서 해당 형식의 파일을 확인할 수 있으며, SRT/VTT 자막은 편집 소프트웨어나 플레이어에 직접 끌어다 놓아 사용할 수 있습니다.
자주 묻는 질문
답변: 비디오는 MP4, MKV, MOV, AVI, FLV, WMV, WebM, M4V, MPG, TS, 3GP, RMVB 등을 지원하며, 오디오는 MP3, WAV, FLAC, AAC, OGG, M4A, WMA, OPUS, AC3, AMR, APE 등을 지원합니다. 같은 배치에 비디오와 오디오 파일을 혼합하여 추가할 수 있으며, 소프트웨어가 자동으로 인식하고 오디오 트랙을 추출합니다.
답변: 소프트웨어는 로컬 오프라인 인식을 사용하므로 전 과정에서 인터넷 연결이 필요하지 않으며, 모델 파일은 프로그램 루트 디렉터리의 models 폴더에 있습니다. FunASR 기반의 Paraformer 중국어 모델을 사용하여 표준 중국어 인식 정확도가 높으며, 핫워드 목록과 함께 사용하면 고유명사, 인명, 전문 용어의 인식 효과를 더욱 높일 수 있습니다.
답변: TXT는 원고 정리와 글쓰기 자료에 적합합니다. SRT와 VTT는 범용 자막 형식으로, 동영상 및 웹 플레이어에 연결할 수 있습니다. JSON은 전체 타임스탬프와 세그먼트 정보를 포함해 2차 개발에 편리합니다. LRC는 음악과 오디오북에 적합합니다. CSV는 Excel에서 시간 구간별로 교정하고 편집하기에 편리합니다. 여러 형식을 선택해 동시에 내보낼 수 있습니다.
답변: 핫워드 입력란에 인식 오류가 발생하기 쉬운 고유명사(예: 인명, 회사명, 제품명, 기술 용어 등)를 입력하고, 여러 단어는 공백이나 줄바꿈으로 구분합니다. 인식 엔진은 이러한 단어를 우선적으로 매칭하므로, 전문 산업 콘텐츠, 1인 미디어 구술, 기업 교육 등의 상황에서 효과가 더 뚜렷합니다.
답변: "하위 디렉터리 순회"를 선택한 후 이 옵션을 사용할 수 있습니다. 활성화하면 출력 파일이 원본 폴더 내 디렉터리 계층 구조에 따라 해당 하위 디렉터리에 생성되어, 대량의 자료를 보관하고 관리하기 편리합니다. 중복 파일명이 있는 경우 파일명 뒤에 숫자를 자동으로 추가해 구분합니다.
답변: 소프트웨어에는 VAD 음성 활동 감지 기능이 내장되어 있어, 먼저 무음 구간을 기준으로 긴 오디오를 자동 분할한 뒤 "일괄 처리 시간" 매개변수에 따라 구간별로 인식 모델에 전달합니다. 이론적으로 몇 시간 분량의 긴 동영상도 완전하게 처리할 수 있습니다. 인식 속도는 컴퓨터 CPU 성능과 관련이 있으며, 대량의 자료를 처리할 때는 리소스 사용량이 높은 다른 프로그램을 닫는 것이 좋습니다.
답: 기본 모델은 중국어 Paraformer로, 표준 중국어와 중국어·영어 혼합 콘텐츠를 비교적 잘 지원합니다. 광둥어, 쓰촨 방언, 민난어 등 방언 인식 성능은 상대적으로 일반적인 수준입니다. 자료가 주로 방언으로 구성되어 있다면 먼저 발음 습관을 조정하거나 기본 경로를 더 적합한 모델로 교체하는 것을 권장합니다.
답: 소프트웨어는 기본적으로 CT-Punc 문장부호 모델을 활성화하여 인식 결과에 쉼표, 마침표, 물음표 등의 문장부호를 자동으로 추가합니다. 문장부호가 없다면 매개변수의 문장부호 모델 경로가 models 폴더 아래의 ct-punc 디렉터리를 올바르게 가리키는지 확인하고, 모델 파일이 완전한지 확인하세요.