Narzędzie do masowej konwersji wideo i audio na tekst
Wsadowo rozpoznawaj offline pliki wideo i audio jako tekst i jednym kliknięciem eksportuj do wielu formatów napisów i tekstu: TXT, SRT, VTT, JSON, LRC, CSV.
Ładowanie narzędzia, czekaj...
Jeśli narzędzie online nie ładuje się lub nie działa, wypróbuj narzędzie desktopowe. https://tools.yikeaigc.com/
Użycie narzędzia
Wróć do starej wersjiNarzędzie do masowej transkrypcji wideo i audio(wersja programu)
Ponieważ ładowanie modelu rozpoznawania mowy offline oraz dekodowanie audio/wideo wymaga dużych zasobów obliczeniowych, dla stabilniejszego i wydajniejszego działania ta funkcja jest dostępna tylko w kliencie desktopowym dla Windows.
Instrukcje
Instrukcja obsługi oprogramowania
- Dodaj pliki do rozpoznania: kliknij przycisk „Wybierz plik” lub „Wybierz folder”, aby dodać pliki wideo lub audio do konwersji na tekst. Możesz też przeciągnąć pliki lub foldery bezpośrednio do okna programu. Obsługiwane jest zbiorcze dodawanie popularnych formatów audio i wideo, takich jak MP4, MKV, MOV, AVI, FLV, WebM, MP3, WAV, FLAC, M4A.
- Ustaw katalog zapisu: wybierz miejsce zapisu przetworzonych napisów i tekstów; obsługiwane jest także ustawianie przez przeciąganie. Jeśli zaznaczysz „Przeszukuj podkatalogi”, możesz dodatkowo zaznaczyć „Zachowaj oryginalną strukturę ścieżek”, a pliki wyjściowe będą odpowiadać strukturze katalogów folderu źródłowego.
- Wybierz format wyjściowy:
- TXT: zwykły tekst, odpowiedni do opracowywania dokumentów i protokołów spotkań
- SRT / VTT: format napisów ze znacznikami czasu, który można bezpośrednio podłączyć do wideo
- JSON: dane strukturalne, wygodne do dalszego programowania i przetwarzania
- LRC: format tekstów piosenek, odpowiedni do muzyki i audiobooków
- CSV: format tabelaryczny, ułatwiający edycję i korektę w Excelu
- Skonfiguruj parametry rozpoznawania:
- Ścieżka modelu: domyślnie używany jest chiński model rozpoznawania Paraformer, wykrywanie aktywności mowy FSMN oraz model interpunkcji CT
- Czas przetwarzania wsadowego: ustaw maksymalną długość audio dla pojedynczego wnioskowania
- Maksymalna długość pojedynczego segmentu VAD w milisekundach: kontroluje szczegółowość podziału segmentów mowy
- Lista słów kluczowych: wpisz nazwy własne, imiona i nazwiska oraz nazwy marek, aby zwiększyć dokładność rozpoznawania
- Strategia pomijania/nadpisywania: wybierz pomijanie lub nadpisywanie istniejących plików wyjściowych
- Rozpocznij rozpoznawanie wsadowe: kliknij przycisk „Rozpocznij rozpoznawanie”, a program automatycznie wyodrębni ścieżkę audio, podzieli mowę na segmenty, wykona transkrypcję i doda interpunkcję. Podczas przetwarzania możesz śledzić postęp w obszarze dziennika; aby przerwać, kliknij przycisk „Zatrzymaj”.
- Wyświetl i użyj wyników: po zakończeniu rozpoznawania przejdź do ustawionego katalogu zapisu, aby wyświetlić pliki w odpowiednim formacie. Napisy SRT/VTT można bezpośrednio przeciągnąć do programu do montażu lub odtwarzacza.
Często zadawane pytania
Powiązane narzędzia
Narzędzie do odwracania i obracania wideo
Obsługuje wsadowe odbijanie filmów w poziomie i pionie or...
Narzędzie do usuwania cichych fragmentów wideo
Inteligentnie usuwa ciche fragmenty ze ścieżki audio wide...
Narzędzie do masowego pobierania filmów z Pexels
Oprogramowanie do masowego pobierania filmów z Pexels zap...
Narzędzie do eksportu raportów parametrów wideo i audio
Odczytuje parametry audio i wideo, takie jak kodek, szybk...
Narzędzie do dodawania okładek MP4
Masowe dodawanie obrazów okładki do filmów MP4, z obsługą...
Narzędzie do wsadowego łączenia filmów w trybie obraz w obrazie
Automatycznie paruje główne wideo i materiały do obrazu w...
Narzędzie do zmiany prędkości wideo
Dostosuj prędkość odtwarzania wideo online, obsługa regul...
Narzędzie do wsadowej renowacji starych filmów
To narzędzie obsługuje zbiorczą poprawę jakości wideo, of...
Narzędzie do masowego maskowania czasu trwania wideo
Masowo modyfikuj informacje o czasie trwania w metadanych...