Công cụ chuyển đổi hàng loạt video và âm thanh thành văn bản
Nhận dạng hàng loạt tệp video và âm thanh thành văn bản ngoại tuyến, xuất chỉ với một cú nhấp chuột sang nhiều định dạng phụ đề và văn bản như TXT, SRT, VTT, JSON, LRC, CSV.
Đang tải công cụ, vui lòng chờ...
Nếu công cụ trực tuyến không tải hoặc chạy được, hãy thử công cụ máy tính. https://tools.yikeaigc.com/
Mức sử dụng công cụ
Quay lại phiên bản cũCông cụ chuyển video/âm thanh sang văn bản hàng loạt(bản phần mềm)
Do mô hình nhận dạng giọng nói ngoại tuyến và giải mã âm thanh/video cần nhiều tài nguyên tính toán, để mang lại trải nghiệm xử lý ổn định và hiệu quả hơn, tính năng này chỉ có trên ứng dụng desktop Windows.
Hướng dẫn
Hướng dẫn sử dụng phần mềm
- Thêm tệp cần nhận dạng:Nhấp vào nút "Chọn tệp" hoặc "Chọn thư mục" để thêm tệp video hoặc âm thanh cần chuyển thành văn bản; cũng có thể kéo trực tiếp tệp hoặc thư mục vào cửa sổ phần mềm. Hỗ trợ thêm hàng loạt lẫn lộn các định dạng âm thanh/video phổ biến như MP4, MKV, MOV, AVI, FLV, WebM, MP3, WAV, FLAC, M4A.
- Thiết lập thư mục lưu:Chọn vị trí lưu phụ đề và văn bản sau khi xử lý, hỗ trợ thiết lập bằng cách kéo thả. Nếu chọn "Duyệt thư mục con", có thể tiếp tục chọn "Giữ nguyên cấu trúc đường dẫn gốc", các tệp xuất ra sẽ tương ứng với cấu trúc thư mục của thư mục nguồn.
- Chọn định dạng đầu ra:
- TXT:Văn bản thuần, phù hợp để整理 biên bản và ghi chú cuộc họp
- SRT / VTT:Định dạng phụ đề có dấu thời gian, có thể gắn trực tiếp vào video để sử dụng
- JSON:Dữ liệu có cấu trúc, thuận tiện cho phát triển thứ cấp và xử lý bằng chương trình
- LRC:Định dạng lời bài hát, phù hợp cho nhạc và sách nói
- CSV:Định dạng bảng, thuận tiện chỉnh sửa và hiệu đính trong Excel
- Cấu hình tham số nhận dạng:
- Đường dẫn mô hình:Mặc định sử dụng mô hình nhận dạng tiếng Trung Paraformer, phát hiện hoạt động giọng nói FSMN và mô hình dấu câu CT
- Thời lượng xử lý hàng loạt:Thiết lập thời lượng âm thanh tối đa cho một lần suy luận
- Số mili giây tối đa cho một đoạn VAD:Kiểm soát độ chi tiết khi chia đoạn giọng nói
- Danh sách từ nóng:Nhập danh từ riêng, tên người, từ thương hiệu để nâng cao độ chính xác nhận dạng
- Chiến lược bỏ qua/ghi đè:Chọn bỏ qua hoặc ghi đè đối với tệp đầu ra đã tồn tại
- Bắt đầu nhận dạng hàng loạt:Nhấp vào nút "Bắt đầu nhận dạng", phần mềm sẽ tự động trích xuất track âm thanh, chia đoạn giọng nói, suy luận chuyển biên và thêm dấu câu. Trong quá trình xử lý, có thể xem tiến độ tại khu vực nhật ký; khi cần dừng, nhấp vào nút "Dừng".
- Xem và sử dụng kết quả:Sau khi nhận dạng hoàn tất, vào thư mục lưu đã thiết lập để xem các tệp định dạng tương ứng; phụ đề SRT/VTT có thể kéo trực tiếp vào phần mềm dựng phim hoặc trình phát để sử dụng.
Câu hỏi thường gặp
Công cụ liên quan
Công cụ cắt đầu và cuối video hàng loạt
Loại bỏ hàng loạt khoảng thời gian chỉ định ở đầu và cuối...
Công cụ điều chỉnh âm lượng video hàng loạt
Điều chỉnh hàng loạt âm lượng video và âm thanh, hỗ trợ t...
Công cụ ngụy trang thời lượng video hàng loạt
Chỉnh sửa hàng loạt thông tin thời lượng trong metadata v...
Công cụ xóa viền đen video hàng loạt
Tự động phát hiện vùng viền đen trên, dưới, trái, phải củ...
Công cụ ghép video hình trong hình hàng loạt
Tự động ghép cặp video chính và tư liệu hình trong hình t...
Trình chuyển đổi video sang GIF
Chuyển đổi video thành ảnh động GIF, hỗ trợ xử lý đơn lẻ ...
Công cụ đóng gói hàng loạt phụ đề mềm
Đóng gói hàng loạt phụ đề SRT, ASS và các định dạng khác ...
Công cụ thêm dấu thời gian động hàng loạt vào video
Thêm hàng loạt watermark dấu thời gian tăng dần động vào ...
Trình tạo phụ đề cuộn và hoạt ảnh cuộn hình ảnh
Tạo hoạt ảnh cuộn cho văn bản hoặc hình ảnh, hỗ trợ xem t...
Phát hiện từ cấm hàng loạt trong video và âm thanh
Nhận dạng hàng loạt nội dung âm thanh và video cục bộ, tự...