ツールを読み込み中です。お待ちください...
ツールを読み込み中です。お待ちください...
オンラインツールを読み込めない、または実行できない場合は、デスクトップツールをお試しください。 https://tools.yikeaigc.com/
ツール使用状況
旧バージョンに戻す
より強力で安定した機能を備えたデスクトップ版があります。
デスクトップ版を開く
Windows 10/11 のみ対応
動画・音声一括文字起こしツール(ソフト版)
オフライン音声認識モデルの読み込みと動画・音声のデコードには多くの計算リソースが必要です。より安定した効率的な処理体験を提供するため、この機能は Windows デスクトップ版のみで提供されます。
動画・音声を一括認識、主要形式に幅広く対応
TXT、SRT、VTT、JSON、LRC、CSV をワンクリック出力
オフラインでローカル認識、ファイルをアップロードせずプライバシー保護
クリックするとソフトのダウンロードページへ移動します
手順
ソフトウェアの使用方法
- 認識対象ファイルの追加:「ファイルを選択」または「フォルダーを選択」ボタンをクリックして、文字起こししたい動画または音声ファイルを追加します。ファイルやフォルダーをソフトウェアのウィンドウに直接ドラッグすることもできます。MP4、MKV、MOV、AVI、FLV、WebM、MP3、WAV、FLAC、M4Aなど、一般的な動画・音声形式をまとめて混在追加できます。
- 保存先ディレクトリの設定:処理後の字幕とテキストの保存場所を選択します。ドラッグ&ドロップでの設定にも対応しています。「サブディレクトリを走査」にチェックを入れると、続けて「元のパス構造を保持」にチェックを入れることができ、出力ファイルは元フォルダーのディレクトリ構造に対応して保存されます。
- 出力形式の選択:
- TXT:プレーンテキスト。原稿整理や議事録作成に適しています
- SRT / VTT:タイムスタンプ付きの字幕形式。動画に直接読み込んで使用できます
- JSON:構造化データ。二次開発やプログラム処理に便利です
- LRC:歌詞形式。音楽やオーディオブックに適しています
- CSV:表形式。Excelでの編集や校正に便利です
- 認識パラメータの設定:
- モデルパス:デフォルトでParaformer中国語認識モデル、FSMN音声活動検出、CT句読点モデルを使用します
- バッチ処理時間:1回の推論で処理する最長音声時間を設定します
- VAD単一セグメント最大ミリ秒:音声セグメント分割の粒度を制御します
- ホットワードリスト:固有名詞、人名、ブランド名を入力して、認識精度を向上させます
- スキップ/上書きポリシー:既存の出力ファイルに対してスキップまたは上書きを選択します
- 一括認識の開始:「認識開始」ボタンをクリックすると、ソフトウェアが音声トラックの抽出、音声セグメントの分割、推論による文字起こし、句読点の付与を自動で行います。処理中はログエリアで進捗を確認でき、中止する場合は「停止」ボタンをクリックします。
- 結果の確認と利用:認識完了後、設定した保存先ディレクトリで対応形式のファイルを確認します。SRT/VTT字幕は編集ソフトやプレーヤーに直接ドラッグして使用できます。
よくある質問
A:動画はMP4、MKV、MOV、AVI、FLV、WMV、WebM、M4V、MPG、TS、3GP、RMVBなどに対応しています。音声はMP3、WAV、FLAC、AAC、OGG、M4A、WMA、OPUS、AC3、AMR、APEなどに対応しています。同じバッチ内で動画と音声ファイルを混在して追加でき、ソフトウェアが自動で識別して音声トラックを抽出します。
A:ソフトウェアはローカルのオフライン認識を採用しており、全工程でインターネット接続は不要です。モデルファイルはプログラムのルートディレクトリにあるmodelsフォルダーに配置されています。FunASRベースのParaformer中国語モデルにより、標準中国語の認識精度は高く、ホットワードリストを併用することで固有名詞、人名、専門用語の認識効果をさらに向上できます。
回答:TXTは原稿整理や執筆素材に適しています。SRTとVTTは汎用字幕形式で、動画やWebプレーヤーに読み込めます。JSONには完全なタイムスタンプとセグメント情報が含まれ、二次開発に便利です。LRCは音楽やオーディオブックに適しています。CSVはExcelで時間帯ごとに校正・編集するのに便利です。複数の形式にチェックを入れて同時にエクスポートできます。
回答:ホットワード入力欄に、認識ミスが起きやすい固有名詞(人名、会社名、製品名、技術用語など)を入力します。複数の単語はスペースまたは改行で区切ります。認識エンジンはこれらの単語を優先的に照合するため、専門業界のコンテンツ、個人メディアの口述、企業研修などの場面で効果が比較的はっきり現れます。
回答:「サブディレクトリを走査」にチェックを入れると、このオプションが使用可能になります。有効にすると、出力ファイルは元フォルダ内のディレクトリ階層に従って対応するサブディレクトリに生成され、大量の素材をアーカイブ管理しやすくなります。重複するファイル名がある場合は、ファイル名の末尾に数字が自動的に追加されて区別されます。
回答:ソフトウェアにはVAD音声活動検出が内蔵されており、まず無音区間に基づいて長い音声を自動分割し、その後「バッチ処理時間」パラメータに従って分割したセグメントを認識モデルに送ります。理論上、数時間の長い動画でも完全に処理できます。認識速度はPCのCPU性能に関係するため、大量の素材を処理する際は、負荷の高い他のプログラムを終了することをおすすめします。
回答:デフォルトモデルは中国語Paraformerで、普通話および中国語と英語が混在する内容には比較的良好に対応しています。一方、広東語、四川方言、閩南語などの方言認識精度は相対的に一般的です。素材が方言中心の場合は、先に発音の傾向を調整するか、デフォルトパスをより適したモデルに置き換えることをおすすめします。
回答:ソフトウェアではデフォルトでCT-Punc句読点モデルが有効になっており、認識結果にカンマ、句点、疑問符などの句読点を自動で追加します。句読点が表示されない場合は、パラメータ内の句読点モデルパスがmodelsフォルダ内のct-puncディレクトリを正しく指しているか確認し、モデルファイルが完全であることを確認してください。