使い方
最終更新:2026年9月
- 1. インストール
- 2. 画面の使い方
- 3. 動画に字幕を焼き込む
- 4. モデルの選び方
- 5. 字幕の自動改行を理解する
- 6. 句読点の補完
- 7. SRT / VTT / ASS / JSON の使い分け
- 8. アンインストール
1. インストール
事前準備:Python
本ツールは Python 3.10〜3.12 の上で動きます。入っていない場合は Python 公式サイト からインストーラーを取得してください。
ステップ 1:展開
ダウンロードした ZIP を、デスクトップやドキュメントなど書き込みできる場所に展開します。 Program Files の中など、書き込み権限のない場所は避けてください。
ステップ 2:セットアップ
展開したフォルダの中の セットアップ.bat をダブルクリックします。
黒い画面が開き、必要な部品が順に導入されます。
- NVIDIA GPU が見つかれば、GPU 版の PyTorch(約 2.5 GB)が入ります
- 見つからなければ CPU 版(約 250 MB)が入ります
- 最後に「モデルを今ダウンロードしますか?」と聞かれます。Enter を押すと約 1.5 GB のモデルを先に取得します(推奨)
回線速度によりますが 10〜40 分ほどかかります。
部品は展開したフォルダの中の .venv に導入され、
システムの設定やレジストリは変更しません。
ステップ 3:起動
起動.bat をダブルクリックします。2 回目以降はこれだけです。
以前の版から更新するとき
新しい ZIP を別のフォルダに展開して、もう一度 セットアップ.bat を実行してください。
AI モデル・FFmpeg・設定はフォルダの外の共通の場所に保存されているので、再ダウンロードは発生せず、設定もそのまま引き継がれます。
新しいほうで動作を確認できたら、古いフォルダは手で削除してください。
2. 画面の使い方
1. 入力ファイル
- ファイル追加:Ctrl キーや Shift キーを押しながらクリックで複数選択できます
- フォルダ追加:フォルダ直下のメディアファイルをまとめて追加します
- ドラッグ&ドロップ:一覧の上に直接放り込めます
登録したファイルは上から順番に処理されます。
2. 出力設定
出力形式は複数同時に選べます。出力先は「元ファイルと同じ場所」か、 任意のフォルダを指定できます。ファイル名は自動生成されます。
会議録画.mp4 → 会議録画.ja.srt
同名のファイルが既にある場合は 会議録画.ja_2.srt のように連番が付き、上書きされません。
出力形式は SRT / VTT / ASS / JSON の 4 種類です。違いは使い分けを参照してください。
3. 動画への焼き込み
「字幕を動画に焼き込む」にチェックを入れると、字幕ファイルとは別に、 字幕を映像に描き込んだ動画を書き出します。詳しくは動画に字幕を焼き込むを参照してください。
4. 認識設定
通常は初期値のままで問題ありません。言語は「自動検出」のままで日本語を正しく判定します。 日本語だと分かっている場合に「日本語」を選ぶと、まれに起きる言語の誤検出を防げます。
5. 進捗
全体と現在のファイルの進み具合が表示され、右側に「残り 約 ○分○秒」の目安が出ます。 焼き込みを有効にした場合は、文字起こしとは別に焼き込みの進み具合も表示されます。 これは音声の総再生時間と実際の処理速度から計算しているため、 処理が進むほど精度が上がります。
3. 動画に字幕を焼き込む
字幕ファイル(SRT など)は、動画とは別のファイルとして扱われます。 動画だけを SNS に上げたり、字幕ファイルに対応していない機器で再生したりすると、字幕は表示されません。 焼き込みは、字幕を映像そのものに描き込んだ動画を作る機能で、どこで再生しても字幕が消えません。
手順
- 入力ファイルに動画を追加する
- 「3. 動画への焼き込み」の「字幕を動画に焼き込む」にチェックを入れる
- スタイルを選ぶ(「見本を見る」で見え方を確認できます)
- 「変換開始」を押す
ファイルごとに文字起こしが終わると、続けて焼き込みが行われます。 元の動画はそのまま残り、字幕を描き込んだ動画が別の名前で作られます。
会議録画.mp4 → 会議録画.ja.srt(字幕ファイル)
→ 会議録画.ja.mp4(字幕を焼き込んだ動画)
元が MKV の動画は MKV のまま、それ以外は MP4 で書き出します。 途中で中止した場合、書きかけの動画は残しません。
スタイルの選び方
| スタイル | 向いている動画 |
|---|---|
| 標準(白文字に黒フチ) | ふつうの横長の動画。迷ったらこれ |
| 大きめ(太字・フチ太め) | スマホで見られる前提の動画。読みやすさを優先したいとき |
| 帯つき(半透明の黒帯) | 空や白い壁など、背景が明るい映像。画面の情報量が多い映像 |
| 縦動画向け(少し上・太字) | 縦長のショート動画。画面下の操作ボタンに隠れない位置に出します |
それぞれの見え方は概要ページの見本で確認できます。
「見本を見る」
追加した動画の 1 コマに、選んだスタイルで見本の字幕を描いて表示します。 見本の画面でスタイルを切り替えながら比べ、「このスタイルを使う」で決定できます。 実際の焼き込みと同じ大きさで描いてから縮小して表示しているので、見本の見え方がそのまま仕上がりになります。
文字の大きさ
文字の大きさは、動画の解像度と「1 行の文字数」から自動で決まります。 一番長い行が画面の横幅に収まる大きさを上限にしているので、縦長の動画でも字幕がはみ出しません。
初回だけ FFmpeg を取得します
焼き込みには、字幕を描く機能を持った FFmpeg というソフトを使います。 初めて焼き込みを実行するときに確認画面が出るので、OK を押すと自動で取得します(約 73 MB、展開後 約 180 MB)。
取得先は GitHub 上の公式ビルドで、置き場所は %LOCALAPPDATA%\johukku\bin です。
メディアダウンローダーやメディアコンバーター・字幕エディターと共通の場所なので、それらを使っている場合は取得は発生しません。
FFmpeg は GPL で提供されているため本ツールには同梱せず、利用者のパソコンが公式ビルドを直接取得する形にしています。
処理時間
焼き込みは映像を作り直すので、文字起こしとは別に時間がかかります。 NVIDIA / Intel / AMD のグラフィック機能が使える場合は自動で使い、 使えない場合は CPU で処理します(10 分の動画で数分程度)。 どちらで処理しているかは、ログの「エンコーダ:」の行で確認できます。
4. モデルの選び方
モデルは「精度」と「速度・必要メモリ」のトレードオフです。 日本語の実用では medium が標準的な選択です。
| モデル | ダウンロード | 必要 VRAM | 向いている用途 |
|---|---|---|---|
| tiny | 約 75 MB | 約 1 GB | 動作確認用。日本語の実用は厳しい |
| base | 約 145 MB | 約 1 GB | 短い英語音声など |
| small | 約 480 MB | 約 2 GB | CPU のみで動かす場合の推奨 |
| medium | 約 1.5 GB | 約 5 GB | 標準。GPU があるならこれ |
| large-v3 | 約 3.1 GB | 約 10 GB | 最高精度。VRAM 10GB 以上が必要 |
| turbo | 約 1.6 GB | 約 6 GB | large 系を高速化したもの |
5. 字幕の自動改行を理解する
これは本ツールで最も効果が大きい機能です。 音声認識の生の出力は「1 つの発話 = 1 つの字幕」になるため、 日本語では 1 行が 35 文字を超えることが珍しくありません。 そのままでは画面に収まらず、字幕として使えません。
整形前
今日の天気は晴れです 音声認識が正しく動いているかどうかを確認しています
整形後(20 文字 × 2 行)
今日の天気は晴れです。音声認識が正しく
動いているかどうかを確認しています。
設定の考え方
初期値の「20 文字 × 2 行」は、テレビ字幕の慣習に近い値です。 画面が小さい端末向けなら 15 文字前後、 PC で見る前提の解説動画なら 25 文字程度でも読めます。
内部で行っていること
- 禁則処理:句読点や閉じカッコが行頭に来ないよう調整します(「、」「。」「」」など)
- 行幅の均等化:51 文字なら「20 / 20 / 11」ではなく「17 / 17 / 17」に配分します
- 英単語の保護:アルファベットの単語を途中で切りません
- 自動分割:指定行数を超えた分は次の字幕に分け、表示時間を文字数の比で割り振ります
- 余分な空白の除去:全角文字どうしの間に入った半角スペースを取り除きます
6. 句読点の補完
Whisper は日本語で句読点を省略することがあり、代わりに半角スペースが入ります。 これをオンにすると、句読点付きの文体をヒントとして与えることで、 「、」「。」が付いた出力になりやすくなります。
オフ
こんにちは これは字幕作成ツールのテストです
今日の天気は晴れです 音声認識が正しく動いているかどうかを確認しています
オン
こんにちは。これは字幕作成ツールのテストです。
今日の天気は晴れです。音声認識が正しく動いているかどうかを確認しています。
この機能は言語を先に判定し、日本語と判定されたときだけ働きます。 英語などの音声には影響しません。
7. SRT / VTT / ASS / JSON の使い分け
| 形式 | 主な用途 |
|---|---|
| SRT | 最も広く使われる字幕形式。YouTube への字幕アップロード、 Premiere Pro / DaVinci Resolve への読み込み、 動画プレイヤー(VLC など)での外部字幕表示。迷ったらこれ。 |
| VTT |
Web 用の字幕形式(WebVTT)。HTML の <track> タグで
動画に字幕を付ける場合に使います。
|
| ASS | 文字の大きさ・フチ・色・位置といった「見た目」の情報まで持てる字幕形式。 「3. 動画への焼き込み」で選んだスタイルで書き出すので、焼き込みと同じ見た目になります。 字幕エディターで手直しして使い回したいときに便利です(同じスタイルで読み書きできます)。 大きさは動画の解像度に合わせて決まります(音声ファイルの場合はフル HD 相当)。 |
| JSON | 全文テキスト、各区間の開始・終了時刻、検出言語、使用モデルなどを含む構造化データ。 自作のプログラムで加工したり、全文を検索可能にしたい場合に使います。 |
JSON の中身の例
{
"source": "会議録画.mp4",
"language": "ja",
"duration": 15.829,
"model": "medium",
"device": "cuda:0",
"text": "こんにちは。これは字幕作成ツールのテストです。...",
"segments": [
{ "id": 0, "start": 0.0, "end": 5.28,
"text": "こんにちは。これは字幕作成ツールのテスト\nです。" }
]
}
8. アンインストール
フォルダの中の アンインストール.bat をダブルクリックします(v1.2 以降)。
黒い画面で確認しながら削除が進みます。
- ツールのフォルダと設定ファイルは、最初の確認でまとめて削除します
- ほかのソフトと共有しているもの(AI モデル・FFmpeg・pip のキャッシュ)は、消すかどうかを 1 つずつ聞きます。Enter を押すと「残す」になります
- フォルダに動画など、ツール以外のファイルを置いていた場合は、そのファイルとフォルダを残します
- ツールが起動中のときは、何も消さずに終了します
- 最後の確認が済むまでは、何も削除しません
Python 本体は削除しません。不要なら Windows の「設定」→「アプリ」から削除してください。
手で削除する場合
レジストリなどは変更していないので、手で削除しても問題ありません。 アンインストーラが入っていない v1.1 以前もこの方法です。展開したフォルダに加えて、下記を削除してください。
C:\Users\(ユーザー名)\AppData\Local\WhisperSubtitleTool … 設定
C:\Users\(ユーザー名)\.cache\whisper … AI モデル
C:\Users\(ユーザー名)\AppData\Local\johukku\bin … FFmpeg(共有)
C:\Users\(ユーザー名)\AppData\Local\pip\Cache … pip のキャッシュ(共有)