YouTube Transcript Research
YouTube動画の内容を、後から検索・引用・要約に使える資料として保存する。
入力
- 調べるテーマ、人物、出来事、または検索語
- 必要なら対象動画URL
- 必要なら保存先と字幕言語
出力
ユーザー指定の保存先を優先する。指定がなければ、作業ディレクトリ内の research/youtube-transcripts/{YYYY-MM-DD}_{slug}/ を使う。
採用動画ごとに次を保存する。
- URL、タイトル、チャンネル、公開日、長さを含むメタデータ
- 取得した字幕の全文データ
- タイムスタンプ付きの読みやすいテキスト
- 内容要約
- 主な論点と該当時刻
- 短い引用候補と該当時刻
- 字幕の誤認識など、利用時に必要な注意
複数動画を扱う場合は、候補一覧と採否理由を含む索引ファイルも作る。
手順
- 指定された検索語でYouTubeを検索する。結果が偏る場合は、同義語、書名、所属、イベント名、「講演」「対談」「インタビュー」などを組み合わせる。
- タイトルだけで決めず、動画説明、話者、チャンネル、公開日、長さを確認して候補を選ぶ。
- 採用動画は、利用可能な元言語字幕または自動字幕を全編取得する。
- 字幕をタイムスタンプ付きテキストへ整形する。
- 全体を読み、内容要約、論点索引、引用候補を資料ファイルへ記録する。
- 固有名詞や直接引用に使う箇所だけ、映像・音声または別の文字起こしで再確認する。
字幕がない場合は、音声を取得でき、ローカルに文字起こし手段があるときだけ音声認識を行う。取得できない場合は、字幕未取得と記録し、内容確認済みとは扱わない。
付属スクリプト
候補検索:
python3 scripts/youtube_transcript.py search \
--query "検索語" \
--limit 20 \
--output /tmp/youtube-candidates.jsonl
全字幕取得:
python3 scripts/youtube_transcript.py fetch \
--url "https://www.youtube.com/watch?v=VIDEO_ID" \
--output-dir research/youtube-transcripts/2026-08-25_topic \
--languages "ja-orig,ja"
複数URLには --url を繰り返す。スクリプトは動画ごとのメタデータ、字幕JSON3、タイムスタンプ付きTSVとテキスト、全体manifestを保存する。
完了条件
- 採用動画のメタデータと字幕全文が保存されている。
- 各資料から元動画と該当時刻へ戻れる。
- 要約と論点索引が字幕内容に基づいている。
- 字幕を取得できなかった動画が区別されている。