Skip to content

非公式本サイトは非公式の日本語ドキュメントであり、Cloudflare 公式サイトではありません。最新情報はdevelopers.cloudflare.comをご確認ください。

動画アップロード時の自動キャプション

最終更新 Markdown で表示Agent セットアップ

はじめに

自動音声認識(ASR)モデルは、字幕と翻訳の生成を可能にし、動画コンテンツのアクセシビリティを大きく変えました。これらのモデルは高度なアルゴリズムで、話し言葉を高い精度でテキストに書き起こします。ASR を動画プラットフォームに組み込むと、コンテンツ制作者、配信者、配信事業者は、聴覚に障害のある人や、別の言語でコンテンツを消費したい人を含む、より広い視聴者に届けられます。

処理は、動画ソースから音声を取得するところから始まり、その音声を ASR モデルに渡します。モデルは音声波形を解析し、テキスト表現に変換して、発話内容を字幕として捉えます。さらに、ASR モデルを言語翻訳にも使い、多言語字幕を作成できます。字幕が生成されると動画と並べて表示でき、発話内容の同期したテキスト表現を提供します。

アップロード時の自動キャプション

図 1: アップロード時の自動キャプション
図 1: アップロード時の自動キャプション
  1. クライアントのアップロード: 動画と音声の両方を API エンドポイントへ POST リクエストで送ります。
  2. 音声の書き起こし: 音声を入力として Workers AI自動音声認識(ASR)モデル を呼び出し、タイムスタンプ付きの書き起こしを生成します。Workers で出力を対応字幕形式に変換します。
  3. 字幕の保存: 字幕ファイルを R2 に保存します。
  4. 動画の保存: 動画ファイルを R2 に保存します。
  5. クライアントのリクエスト: 動画と字幕をオリジンへ GET リクエストで取得します。グローバル Cache で性能を上げます。
  6. オリジンリクエスト: キャッシュ MISS 時は Public Buckets を使い、R2 からファイルを取得します。

関連リソース

役に立ちましたか?