自動音声認識(ASR)モデルは、字幕と翻訳の生成を可能にし、動画コンテンツのアクセシビリティを大きく変えました。これらのモデルは高度なアルゴリズムで、話し言葉を高い精度でテキストに書き起こします。ASR を動画プラットフォームに組み込むと、コンテンツ制作者、配信者、配信事業者は、聴覚に障害のある人や、別の言語でコンテンツを消費したい人を含む、より広い視聴者に届けられます。
処理は、動画ソースから音声を取得するところから始まり、その音声を ASR モデルに渡します。モデルは音声波形を解析し、テキスト表現に変換して、発話内容を字幕として捉えます。さらに、ASR モデルを言語翻訳にも使い、多言語字幕を作成できます。字幕が生成されると動画と並べて表示でき、発話内容の同期したテキスト表現を提供します。
- クライアントのアップロード: 動画と音声の両方を API エンドポイントへ POST リクエストで送ります。
- 音声の書き起こし: 音声を入力として Workers AI の 自動音声認識(ASR)モデル を呼び出し、タイムスタンプ付きの書き起こしを生成します。Workers で出力を対応字幕形式に変換します。
- 字幕の保存: 字幕ファイルを R2 に保存します。
- 動画の保存: 動画ファイルを R2 に保存します。
- クライアントのリクエスト: 動画と字幕をオリジンへ GET リクエストで取得します。グローバル Cache で性能を上げます。
- オリジンリクエスト: キャッシュ
MISS時は Public Buckets を使い、R2 からファイルを取得します。