Skip to content

非公式本サイトは非公式の日本語ドキュメントであり、Cloudflare 公式サイトではありません。最新情報はdevelopers.cloudflare.comをご確認ください。

OpenAI のロゴ

whisper-large-v3-turbo

音声認識 • OpenAI

Markdown で表示Agent セットアップ
  • Cloudflare ホスト
  • バッチ

Whisper は、自動音声認識(ASR)と音声翻訳向けの事前学習モデルです。

モデル情報
バッチはい
単価$0.00051 per audio minute

パラメーター

task
stringデフォルト: transcribe対応タスクは `translate` または `transcribe` です。
language
string書き起こしまたは翻訳する音声の言語です。
vad_filter
booleanデフォルト: false音声区間検出モデルで音声を前処理します。
initial_prompt
string音声の内容についてモデルにコンテキストを与えるテキストプロンプトです。
prefix
string書き起こし出力の先頭に付けるプレフィックスです。結果の案内に使えます。
beam_size
integerデフォルト: 5ビームサーチデコードで使うビーム数です。値が高いほど精度は上がることがありますが、速度は下がります。
condition_on_previous_text
booleanデフォルト: true書き起こし中に直前のテキストを条件にするかどうかです。`false` にすると、幻覚のループを防げることがあります。
no_speech_threshold
numberデフォルト: 0.6無音セグメント検出のしきい値です。無音確率がこの値を超えるセグメントはスキップされます。
compression_ratio_threshold
numberデフォルト: 2.4圧縮比が高いセグメントを除くしきい値です。繰り返しや幻覚テキストのことが多いです。
log_prob_threshold
numberデフォルト: -1平均対数確率が低く信頼度が低いセグメントを除くしきい値です。
hallucination_silence_threshold
number幻覚の原因になりうる無音区間をスキップする任意のしきい値(秒)です。
text
string音声の完全な書き起こしです。
word_count
number書き起こしの単語の合計数です。
vtt
string字幕向けのタイミングとテキストを含む、WebVTT 形式の書き起こしです。

API スキーマ(Raw)

Input
Output

役に立ちましたか?