- Cloudflare ホスト
- バッチ
- パートナー
- リアルタイム
Deepgram の音声認識モデルで音声を文字起こしします。
| モデル情報 | |
|---|---|
| 利用規約とライセンス | リンク ↗ |
| バッチ | はい |
| パートナー | はい |
| リアルタイム | はい |
| 単価 | $0.0052 per audio minute, $0.0092 per audio minute (websocket) |
▶audio{}
object必須custom_topic_mode
stringenum: extended, strict`custom_topic` に渡した文字列の解釈方法です。`strict` では渡したトピックだけを返し、`extended` ではモデルが検出したトピックも合わせて返します。custom_topic
string入力音声またはテキストにあれば検出してほしいカスタムトピックです。最大 100 件ですcustom_intent_mode
stringenum: extended, strict`custom_intent` に渡したインテントの解釈方法です。`strict` では渡したインテントだけを返し、`extended` ではモデルが検出したインテントも合わせて返しますcustom_intent
string入力音声にあれば検出してほしいカスタムインテントですdetect_entities
boolean送信した音声の内容から主要なエンティティを識別して抽出しますdetect_language
boolean送信した音声で主に話されている言語を識別しますdiarize
boolean話者の切り替わりを認識します。書き起こしの各単語に 0 から始まる話者番号が付きますdictation
boolean送信した音声の内容から主要なエンティティを識別して抽出しますencoding
stringenum: linear16, flac, mulaw, amr-nb, amr-wb, opus, speex, g729送信する音声の想定エンコードを指定しますextra
string後段処理で使うために API 応答に付ける、任意のキーと値ですfiller_words
booleanフィラー語は、`uh` や `um` のような音声の途切れを書き起こすのに役立ちますkeyterm
stringキータームプロンプトは、専門用語やブランド名を強調または抑制できます。keywords
stringキーワードは、専門用語やブランド名を強調または抑制できます。language
string主な発話言語のヒントになる BCP-47 言語タグです。選んだモデルと API エンドポイントによって、使える言語は限られます。measurements
boolean話し言葉の単位は、対応する略語に変換されます。mip_opt_out
booleanリクエストを Deepgram Model Improvement Program からオプトアウトします。`true` にする前に、料金への影響はドキュメントを確認してください。https://dpgr.am/deepgram-mipmode
stringenum: general, medical, finance送信した音声で話される広い話題領域を表す、モデルの動作モードですmultichannel
boolean各音声チャンネルを独立して書き起こします。numerals
booleanNumerals は、書き言葉の数字を数値形式に変換します。paragraphs
boolean読みやすさのため、音声を段落に分割します。profanity_filter
booleanProfanity Filter は既知の不適切表現を探し、近い適切な語に置き換えるか、書き起こしから完全に除きます。punctuate
boolean書き起こしに句読点と大文字化を付けます。redact
stringRedaction は書き起こしから機密情報を除きます。replace
string送信した音声内の語句を検索して置き換えます。search
string送信した音声内の語句を検索します。sentiment
boolean書き起こしまたはテキスト全体の感情を認識します。smart_format
boolean書き起こし出力に書式を適用します。`true` の場合、読みやすさのための追加書式が付きます。topics
boolean書き起こしまたはテキスト全体のトピックを検出します。utterances
boolean発話を意味のある単位に分割します。utt_split
number送信した音声で単語間のポーズを検出するまでの待ち秒数です。channels
number送信した音声のチャンネル数ですinterim_results
booleanストリーミングエンドポイントが、音声の受信に合わせて書き起こしを更新し続けるかどうかです。`true` の場合、継続的に更新され、書き起こし結果は時間とともに変わることがあります。対応は websocket のみです。endpointing
string話者が話し終えたか、長くポーズしたかを検出するまでの待ち時間です。値を設定すると、処理済み時間範囲の書き起こしをすぐに確定し、`speech_final` が true の書き起こしを返します。`false` でエンドポインティングを無効にできますvad_events
boolean発話が始まったことを示します。発話開始とともに Speech Started メッセージを受け取ります。対応は websocket のみです。utterance_end_ms
boolean単語の書き起こし後、UtteranceEnd メッセージを送るまでの待ち時間です。`interim_results` と一緒に使います。対応は websocket のみです。▶results{}
object