- Cloudflare ホスト
- 画像入力
Moondream 3 は、高速で効率的な 90億パラメータの Mixture-of-Experts ビジョン言語モデル(有効パラメータは 20億)です。物体検出、ポインティング、OCR、構造化出力などのタスクで、最先端レベルの視覚推論を提供します。
| モデル情報 | |
|---|---|
| 画像入力 | はい |
| 単価 | $0.30 per M input tokens, $1.00 per M output tokens |
task
stringデフォルト: queryenum: query, caption, point, detect実行する Moondream の skill です。image
string入力画像です。公開 HTTPS URL または Base64 data URI です。`query` では任意、`caption`、`point`、`detect` では必須です。question
stringデフォルト: What's in this image?`query` タスクの質問です。caption_length
stringデフォルト: normalenum: short, normal, long`caption` タスクのキャプション長です。target
stringデフォルト: person`point` と `detect` で探すオブジェクトのフレーズです(例: `person wearing a red shirt`)。reasoning
booleanデフォルト: true`query` タスクの推論トレースを有効にします。temperature
numberデフォルト: 0.2minimum: 0maximum: 2サンプリング temperature です。top_p
numberデフォルト: 0.9minimum: 0maximum: 1Top-p(nucleus)sampling です。max_tokens
integerデフォルト: 8192minimum: 1maximum: 28672`query` と `caption` で生成するトークンの最大数です。max_objects
integerデフォルト: 150minimum: 1maximum: 500`point` と `detect` で返すオブジェクトの最大数です。stream
booleanデフォルト: true`query` と `caption` でトークンを順次返します。`point` と `detect` はストリーミング非対応です。finish_reason
string生成が終了した理由です。▶metrics{}
objectanswer
string`query` タスクの回答テキストです。他のタスクでは null です。caption
string`caption` タスクのキャプションテキストです。他のタスクでは null です。▶points[]
array`point` タスクで特定した点です。他のタスクでは null です。▶objects[]
array`detect` タスクで検出したバウンディングボックスです。他のタスクでは null です。▶reasoning{}
object`reasoning=true` のときの `query` タスクの推論トレースです。それ以外は null です。