> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Fish Audio 音声合成

<Note>
  最良の結果を得るには、この API を使用する前に、まず[音声クローン](/ja/docs/models/reference-fish-audio-voice-cloning)を使用して参照音声をアップロードすることをお勧めします。これにより、音声品質が向上し、レイテンシが低減されます。
</Note>

Fish Audio はテキストを音声に変換します。

対応している音声形式：

* WAV / PCM
  * サンプルレート：8kHz, 16kHz, 24kHz, 32kHz, 44.1kHz
  * デフォルトのサンプルレート：44.1kHz
  * 16-bit、モノラル

* MP3
  * サンプルレート：32kHz, 44.1kHz
  * デフォルトのサンプルレート：44.1kHz
  * モノラル
  * ビットレート：64kbps, 128kbps (デフォルト), 192kbps

* Opus
  * サンプルレート：48kHz
  * デフォルトのサンプルレート：48kHz
  * モノラル
  * ビットレート：-1000 (自動), 24kbps, 32kbps (デフォルト), 48kbps, 64kbps

## リクエストヘッダー

<ParamField header="Content-Type" type="string" required={true}>
  列挙値: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Bearer 認証形式: Bearer \{\{API Key}}。
</ParamField>

## リクエストボディ

<ParamField body="text" type="string" required={true}>
  音声に変換するテキスト。
</ParamField>

<ParamField body="temperature" type="number" default={0.9}>
  音声生成のランダム性を制御します。値が高いほど（例：1.0）出力はよりランダムになり、値が低いほど（例：0.1）より決定的になります。`s1` モデルでは `0.9` の使用をお勧めします。

  必須範囲：`0 <= x <= 1`
</ParamField>

<ParamField body="top_p" type="number" default={0.9}>
  nucleus sampling によって多様性を制御します。値が低いほど（例：0.1）出力はより集中し、値が高いほど（例：1.0）より多様性が許容されます。`s1` モデルでは `0.9` の使用をお勧めします。

  必須範囲：`0 <= x <= 1`
</ParamField>

<ParamField body="references" type="ReferenceAudio · object[] | null">
  音声に使用する参照音声です。これには MessagePack シリアライズが必要で、reference\_voices と reference\_texts を上書きします。

  <Expandable title="properties">
    <ParamField body="audio" type="file" required={true}>
      参照音声ファイル。
    </ParamField>

    <ParamField body="text" type="string" required={true}>
      音声に対応する参照テキスト。
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="reference_id" type="string | null">
  音声に使用する参照モデル ID。
</ParamField>

<ParamField body="prosody" type="ProsodyControl · object">
  音声に使用する韻律制御。

  <Expandable title="properties">
    <ParamField body="speed" type="number" default={1}>
      音声速度の制御。
    </ParamField>

    <ParamField body="volume" type="number" default={0}>
      音声音量の制御。
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="chunk_length" type="integer" default={200}>
  音声に使用するチャンク長。

  必須範囲：`100 <= x <= 300`
</ParamField>

<ParamField body="normalize" type="boolean" default={true}>
  音声を正規化するかどうか。これによりレイテンシは低減されますが、数字や日付の処理性能が低下する可能性があります。
</ParamField>

<ParamField body="format" type="enum<string>" default="mp3">
  音声に使用する形式。

  選択可能な値：`wav`, `pcm`, `mp3`, `opus`
</ParamField>

<ParamField body="sample_rate" type="integer | null">
  音声に使用するサンプルレート。
</ParamField>

<ParamField body="mp3_bitrate" type="enum<integer>" default={128}>
  音声に使用する MP3 ビットレート。

  選択可能な値：`64`, `128`, `192`
</ParamField>

<ParamField body="opus_bitrate" type="enum<integer>" default={32}>
  音声に使用する Opus ビットレート。

  選択可能な値：`-1000`, `24`, `32`, `48`, `64`
</ParamField>

<ParamField body="latency" type="enum<string>" default="normal">
  音声に使用するレイテンシ設定。balanced はレイテンシを低減しますが、性能低下を引き起こす可能性があります。

  選択可能な値：`normal`, `balanced`
</ParamField>

## レスポンス情報

API は `format` パラメータで指定された形式の音声ストリームを直接返します（デフォルト：mp3）。
