> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# MiniMax Speech 2.8 Turbo 同期音声合成

テキストを音声に変換します。複数の音色、感情制御、話速調整などの機能に対応しています。テキスト長は 10000 文字未満に制限されます。テキスト長が 3000 文字を超える場合は、ストリーミング出力の使用を推奨します。

## リクエストヘッダー

<ParamField header="Content-Type" type="string" required={true}>
  列挙値: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Bearer 認証形式: Bearer \{\{API Key}}。
</ParamField>

## リクエストボディ

<ParamField body="text" type="string" required={true}>
  音声合成するテキスト。長さは 10000 文字未満に制限されます。テキスト長が 3000 文字を超える場合は、ストリーミング出力の使用を推奨します。段落切り替え（改行）、ポーズ制御（`&lt;#x#&gt;` マーク）、フィラータグ（(laughs)、(coughs) など。speech-2.8-hd/turbo のみ対応）をサポートします
</ParamField>

<ParamField body="stream" type="boolean" default={false}>
  ストリーミング出力するかどうかを制御します。デフォルトは false、つまりストリーミングは有効化されません
</ParamField>

<ParamField body="voice_modify" type="object">
  <Expandable title="プロパティ" defaultOpen={true}>
    <ParamField body="pitch" type="integer">
      ピッチ調整（低め/明るめ）。範囲は \[-100, 100] です。値が -100 に近いほど声はより低くなり、100 に近いほどより明るくなります

      値の範囲：\[-100, 100]
    </ParamField>

    <ParamField body="timbre" type="integer">
      音色調整（深み/クリア）。範囲は \[-100, 100] です。値が -100 に近いほど声はより厚みを増し、100 に近いほどよりクリアになります

      値の範囲：\[-100, 100]
    </ParamField>

    <ParamField body="intensity" type="integer">
      強度調整（力強さ/柔らかさ）。範囲は \[-100, 100] です。値が -100 に近いほど声はより力強くなり、100 に近いほどより柔らかくなります

      値の範囲：\[-100, 100]
    </ParamField>

    <ParamField body="sound_effects" type="string">
      音響効果の設定。一度に 1 種類のみ選択できます。選択可能な値：spacious\_echo（広い空間のエコー）、auditorium\_echo（講堂放送）、lofi\_telephone（電話風の歪み）、robotic（電子音）

      選択可能な値：`spacious_echo`, `auditorium_echo`, `lofi_telephone`, `robotic`
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="audio_setting" type="object">
  <Expandable title="プロパティ" defaultOpen={true}>
    <ParamField body="format" type="string" default="mp3">
      生成される音声の形式。wav は非ストリーミング出力でのみサポートされます

      選択可能な値：`mp3`, `pcm`, `flac`, `wav`
    </ParamField>

    <ParamField body="bitrate" type="integer" default={128000}>
      生成される音声のビットレート。選択可能な範囲は \[32000, 64000, 128000, 256000]、デフォルト値は 128000 です。このパラメータは mp3 形式の音声にのみ有効です

      選択可能な値：`32000`, `64000`, `128000`, `256000`
    </ParamField>

    <ParamField body="channel" type="integer" default={1}>
      生成される音声のチャンネル数。選択可能な範囲：\[1, 2]。1 はモノラル、2 はステレオです。デフォルト値は 1 です

      選択可能な値：`1`, `2`
    </ParamField>

    <ParamField body="force_cbr" type="boolean" default={false}>
      音声の固定ビットレート（cbr）制御に使用します。false、true を選択できます。このパラメータを true に設定すると、固定ビットレート方式で音声をエンコードします。注意：このパラメータは、音声がストリーミング出力に設定され、かつ音声形式が mp3 の場合にのみ有効です
    </ParamField>

    <ParamField body="sample_rate" type="integer" default={32000}>
      生成される音声のサンプリングレート。選択可能な範囲は \[8000, 16000, 22050, 24000, 32000, 44100]、デフォルトは 32000 です

      選択可能な値：`8000`, `16000`, `22050`, `24000`, `32000`, `44100`
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="output_format" type="string" default="hex">
  出力結果形式を制御するパラメータです。選択可能な値の範囲は url、hex で、デフォルト値は hex です。このパラメータは非ストリーミングシナリオでのみ有効です。ストリーミングシナリオでは hex 形式の返却のみサポートされます。返却される url の有効期限は 24 時間です

  選択可能な値：`url`, `hex`
</ParamField>

<ParamField body="voice_setting" type="object">
  <Expandable title="プロパティ" defaultOpen={true}>
    <ParamField body="vol" type="number" default={1}>
      合成音声の音量。値が大きいほど音量が高くなります。値の範囲は (0, 10]、デフォルト値は 1.0 です

      値の範囲：\[0, 10]
    </ParamField>

    <ParamField body="pitch" type="integer" default={0}>
      合成音声のピッチ。値の範囲は \[-12, 12]、デフォルト値は 0 です。0 は元の音色で出力することを示します

      値の範囲：\[-12, 12]
    </ParamField>

    <ParamField body="speed" type="number" default={1}>
      合成音声の話速。値が大きいほど話速が速くなります。値の範囲は \[0.5, 2]、デフォルト値は 1.0 です

      値の範囲：\[0.5, 2]
    </ParamField>

    <ParamField body="emotion" type="string">
      合成音声の感情を制御します。パラメータ範囲はそれぞれ 8 種類の感情に対応します：喜び(happy)、悲しみ(sad)、怒り(angry)、恐れ(fearful)、嫌悪(disgusted)、驚き(surprised)、中立(calm)、生き生き(fluent)、ささやき(whisper)。モデルは入力テキストに基づいて適切な感情を自動的に一致させるため、通常は手動指定は不要です

      選択可能な値：`happy`, `sad`, `angry`, `fearful`, `disgusted`, `surprised`, `calm`, `fluent`, `whisper`
    </ParamField>

    <ParamField body="voice_id" type="string" required={true}>
      合成音声の音色 ID。混合音色を設定する必要がある場合は、timber\_weights パラメータを設定し、このパラメータは空値にしてください。システム音色、クローン音色、テキスト生成音色の 3 種類をサポートします
    </ParamField>

    <ParamField body="latex_read" type="boolean" default={false}>
      latex 数式を読み上げるかどうかを制御します。デフォルトは false です。中国語のみ対応しています。このパラメータを有効にすると、language\_boost パラメータは Chinese に設定されます
    </ParamField>

    <ParamField body="text_normalization" type="boolean" default={false}>
      中国語・英語テキストの正規化を有効にするかどうか。オンにすると数字読み上げシナリオの性能を向上できますが、遅延がわずかに増加します。デフォルト値は false です
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="aigc_watermark" type="boolean" default={false}>
  合成音声の末尾に音声リズム識別子を追加するかどうかを制御します。デフォルト値は false です。このパラメータは非ストリーミング合成にのみ有効です
</ParamField>

<ParamField body="language_boost" type="string">
  指定した少数言語および方言の認識能力を強化するかどうか。デフォルト値は null です。auto に設定すると、モデルに自律的に判断させることができます

  選択可能な値：`Chinese`, `Chinese,Yue`, `English`, `Arabic`, `Russian`, `Spanish`, `French`, `Portuguese`, `German`, `Turkish`, `Dutch`, `Ukrainian`, `Vietnamese`, `Indonesian`, `Japanese`, `Italian`, `Korean`, `Thai`, `Polish`, `Romanian`, `Greek`, `Czech`, `Finnish`, `Hindi`, `Bulgarian`, `Danish`, `Hebrew`, `Malay`, `Persian`, `Slovak`, `Swedish`, `Croatian`, `Filipino`, `Hungarian`, `Norwegian`, `Slovenian`, `Catalan`, `Nynorsk`, `Tamil`, `Afrikaans`, `auto`
</ParamField>

<ParamField body="stream_options" type="object">
  <Expandable title="プロパティ" defaultOpen={true}>
    <ParamField body="exclude_aggregated_audio" type="boolean" default={false}>
      最後の chunk に結合後の音声 hex データを含めるかどうかを設定します。デフォルト値は false、つまり最後の chunk には結合後の完全な音声 hex データが含まれます
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="timber_weights" type="object[]">
  混合音色設定。最大 4 種類の音色混合をサポートします

  <Expandable title="プロパティ" defaultOpen={true}>
    <ParamField body="weight" type="integer" required={true}>
      合成音声における各音色の重み。voice\_id と同期して入力する必要があります。選択可能な値の範囲は \[1, 100] で、最大 4 種類の音色混合をサポートします。単一音色の値の比率が高いほど、合成音色はその音色により近くなります

      値の範囲：\[1, 100]
    </ParamField>

    <ParamField body="voice_id" type="string" required={true}>
      合成音声の音色 ID。weight パラメータと同期して入力する必要があります。システム音色、クローン音色、テキスト生成音色の 3 種類をサポートします
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="subtitle_enable" type="boolean" default={false}>
  字幕サービスを有効にするかどうかを制御します。デフォルト値は false です。このパラメータは非ストリーミング出力シナリオでのみ有効であり、speech-2.6-hd, speech-2.6-turbo, speech-01-turbo, speech-01-hd モデルに対してのみ有効です
</ParamField>

<ParamField body="continuous_sound" type="boolean" default={false}>
  このパラメータを有効にすると、句と句のつなぎ目がより自然になります。speech-2.8-hd および speech-2.8-turbo モデルのみ対応しています
</ParamField>

<ParamField body="pronunciation_dict" type="object">
  <Expandable title="プロパティ" defaultOpen={true}>
    <ParamField body="tone" type="string[]">
      特別な注記が必要な文字または記号に対応する注音または発音の置換ルールを定義します。中国語テキストでは、声調を数字で表します：一声は 1、二声は 2、三声は 3、四声は 4、軽声は 5 です。例：\["燕少飞/(yan4)(shao3)(fei1)", "omg/oh my god"]
    </ParamField>
  </Expandable>
</ParamField>

## レスポンス情報

<ResponseField name="data" type="object" required={false}>
  返却される合成データオブジェクト。null の可能性があるため、非 null 判定が必要です
</ResponseField>

<ResponseField name="trace_id" type="string" required={false}>
  今回のセッションの id。問い合わせ/フィードバック時に問題の特定に役立ちます
</ResponseField>

<ResponseField name="base_resp" type="object" required={false}>
  今回のリクエストのステータスコードと詳細
</ResponseField>

<ResponseField name="extra_info" type="object" required={false}>
  音声の追加情報
</ResponseField>
