> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# MiniMax Speech 2.8 Turbo 非同期音声合成

本インターフェイスを使用して、非同期音声合成タスクを作成します。テキストまたはファイル入力に対応しており、テキストの長さは最大 5 万文字、ファイルは最大 10 万文字までに制限されます。

<Tip>
  これは**非同期**API であり、非同期タスクの task\_id のみを返します。この task\_id を使用して [タスク結果照会 API](/ja/docs/models/reference-get-async-task-result) にリクエストし、生成結果を取得してください。
</Tip>

## リクエストヘッダー

<ParamField header="Content-Type" type="string" required={true}>
  列挙値: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Bearer 認証形式: Bearer \{\{API Key}}。
</ParamField>

## リクエストボディ

<ParamField body="text" type="string">
  合成する音声のテキスト。最大 5 万文字まで。`text_file_id` とのいずれか一方が必須です<br /><br />• 感情詞タグ：モデルに `speech-2.8-hd` または `speech-2.8-turbo` を選択した場合のみ、テキスト内に感情詞タグを挿入できます。対応している感情詞：`(laughs)`（笑い声）、`(chuckle)`（軽い笑い）、`(coughs)`（咳）、`(clear-throat)`（咳払い）、`(groans)`（うめき声）、`(breath)`（通常の息継ぎ）、`(pant)`（息切れ）、`(inhale)`（吸気）、`(exhale)`（呼気）、`(gasps)`（息をのむ）、`(sniffs)`（鼻をすする）、`(sighs)`（ため息）、`(snorts)`（鼻息）、`(burps)`（げっぷ）、`(lip-smacking)`（舌鼓）、`(humming)`（ハミング）、`(hissing)`（シューという音）、`(emm)`（うーん）、`(whistles)`（口笛）、`(sneezes)`（くしゃみ）、`(crying)`（すすり泣き）、`(applause)`（拍手）
</ParamField>

<ParamField body="text_file_id" type="integer">
  合成する音声のテキストファイル id。単一ファイルの長さは 10 万文字未満に制限され、対応ファイル形式は txt、zip です。`text` とのいずれか一方が必須で、渡された後に形式が自動検証されます。<br />• **txt ファイル**：長さ制限 \<100,000 文字。`&lt;#x#&gt;` マークを使用したカスタムポーズに対応しています。x はポーズ時間（単位：秒）で、範囲は \[0.01,99.99]、小数点以下 2 桁まで保持できます。ポーズは音声として発音可能な 2 つのテキストの間に設定する必要があり、複数のポーズマークを連続して使用することはできません<br />• **zip ファイル**：<br />• 圧縮パッケージ内には、同一形式の txt または json ファイルを含める必要があります。<br />• json ファイル形式：\[`title`, `content`, `extra`] の 3 つのフィールドに対応し、それぞれタイトル、本文、追加情報を表します。3 つのフィールドがすべて存在する場合、3 組の結果、合計 9 個のファイルが生成され、1 つのフォルダにまとめて保存されます。いずれかのフィールドが存在しない、または内容が空の場合、そのフィールドに対応する結果は生成されません
</ParamField>

<ParamField body="voice_modify" type="object">
  <Expandable title="プロパティ" defaultOpen={true}>
    <ParamField body="pitch" type="integer">
      ピッチ調整（低め/明るめ）。範囲は \[-100, 100] で、値が -100 に近いほど声はより低くなり、100 に近いほど声はより明るくなります

      値の範囲：\[-100, 100]
    </ParamField>

    <ParamField body="timbre" type="integer">
      音色調整（磁性的/澄んだ）。範囲は \[-100, 100] で、値が -100 に近いほど声はより厚みを増し、100 に近いほど声はより澄んだものになります

      値の範囲：\[-100, 100]
    </ParamField>

    <ParamField body="intensity" type="integer">
      強度調整（力強さ/柔らかさ）。範囲は \[-100, 100] で、値が -100 に近いほど声はより力強くなり、100 に近いほど声はより柔らかくなります

      値の範囲：\[-100, 100]
    </ParamField>

    <ParamField body="sound_effects" type="string">
      音効設定。1 回につき 1 種類のみ選択可能です。選択可能な値：

      1. spacious\_echo（広い空間のエコー）
      2. auditorium\_echo（講堂放送）
      3. lofi\_telephone（電話の歪み）
      4. robotic（電子音）

      選択可能な値：`spacious_echo`, `auditorium_echo`, `lofi_telephone`, `robotic`
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="audio_setting" type="object">
  <Expandable title="プロパティ" defaultOpen={true}>
    <ParamField body="format" type="string" default="mp3">
      生成音声の形式。選択可能範囲は \[mp3, pcm, flac]、デフォルト値は `mp3` です

      選択可能な値：`mp3`, `pcm`, `flac`
    </ParamField>

    <ParamField body="bitrate" type="integer" default={128000}>
      生成音声のビットレート。選択可能範囲は \[32000, 64000, 128000, 256000]、デフォルト値は `128000` です。このパラメータは `mp3` 形式の音声にのみ有効です
    </ParamField>

    <ParamField body="channel" type="integer" default={2}>
      生成音声のチャンネル数。選択可能範囲：\[1, 2]。`1` はモノラル、`2` はステレオで、デフォルト値は 1 です
    </ParamField>

    <ParamField body="audio_sample_rate" type="integer" default={32000}>
      生成音声のサンプリングレート。選択可能範囲は \[8000, 16000, 22050, 24000, 32000, 44100]、デフォルトは `32000` です
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="voice_setting" type="object" required={true}>
  <Expandable title="プロパティ" defaultOpen={true}>
    <ParamField body="vol" type="number" default={1}>
      合成音声の音量。値が大きいほど音量が高くなります。値の範囲は (0, 10]、デフォルト値は 1.0 です

      値の範囲：\[0, 10]
    </ParamField>

    <ParamField body="pitch" type="integer" default={0}>
      合成音声のイントネーション。値の範囲は \[-12, 12]、デフォルト値は 0 で、0 は元の音色での出力を表します

      値の範囲：\[-12, 12]
    </ParamField>

    <ParamField body="speed" type="number" default={1}>
      合成音声の話速。値が大きいほど話速が速くなります。値の範囲は \[0.5, 2]、デフォルト値は 1.0 です

      値の範囲：\[0.5, 2]
    </ParamField>

    <ParamField body="emotion" type="string">
      合成音声の感情を制御します。パラメータ範囲は \["happy", "sad", "angry", "fearful", "disgusted", "surprised", "calm", "fluent", "whisper"] で、それぞれ 8 種類の感情に対応します：喜び、悲しみ、怒り、恐れ、嫌悪、驚き、中性、生き生き、ささやき
      <br />• モデルは入力テキストに基づいて適切な感情を自動的にマッチングするため、通常は手動指定は不要です
      <br />• このパラメータは `speech-2.6-hd`, `speech-2.6-turbo`, `speech-01-hd`, `speech-01-turbo` モデルにのみ有効です
      <br />• オプション `fluent`, `whisper` は `speech-2.6-turbo`, `speech-2.6-hd` モデルにのみ有効です

      選択可能な値：`happy`, `sad`, `angry`, `fearful`, `disgusted`, `surprised`, `calm`, `fluent`, `whisper`
    </ParamField>

    <ParamField body="voice_id" type="string" required={true}>
      合成音声の音色番号。混合音色を設定する必要がある場合は、timber\_weights パラメータを設定し、本パラメータは空値にしてください。システム音色、クローン音色、テキスト生成音色の 3 種類に対応しています。以下は一部の最新システム音色（ID）で、公式が対応するすべての音色を確認できます
      <br />• **中国語**:<br />• moss\_audio\_ce44fc67-7ce3-11f0-8de5-96e35d26fb85<br />• moss\_audio\_aaa1346a-7ce7-11f0-8e61-2e6e3c7ee85d<br />• Chinese (Mandarin)\_Lyrical\_Voice<br />• Chinese (Mandarin)\_HK\_Flight\_Attendant<br />• 英語:<br />• English\_Graceful\_Lady<br />• English\_Insightful\_Speaker<br />• English\_radiant\_girl<br />• English\_Persuasive\_Man<br />• moss\_audio\_6dc281eb-713c-11f0-a447-9613c873494c<br />• moss\_audio\_570551b1-735c-11f0-b236-0adeeecad052<br />• moss\_audio\_ad5baf92-735f-11f0-8263-fe5a2fe98ec8<br />• English\_Lucky\_Robot<br />• 日本語:<br />• Japanese\_Whisper\_Belle<br />• moss\_audio\_24875c4a-7be4-11f0-9359-4e72c55db738<br />• moss\_audio\_7f4ee608-78ea-11f0-bb73-1e2a4cfcd245<br />• moss\_audio\_c1a6a3ac-7be6-11f0-8e8e-36b92fbb4f95
    </ParamField>

    <ParamField body="english_normalization" type="boolean" default={false}>
      英語テキストの正規化に対応しています。有効にすると数字読み上げシーンの性能を向上できますが、遅延がわずかに増加します。デフォルトは false です
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="aigc_watermark" type="boolean" default={false}>
  合成音声の末尾に音声リズム識別子を追加するかどうかを制御します。デフォルト値は False です。このパラメータは非ストリーミング合成にのみ有効です
</ParamField>

<ParamField body="language_boost" type="string">
  指定した小規模言語および方言の認識能力を強化するかどうか。デフォルト値は `null` で、`auto` に設定するとモデルが自律的に判断します。

  選択可能な値：`Chinese`, `Chinese,Yue`, `English`, `Arabic`, `Russian`, `Spanish`, `French`, `Portuguese`, `German`, `Turkish`, `Dutch`, `Ukrainian`, `Vietnamese`, `Indonesian`, `Japanese`, `Italian`, `Korean`, `Thai`, `Polish`, `Romanian`, `Greek`, `Czech`, `Finnish`, `Hindi`, `Bulgarian`, `Danish`, `Hebrew`, `Malay`, `Persian`, `Slovak`, `Swedish`, `Croatian`, `Filipino`, `Hungarian`, `Norwegian`, `Slovenian`, `Catalan`, `Nynorsk`, `Tamil`, `Afrikaans`, `auto`
</ParamField>

<ParamField body="continuous_sound" type="boolean" default={false}>
  このパラメータを有効にすると、句のつなぎ目がより自然になります。`speech-2.8-hd` および `speech-2.8-turbo` モデルのみ対応しています
</ParamField>

<ParamField body="pronunciation_dict" type="object">
  <Expandable title="プロパティ" defaultOpen={true}>
    <ParamField body="tone" type="string[]">
      特殊な注記が必要な文字または記号に対応する注音または発音置換ルールを定義します。中国語テキストでは、声調を数字で表します：
      一声は `1`、二声は `2`、三声は `3`、四声は `4`、軽声は `5`
      例：
      \["燕少飞/(yan4)(shao3)(fei1)", "omg/oh my god"]
    </ParamField>
  </Expandable>
</ParamField>

## レスポンス情報

<ResponseField name="file_id" type="integer" required={false}>
  タスク作成成功後に返される、対応する音声ファイルの ID。<br /><br />• タスク完了後、file\_id で照会できます。リクエストエラー時、このフィールドは返されません

  注意：返されるダウンロード URL は生成時点から 9 時間（32400 秒）有効です。期限切れ後、ファイルは無効になり、生成された情報は失われます。ダウンロード情報の有効時間にご注意ください
</ResponseField>

<ResponseField name="task_id" type="string" required={false}>
  task\_id を使用して [タスク結果照会 API](/ja/docs/models/reference-get-async-task-result) にリクエストし、生成された出力を取得します。
</ResponseField>

<ResponseField name="base_resp" type="object" required={false}>
  <Expandable title="プロパティ" defaultOpen={true}>
    <ResponseField name="status_msg" type="string" required={true}>
      ステータス詳細
    </ResponseField>

    <ResponseField name="status_code" type="integer" required={true}>
      ステータスコード<br /><br />• `0`: 正常<br />• `1002`: レート制限<br />• `1004`: 認証失敗<br />• `1039`: TPM レート制限の発生<br />• `1042`: 不正文字が 10% 超<br />• `2013`: パラメータエラー
    </ResponseField>
  </Expandable>
</ResponseField>

<ResponseField name="task_token" type="string" required={false}>
  現在のタスクの完了に使用されるキー情報
</ResponseField>

<ResponseField name="usage_characters" type="integer" required={false}>
  課金対象文字数
</ResponseField>
