> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# MiniMax Speech 2.8 HD 非同期音声合成

このインターフェースを使用して、非同期音声合成タスクを作成します。テキストまたはファイル入力に対応し、テキストの長さは最大 5 万文字、ファイルは最大 10 万文字までに制限されます。

<Tip>
  これは**非同期**API であり、非同期タスクの task\_id のみを返します。この task\_id を使用して [タスク結果照会 API](/ja/docs/models/reference-get-async-task-result) にリクエストし、生成結果を取得してください。
</Tip>

## リクエストヘッダー

<ParamField header="Content-Type" type="string" required={true}>
  列挙値: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Bearer 認証形式: Bearer \{\{API Key}}。
</ParamField>

## リクエストボディ

<ParamField body="text" type="string">
  合成する音声のテキスト。最大 5 万文字までに制限されます。`text_file_id` とのいずれか一方が必須です<br /><br />• フィラータグ：モデルで `speech-2.8-hd` または `speech-2.8-turbo` を選択した場合のみ、テキスト内にフィラータグを挿入できます。対応するフィラー：`(laughs)`（笑い声）、`(chuckle)`（軽い笑い）、`(coughs)`（咳）、`(clear-throat)`（咳払い）、`(groans)`（うめき声）、`(breath)`（通常の呼吸）、`(pant)`（息切れ）、`(inhale)`（吸気）、`(exhale)`（呼気）、`(gasps)`（息をのむ）、`(sniffs)`（鼻をすする）、`(sighs)`（ため息）、`(snorts)`（鼻息）、`(burps)`（げっぷ）、`(lip-smacking)`（舌鼓）、`(humming)`（鼻歌）、`(hissing)`（シューという音）、`(emm)`（ええと）、`(whistles)`（口笛）、`(sneezes)`（くしゃみ）、`(crying)`（すすり泣き）、`(applause)`（拍手）
</ParamField>

<ParamField body="text_file_id" type="integer">
  合成する音声のテキストファイル id。単一ファイルの長さは 10 万文字未満に制限され、対応ファイル形式は txt、zip です。`text` とのいずれか一方が必須で、指定後に形式が自動検証されます。<br />• **txt ファイル**：長さ制限 \<100000 文字。`&lt;#x#&gt;` マークによるカスタムポーズに対応しています。x はポーズの長さ（単位：秒）で、範囲は \[0.01, 99.99]、小数点以下は最大 2 桁まで保持できます。ポーズは音声として発音可能な 2 つのテキストの間に設定する必要があり、複数のポーズマークを連続して使用することはできません<br />• **zip ファイル**：<br />• 圧縮ファイル内には、同一形式の txt または json ファイルを含める必要があります。<br />• json ファイル形式：\[`title`, `content`, `extra`] の 3 つのフィールドに対応しており、それぞれタイトル、本文、追加情報を表します。3 つのフィールドがすべて存在する場合、3 セットの結果、合計 9 ファイルが生成され、1 つのフォルダにまとめて保存されます。いずれかのフィールドが存在しない、または内容が空の場合、そのフィールドに対応する結果は生成されません
</ParamField>

<ParamField body="voice_modify" type="object">
  <Expandable title="プロパティ" defaultOpen={true}>
    <ParamField body="pitch" type="integer">
      ピッチ調整（低い/明るい）。範囲は \[-100, 100] で、値が -100 に近いほど声はより低くなり、100 に近いほど声はより明るくなります

      値の範囲：\[-100, 100]
    </ParamField>

    <ParamField body="timbre" type="integer">
      音色調整（渋い/クリア）。範囲は \[-100, 100] で、値が -100 に近いほど声はより厚みが増し、100 に近いほど声はよりクリアになります

      値の範囲：\[-100, 100]
    </ParamField>

    <ParamField body="intensity" type="integer">
      強度調整（力強さ/柔らかさ）。範囲は \[-100, 100] で、値が -100 に近いほど声はより力強くなり、100 に近いほど声はより柔らかくなります

      値の範囲：\[-100, 100]
    </ParamField>

    <ParamField body="sound_effects" type="string">
      音響効果の設定。1 回につき 1 種類のみ選択可能です。選択可能な値：

      1. spacious\_echo（広い空間のエコー）
      2. auditorium\_echo（講堂放送）
      3. lofi\_telephone（電話の歪み）
      4. robotic（電子音声）

      選択可能な値：`spacious_echo`, `auditorium_echo`, `lofi_telephone`, `robotic`
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="audio_setting" type="object">
  <Expandable title="プロパティ" defaultOpen={true}>
    <ParamField body="format" type="string" default="mp3">
      生成される音声の形式。選択可能な範囲は \[mp3, pcm, flac]、デフォルト値は `mp3` です

      選択可能な値：`mp3`, `pcm`, `flac`
    </ParamField>

    <ParamField body="bitrate" type="integer" default={128000}>
      生成される音声のビットレート。選択可能な範囲は \[32000, 64000, 128000, 256000]、デフォルト値は `128000` です。このパラメータは `mp3` 形式の音声にのみ有効です
    </ParamField>

    <ParamField body="channel" type="integer" default={2}>
      生成される音声のチャンネル数。選択可能な範囲：\[1, 2]。`1` はモノラル、`2` はステレオを表し、デフォルト値は 1 です
    </ParamField>

    <ParamField body="audio_sample_rate" type="integer" default={32000}>
      生成される音声のサンプリングレート。選択可能な範囲は \[8000, 16000, 22050, 24000, 32000, 44100]、デフォルトは `32000` です
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="voice_setting" type="object" required={true}>
  <Expandable title="プロパティ" defaultOpen={true}>
    <ParamField body="vol" type="number" default={1}>
      合成音声の音量。値が大きいほど音量が大きくなります。値の範囲は (0, 10]、デフォルト値は 1.0 です

      値の範囲：\[0, 10]
    </ParamField>

    <ParamField body="pitch" type="integer" default={0}>
      合成音声のイントネーション。値の範囲は \[-12, 12]、デフォルト値は 0 です。0 は元の音色での出力を表します

      値の範囲：\[-12, 12]
    </ParamField>

    <ParamField body="speed" type="number" default={1}>
      合成音声の話速。値が大きいほど話速が速くなります。値の範囲は \[0.5, 2]、デフォルト値は 1.0 です

      値の範囲：\[0.5, 2]
    </ParamField>

    <ParamField body="emotion" type="string">
      合成音声の感情を制御します。パラメータ範囲は \["happy", "sad", "angry", "fearful", "disgusted", "surprised", "calm", "fluent", "whisper"] で、それぞれ 8 種類の感情に対応します：喜び、悲しみ、怒り、恐れ、嫌悪、驚き、中立、生き生き、ささやき
      <br />• モデルは入力テキストに基づいて適切な感情を自動的にマッチングするため、通常は手動指定は不要です
      <br />• このパラメータは `speech-2.6-hd`, `speech-2.6-turbo`, `speech-01-hd`, `speech-01-turbo` モデルにのみ有効です
      <br />• オプション `fluent`, `whisper` は `speech-2.6-turbo`, `speech-2.6-hd` モデルにのみ有効です

      選択可能な値：`happy`, `sad`, `angry`, `fearful`, `disgusted`, `surprised`, `calm`, `fluent`, `whisper`
    </ParamField>

    <ParamField body="voice_id" type="string" required={true}>
      合成音声の音色番号。混合音色を設定する必要がある場合は、timber\_weights パラメータを設定し、このパラメータは空値にしてください。システム音色、クローン音色、テキスト生成音色の 3 種類に対応しています。以下は最新のシステム音色（ID）の一部です。公式に対応しているすべての音色を確認できます
      <br />• **中国語**:<br />• moss\_audio\_ce44fc67-7ce3-11f0-8de5-96e35d26fb85<br />• moss\_audio\_aaa1346a-7ce7-11f0-8e61-2e6e3c7ee85d<br />• Chinese (Mandarin)\_Lyrical\_Voice<br />• Chinese (Mandarin)\_HK\_Flight\_Attendant<br />• **英語**:<br />• English\_Graceful\_Lady<br />• English\_Insightful\_Speaker<br />• English\_radiant\_girl<br />• English\_Persuasive\_Man<br />• moss\_audio\_6dc281eb-713c-11f0-a447-9613c873494c<br />• moss\_audio\_570551b1-735c-11f0-b236-0adeeecad052<br />• moss\_audio\_ad5baf92-735f-11f0-8263-fe5a2fe98ec8<br />• English\_Lucky\_Robot<br />• **日本語**:<br />• Japanese\_Whisper\_Belle<br />• moss\_audio\_24875c4a-7be4-11f0-9359-4e72c55db738<br />• moss\_audio\_7f4ee608-78ea-11f0-bb73-1e2a4cfcd245<br />• moss\_audio\_c1a6a3ac-7be6-11f0-8e8e-36b92fbb4f95
    </ParamField>

    <ParamField body="english_normalization" type="boolean" default={false}>
      英語テキストの正規化に対応します。有効にすると数字読み上げシーンでの性能を向上できますが、レイテンシがわずかに増加します。デフォルトは false です
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="aigc_watermark" type="boolean" default={false}>
  合成音声の末尾に音声リズム識別子を追加するかどうかを制御します。デフォルト値は False です。このパラメータは非ストリーミング合成にのみ有効です
</ParamField>

<ParamField body="language_boost" type="string">
  指定した少数言語および方言の認識能力を強化するかどうか。デフォルト値は `null` で、`auto` に設定するとモデルが自律的に判断します。

  選択可能な値：`Chinese`, `Chinese,Yue`, `English`, `Arabic`, `Russian`, `Spanish`, `French`, `Portuguese`, `German`, `Turkish`, `Dutch`, `Ukrainian`, `Vietnamese`, `Indonesian`, `Japanese`, `Italian`, `Korean`, `Thai`, `Polish`, `Romanian`, `Greek`, `Czech`, `Finnish`, `Hindi`, `Bulgarian`, `Danish`, `Hebrew`, `Malay`, `Persian`, `Slovak`, `Swedish`, `Croatian`, `Filipino`, `Hungarian`, `Norwegian`, `Slovenian`, `Catalan`, `Nynorsk`, `Tamil`, `Afrikaans`, `auto`
</ParamField>

<ParamField body="continuous_sound" type="boolean" default={false}>
  このパラメータを有効にすると、句の接続部分がより自然になります。`speech-2.8-hd` および `speech-2.8-turbo` モデルのみ対応しています
</ParamField>

<ParamField body="pronunciation_dict" type="object">
  <Expandable title="プロパティ" defaultOpen={true}>
    <ParamField body="tone" type="string[]">
      特別な注記が必要な文字または記号に対応するルビや発音置換ルールを定義します。中国語テキストでは、声調を数字で表します：
      一声は `1`、二声は `2`、三声は `3`、四声は `4`、軽声は `5`
      例：
      \["燕少飞/(yan4)(shao3)(fei1)", "omg/oh my god"]
    </ParamField>
  </Expandable>
</ParamField>

## レスポンス情報

<ResponseField name="file_id" type="integer" required={false}>
  タスク作成成功後に返される、対応する音声ファイルの ID。<br /><br />• タスク完了後、file\_id で照会できます。リクエストでエラーが発生した場合、このフィールドは返されません

  注意：返されるダウンロード URL は生成時から 9 時間（32400 秒）有効です。有効期限を過ぎるとファイルは無効になり、生成された情報は失われます。ダウンロード情報の時間にご注意ください
</ResponseField>

<ResponseField name="task_id" type="string" required={false}>
  task\_id を使用して [タスク結果照会 API](/ja/docs/models/reference-get-async-task-result) にリクエストし、生成された出力を取得します。
</ResponseField>

<ResponseField name="base_resp" type="object" required={false}>
  <Expandable title="プロパティ" defaultOpen={true}>
    <ResponseField name="status_msg" type="string" required={true}>
      ステータスの詳細
    </ResponseField>

    <ResponseField name="status_code" type="integer" required={true}>
      ステータスコード<br /><br />• `0`: 正常<br />• `1002`: レート制限<br />• `1004`: 認証失敗<br />• `1039`: TPM レート制限に達しました<br />• `1042`: 不正な文字が 10% 超<br />• `2013`: パラメータエラー
    </ResponseField>
  </Expandable>
</ResponseField>

<ResponseField name="task_token" type="string" required={false}>
  現在のタスクの完了に使用されたキー情報
</ResponseField>

<ResponseField name="usage_characters" type="integer" required={false}>
  課金対象文字数
</ResponseField>
