API TTA Speech 2.6 Turbo | Síntesis de voz de alta calidad de MiniMax

Síntesis de voz síncrona MiniMax Speech-2.6-turbo

curl --request POST \
  --url https://api.highwayapi.ai/v3/minimax-speech-2.6-turbo \
  --header 'Authorization: <authorization>' \
  --header 'Content-Type: <content-type>' \
  --data '
{
  "text": "<string>",
  "voice_setting": {
    "speed": 123,
    "vol": 123,
    "pitch": 123,
    "voice_id": "<string>",
    "emotion": "<string>",
    "latex_read": true,
    "text_normalization": true
  },
  "audio_setting": {
    "sample_rate": 123,
    "bitrate": 123,
    "format": "<string>",
    "channel": 123
  },
  "pronunciation_dict": {
    "tone": [
      {}
    ]
  },
  "timbre_weights": [
    {
      "voice_id": "<string>",
      "weight": 123
    }
  ],
  "stream": true,
  "stream_options": {
    "exclude_aggregated_audio": true
  },
  "language_boost": "<string>",
  "output_format": "<string>",
  "voice_modify": {
    "pitch": 123,
    "intensity": 123,
    "timbre": 123,
    "sound_effects": "<string>"
  }
}
'

import requests

url = "https://api.highwayapi.ai/v3/minimax-speech-2.6-turbo"

payload = {
    "text": "<string>",
    "voice_setting": {
        "speed": 123,
        "vol": 123,
        "pitch": 123,
        "voice_id": "<string>",
        "emotion": "<string>",
        "latex_read": True,
        "text_normalization": True
    },
    "audio_setting": {
        "sample_rate": 123,
        "bitrate": 123,
        "format": "<string>",
        "channel": 123
    },
    "pronunciation_dict": { "tone": [{}] },
    "timbre_weights": [
        {
            "voice_id": "<string>",
            "weight": 123
        }
    ],
    "stream": True,
    "stream_options": { "exclude_aggregated_audio": True },
    "language_boost": "<string>",
    "output_format": "<string>",
    "voice_modify": {
        "pitch": 123,
        "intensity": 123,
        "timbre": 123,
        "sound_effects": "<string>"
    }
}
headers = {
    "Content-Type": "<content-type>",
    "Authorization": "<authorization>"
}

response = requests.post(url, json=payload, headers=headers)

print(response.text)

const options = {
  method: 'POST',
  headers: {'Content-Type': '<content-type>', Authorization: '<authorization>'},
  body: JSON.stringify({
    text: '<string>',
    voice_setting: {
      speed: 123,
      vol: 123,
      pitch: 123,
      voice_id: '<string>',
      emotion: '<string>',
      latex_read: true,
      text_normalization: true
    },
    audio_setting: {sample_rate: 123, bitrate: 123, format: '<string>', channel: 123},
    pronunciation_dict: {tone: [{}]},
    timbre_weights: [{voice_id: '<string>', weight: 123}],
    stream: true,
    stream_options: {exclude_aggregated_audio: true},
    language_boost: '<string>',
    output_format: '<string>',
    voice_modify: {pitch: 123, intensity: 123, timbre: 123, sound_effects: '<string>'}
  })
};

fetch('https://api.highwayapi.ai/v3/minimax-speech-2.6-turbo', options)
  .then(res => res.json())
  .then(res => console.log(res))
  .catch(err => console.error(err));

<?php

$curl = curl_init();

curl_setopt_array($curl, [
  CURLOPT_URL => "https://api.highwayapi.ai/v3/minimax-speech-2.6-turbo",
  CURLOPT_RETURNTRANSFER => true,
  CURLOPT_ENCODING => "",
  CURLOPT_MAXREDIRS => 10,
  CURLOPT_TIMEOUT => 30,
  CURLOPT_HTTP_VERSION => CURL_HTTP_VERSION_1_1,
  CURLOPT_CUSTOMREQUEST => "POST",
  CURLOPT_POSTFIELDS => json_encode([
    'text' => '<string>',
    'voice_setting' => [
        'speed' => 123,
        'vol' => 123,
        'pitch' => 123,
        'voice_id' => '<string>',
        'emotion' => '<string>',
        'latex_read' => true,
        'text_normalization' => true
    ],
    'audio_setting' => [
        'sample_rate' => 123,
        'bitrate' => 123,
        'format' => '<string>',
        'channel' => 123
    ],
    'pronunciation_dict' => [
        'tone' => [
                [
                                
                ]
        ]
    ],
    'timbre_weights' => [
        [
                'voice_id' => '<string>',
                'weight' => 123
        ]
    ],
    'stream' => true,
    'stream_options' => [
        'exclude_aggregated_audio' => true
    ],
    'language_boost' => '<string>',
    'output_format' => '<string>',
    'voice_modify' => [
        'pitch' => 123,
        'intensity' => 123,
        'timbre' => 123,
        'sound_effects' => '<string>'
    ]
  ]),
  CURLOPT_HTTPHEADER => [
    "Authorization: <authorization>",
    "Content-Type: <content-type>"
  ],
]);

$response = curl_exec($curl);
$err = curl_error($curl);

curl_close($curl);

if ($err) {
  echo "cURL Error #:" . $err;
} else {
  echo $response;
}

package main

import (
	"fmt"
	"strings"
	"net/http"
	"io"
)

func main() {

	url := "https://api.highwayapi.ai/v3/minimax-speech-2.6-turbo"

	payload := strings.NewReader("{\n  \"text\": \"<string>\",\n  \"voice_setting\": {\n    \"speed\": 123,\n    \"vol\": 123,\n    \"pitch\": 123,\n    \"voice_id\": \"<string>\",\n    \"emotion\": \"<string>\",\n    \"latex_read\": true,\n    \"text_normalization\": true\n  },\n  \"audio_setting\": {\n    \"sample_rate\": 123,\n    \"bitrate\": 123,\n    \"format\": \"<string>\",\n    \"channel\": 123\n  },\n  \"pronunciation_dict\": {\n    \"tone\": [\n      {}\n    ]\n  },\n  \"timbre_weights\": [\n    {\n      \"voice_id\": \"<string>\",\n      \"weight\": 123\n    }\n  ],\n  \"stream\": true,\n  \"stream_options\": {\n    \"exclude_aggregated_audio\": true\n  },\n  \"language_boost\": \"<string>\",\n  \"output_format\": \"<string>\",\n  \"voice_modify\": {\n    \"pitch\": 123,\n    \"intensity\": 123,\n    \"timbre\": 123,\n    \"sound_effects\": \"<string>\"\n  }\n}")

	req, _ := http.NewRequest("POST", url, payload)

	req.Header.Add("Content-Type", "<content-type>")
	req.Header.Add("Authorization", "<authorization>")

	res, _ := http.DefaultClient.Do(req)

	defer res.Body.Close()
	body, _ := io.ReadAll(res.Body)

	fmt.Println(string(body))

}

HttpResponse<String> response = Unirest.post("https://api.highwayapi.ai/v3/minimax-speech-2.6-turbo")
  .header("Content-Type", "<content-type>")
  .header("Authorization", "<authorization>")
  .body("{\n  \"text\": \"<string>\",\n  \"voice_setting\": {\n    \"speed\": 123,\n    \"vol\": 123,\n    \"pitch\": 123,\n    \"voice_id\": \"<string>\",\n    \"emotion\": \"<string>\",\n    \"latex_read\": true,\n    \"text_normalization\": true\n  },\n  \"audio_setting\": {\n    \"sample_rate\": 123,\n    \"bitrate\": 123,\n    \"format\": \"<string>\",\n    \"channel\": 123\n  },\n  \"pronunciation_dict\": {\n    \"tone\": [\n      {}\n    ]\n  },\n  \"timbre_weights\": [\n    {\n      \"voice_id\": \"<string>\",\n      \"weight\": 123\n    }\n  ],\n  \"stream\": true,\n  \"stream_options\": {\n    \"exclude_aggregated_audio\": true\n  },\n  \"language_boost\": \"<string>\",\n  \"output_format\": \"<string>\",\n  \"voice_modify\": {\n    \"pitch\": 123,\n    \"intensity\": 123,\n    \"timbre\": 123,\n    \"sound_effects\": \"<string>\"\n  }\n}")
  .asString();

require 'uri'
require 'net/http'

url = URI("https://api.highwayapi.ai/v3/minimax-speech-2.6-turbo")

http = Net::HTTP.new(url.host, url.port)
http.use_ssl = true

request = Net::HTTP::Post.new(url)
request["Content-Type"] = '<content-type>'
request["Authorization"] = '<authorization>'
request.body = "{\n  \"text\": \"<string>\",\n  \"voice_setting\": {\n    \"speed\": 123,\n    \"vol\": 123,\n    \"pitch\": 123,\n    \"voice_id\": \"<string>\",\n    \"emotion\": \"<string>\",\n    \"latex_read\": true,\n    \"text_normalization\": true\n  },\n  \"audio_setting\": {\n    \"sample_rate\": 123,\n    \"bitrate\": 123,\n    \"format\": \"<string>\",\n    \"channel\": 123\n  },\n  \"pronunciation_dict\": {\n    \"tone\": [\n      {}\n    ]\n  },\n  \"timbre_weights\": [\n    {\n      \"voice_id\": \"<string>\",\n      \"weight\": 123\n    }\n  ],\n  \"stream\": true,\n  \"stream_options\": {\n    \"exclude_aggregated_audio\": true\n  },\n  \"language_boost\": \"<string>\",\n  \"output_format\": \"<string>\",\n  \"voice_modify\": {\n    \"pitch\": 123,\n    \"intensity\": 123,\n    \"timbre\": 123,\n    \"sound_effects\": \"<string>\"\n  }\n}"

response = http.request(request)
puts response.read_body

{
  "audio": "<string>",
  "status": 123
}

POST

minimax-speech-2.6-turbo

Síntesis de voz síncrona MiniMax Speech-2.6-turbo

curl --request POST \
  --url https://api.highwayapi.ai/v3/minimax-speech-2.6-turbo \
  --header 'Authorization: <authorization>' \
  --header 'Content-Type: <content-type>' \
  --data '
{
  "text": "<string>",
  "voice_setting": {
    "speed": 123,
    "vol": 123,
    "pitch": 123,
    "voice_id": "<string>",
    "emotion": "<string>",
    "latex_read": true,
    "text_normalization": true
  },
  "audio_setting": {
    "sample_rate": 123,
    "bitrate": 123,
    "format": "<string>",
    "channel": 123
  },
  "pronunciation_dict": {
    "tone": [
      {}
    ]
  },
  "timbre_weights": [
    {
      "voice_id": "<string>",
      "weight": 123
    }
  ],
  "stream": true,
  "stream_options": {
    "exclude_aggregated_audio": true
  },
  "language_boost": "<string>",
  "output_format": "<string>",
  "voice_modify": {
    "pitch": 123,
    "intensity": 123,
    "timbre": 123,
    "sound_effects": "<string>"
  }
}
'

import requests

url = "https://api.highwayapi.ai/v3/minimax-speech-2.6-turbo"

payload = {
    "text": "<string>",
    "voice_setting": {
        "speed": 123,
        "vol": 123,
        "pitch": 123,
        "voice_id": "<string>",
        "emotion": "<string>",
        "latex_read": True,
        "text_normalization": True
    },
    "audio_setting": {
        "sample_rate": 123,
        "bitrate": 123,
        "format": "<string>",
        "channel": 123
    },
    "pronunciation_dict": { "tone": [{}] },
    "timbre_weights": [
        {
            "voice_id": "<string>",
            "weight": 123
        }
    ],
    "stream": True,
    "stream_options": { "exclude_aggregated_audio": True },
    "language_boost": "<string>",
    "output_format": "<string>",
    "voice_modify": {
        "pitch": 123,
        "intensity": 123,
        "timbre": 123,
        "sound_effects": "<string>"
    }
}
headers = {
    "Content-Type": "<content-type>",
    "Authorization": "<authorization>"
}

response = requests.post(url, json=payload, headers=headers)

print(response.text)

const options = {
  method: 'POST',
  headers: {'Content-Type': '<content-type>', Authorization: '<authorization>'},
  body: JSON.stringify({
    text: '<string>',
    voice_setting: {
      speed: 123,
      vol: 123,
      pitch: 123,
      voice_id: '<string>',
      emotion: '<string>',
      latex_read: true,
      text_normalization: true
    },
    audio_setting: {sample_rate: 123, bitrate: 123, format: '<string>', channel: 123},
    pronunciation_dict: {tone: [{}]},
    timbre_weights: [{voice_id: '<string>', weight: 123}],
    stream: true,
    stream_options: {exclude_aggregated_audio: true},
    language_boost: '<string>',
    output_format: '<string>',
    voice_modify: {pitch: 123, intensity: 123, timbre: 123, sound_effects: '<string>'}
  })
};

fetch('https://api.highwayapi.ai/v3/minimax-speech-2.6-turbo', options)
  .then(res => res.json())
  .then(res => console.log(res))
  .catch(err => console.error(err));

<?php

$curl = curl_init();

curl_setopt_array($curl, [
  CURLOPT_URL => "https://api.highwayapi.ai/v3/minimax-speech-2.6-turbo",
  CURLOPT_RETURNTRANSFER => true,
  CURLOPT_ENCODING => "",
  CURLOPT_MAXREDIRS => 10,
  CURLOPT_TIMEOUT => 30,
  CURLOPT_HTTP_VERSION => CURL_HTTP_VERSION_1_1,
  CURLOPT_CUSTOMREQUEST => "POST",
  CURLOPT_POSTFIELDS => json_encode([
    'text' => '<string>',
    'voice_setting' => [
        'speed' => 123,
        'vol' => 123,
        'pitch' => 123,
        'voice_id' => '<string>',
        'emotion' => '<string>',
        'latex_read' => true,
        'text_normalization' => true
    ],
    'audio_setting' => [
        'sample_rate' => 123,
        'bitrate' => 123,
        'format' => '<string>',
        'channel' => 123
    ],
    'pronunciation_dict' => [
        'tone' => [
                [
                                
                ]
        ]
    ],
    'timbre_weights' => [
        [
                'voice_id' => '<string>',
                'weight' => 123
        ]
    ],
    'stream' => true,
    'stream_options' => [
        'exclude_aggregated_audio' => true
    ],
    'language_boost' => '<string>',
    'output_format' => '<string>',
    'voice_modify' => [
        'pitch' => 123,
        'intensity' => 123,
        'timbre' => 123,
        'sound_effects' => '<string>'
    ]
  ]),
  CURLOPT_HTTPHEADER => [
    "Authorization: <authorization>",
    "Content-Type: <content-type>"
  ],
]);

$response = curl_exec($curl);
$err = curl_error($curl);

curl_close($curl);

if ($err) {
  echo "cURL Error #:" . $err;
} else {
  echo $response;
}

package main

import (
	"fmt"
	"strings"
	"net/http"
	"io"
)

func main() {

	url := "https://api.highwayapi.ai/v3/minimax-speech-2.6-turbo"

	payload := strings.NewReader("{\n  \"text\": \"<string>\",\n  \"voice_setting\": {\n    \"speed\": 123,\n    \"vol\": 123,\n    \"pitch\": 123,\n    \"voice_id\": \"<string>\",\n    \"emotion\": \"<string>\",\n    \"latex_read\": true,\n    \"text_normalization\": true\n  },\n  \"audio_setting\": {\n    \"sample_rate\": 123,\n    \"bitrate\": 123,\n    \"format\": \"<string>\",\n    \"channel\": 123\n  },\n  \"pronunciation_dict\": {\n    \"tone\": [\n      {}\n    ]\n  },\n  \"timbre_weights\": [\n    {\n      \"voice_id\": \"<string>\",\n      \"weight\": 123\n    }\n  ],\n  \"stream\": true,\n  \"stream_options\": {\n    \"exclude_aggregated_audio\": true\n  },\n  \"language_boost\": \"<string>\",\n  \"output_format\": \"<string>\",\n  \"voice_modify\": {\n    \"pitch\": 123,\n    \"intensity\": 123,\n    \"timbre\": 123,\n    \"sound_effects\": \"<string>\"\n  }\n}")

	req, _ := http.NewRequest("POST", url, payload)

	req.Header.Add("Content-Type", "<content-type>")
	req.Header.Add("Authorization", "<authorization>")

	res, _ := http.DefaultClient.Do(req)

	defer res.Body.Close()
	body, _ := io.ReadAll(res.Body)

	fmt.Println(string(body))

}

HttpResponse<String> response = Unirest.post("https://api.highwayapi.ai/v3/minimax-speech-2.6-turbo")
  .header("Content-Type", "<content-type>")
  .header("Authorization", "<authorization>")
  .body("{\n  \"text\": \"<string>\",\n  \"voice_setting\": {\n    \"speed\": 123,\n    \"vol\": 123,\n    \"pitch\": 123,\n    \"voice_id\": \"<string>\",\n    \"emotion\": \"<string>\",\n    \"latex_read\": true,\n    \"text_normalization\": true\n  },\n  \"audio_setting\": {\n    \"sample_rate\": 123,\n    \"bitrate\": 123,\n    \"format\": \"<string>\",\n    \"channel\": 123\n  },\n  \"pronunciation_dict\": {\n    \"tone\": [\n      {}\n    ]\n  },\n  \"timbre_weights\": [\n    {\n      \"voice_id\": \"<string>\",\n      \"weight\": 123\n    }\n  ],\n  \"stream\": true,\n  \"stream_options\": {\n    \"exclude_aggregated_audio\": true\n  },\n  \"language_boost\": \"<string>\",\n  \"output_format\": \"<string>\",\n  \"voice_modify\": {\n    \"pitch\": 123,\n    \"intensity\": 123,\n    \"timbre\": 123,\n    \"sound_effects\": \"<string>\"\n  }\n}")
  .asString();

require 'uri'
require 'net/http'

url = URI("https://api.highwayapi.ai/v3/minimax-speech-2.6-turbo")

http = Net::HTTP.new(url.host, url.port)
http.use_ssl = true

request = Net::HTTP::Post.new(url)
request["Content-Type"] = '<content-type>'
request["Authorization"] = '<authorization>'
request.body = "{\n  \"text\": \"<string>\",\n  \"voice_setting\": {\n    \"speed\": 123,\n    \"vol\": 123,\n    \"pitch\": 123,\n    \"voice_id\": \"<string>\",\n    \"emotion\": \"<string>\",\n    \"latex_read\": true,\n    \"text_normalization\": true\n  },\n  \"audio_setting\": {\n    \"sample_rate\": 123,\n    \"bitrate\": 123,\n    \"format\": \"<string>\",\n    \"channel\": 123\n  },\n  \"pronunciation_dict\": {\n    \"tone\": [\n      {}\n    ]\n  },\n  \"timbre_weights\": [\n    {\n      \"voice_id\": \"<string>\",\n      \"weight\": 123\n    }\n  ],\n  \"stream\": true,\n  \"stream_options\": {\n    \"exclude_aggregated_audio\": true\n  },\n  \"language_boost\": \"<string>\",\n  \"output_format\": \"<string>\",\n  \"voice_modify\": {\n    \"pitch\": 123,\n    \"intensity\": 123,\n    \"timbre\": 123,\n    \"sound_effects\": \"<string>\"\n  }\n}"

response = http.request(request)
puts response.read_body

{
  "audio": "<string>",
  "status": 123
}

Esta API admite la generación síncrona de texto a voz, con una transmisión máxima de 10000 caracteres por texto. Admite más de 100 voces del sistema y selección autónoma de voces clonadas; admite ajuste de volumen, entonación, velocidad y formato de salida; admite mezcla proporcional, control de intervalos fijos; admite múltiples especificaciones y formatos de audio, incluidos: mp3, pcm, flac, wav, y admite salida en streaming. Después de enviar una solicitud de síntesis de voz de texto largo, tenga en cuenta que la URL devuelta tiene una validez de 24 horas desde el momento en que se devuelve la URL. Preste atención al tiempo de descarga de la información.

Adecuada para escenarios como generación de frases cortas, chat de voz y redes sociales en línea; el tiempo de procesamiento es corto, pero el límite de longitud del texto es inferior a 10000 caracteres. Para textos largos, se recomienda usar síntesis de voz mediante llamada asíncrona.

Encabezados de solicitud

string

requerido

Valores enumerados: application/json

string

requerido

Formato de autenticación Bearer: Bearer {{API Key}}.

Cuerpo de la solicitud

string

requerido

Texto que se va a sintetizar, con un límite de longitud inferior a 10000 caracteres; los cambios de párrafo se sustituyen por saltos de línea. (Si necesita controlar el intervalo de tiempo en la voz, agregue <#x#> entre caracteres; la unidad de x es segundos, admite 0.01-99.99, con un máximo de dos decimales). Admite intervalos de tiempo de voz personalizados entre textos para lograr el efecto de pausas de voz personalizadas en el texto. Tenga en cuenta que el intervalo de tiempo entre textos debe establecerse entre dos textos que puedan pronunciarse, y no se pueden establecer varios intervalos de tiempo consecutivos.

object

requerido

Mostrar propiedades

float

predeterminado:"1.0"

Rango [0.5,2], el valor predeterminado es 1.0Velocidad de habla de la voz generada. Opcional. Cuanto mayor sea el valor, más rápida será la velocidad.

float

predeterminado:"1.0"

Rango (0,10], el valor predeterminado es 1.0Volumen de la voz generada. Opcional. Cuanto mayor sea el valor, más alto será el volumen.

int

predeterminado:"0"

Rango [-12,12], el valor predeterminado es 0Entonación de la voz generada. Opcional. (0 corresponde a la salida de la voz original; el valor debe ser un entero).

string

ID de la voz solicitada. Obligatorio elegir uno entre este parámetro y timbre_weights.Admite dos tipos: voces del sistema (id) y voces clonadas (id). Las voces del sistema (ID) son las siguientes:

Voz de joven inexperto: male-qn-qingse
Voz de joven de élite: male-qn-jingying
Voz de joven dominante: male-qn-badao
Voz de estudiante universitario joven: male-qn-daxuesheng
Voz de chica joven: female-shaonv
Voz de mujer madura y elegante: female-yujie
Voz de mujer madura: female-chengshu
Voz de mujer dulce: female-tianmei
Presentador masculino: presenter_male
Presentadora femenina: presenter_female
Audiolibro masculino 1: audiobook_male_1
Audiolibro masculino 2: audiobook_male_2
Audiolibro femenino 1: audiobook_female_1
Audiolibro femenino 2: audiobook_female_2
Voz de joven inexperto-beta: male-qn-qingse-jingpin
Voz de joven de élite-beta: male-qn-jingying-jingpin
Voz de joven dominante-beta: male-qn-badao-jingpin
Voz de estudiante universitario joven-beta: male-qn-daxuesheng-jingpin
Voz de chica joven-beta: female-shaonv-jingpin
Voz de mujer madura y elegante-beta: female-yujie-jingpin
Voz de mujer madura-beta: female-chengshu-jingpin
Voz de mujer dulce-beta: female-tianmei-jingpin
Niño inteligente: clever_boy
Niño adorable: cute_boy
Niña encantadora: lovely_girl
Cerdito de dibujos animados Xiaoqi: cartoon_pig
Hermano menor yandere: bingjiao_didi
Novio apuesto: junlang_nanyou
Estudiante menor inocente: chunzhen_xuedi
Estudiante mayor distante: lengdan_xiongzhang
Joven señor dominante: badao_shaoye
Dulce Xiaoling: tianxin_xiaoling
Chica mona y juguetona: qiaopi_mengmei
Mujer madura seductora: wumei_yujie
Estudiante menor melosa: diadia_xuemei
Estudiante mayor elegante: danya_xuejie
Santa Claus: Santa_Claus
Grinch: Grinch
Rudolph: Rudolph
Arnold: Arnold
Charming Santa: Charming_Santa
Charming Lady: Charming_Lady
Sweet Girl: Sweet_Girl
Cute Elf: Cute_Elf
Attractive Girl: Attractive_Girl
Serene Woman: Serene_Woman

string

Controla la emoción de la voz sintetizada;Actualmente admite 7 emociones: feliz, triste, enojado, temeroso, asqueado, sorprendido y neutral;Rango de parámetros: ["happy", "sad", "angry", "fearful", "disgusted", "surprised", "neutral"]

bool

predeterminado:"false"

Controla si se admite la lectura de fórmulas latex. El valor predeterminado es false.Tenga en cuenta:

Las fórmulas en la solicitud deben llevar $$ al inicio y al final;
Si una fórmula en la solicitud contiene "", debe escaparse como ”\”.

Ejemplo: la fórmula básica de la derivada es $$\\frac{d}{dx}(x^n) = nx^{n-1}$$

bool

predeterminado:"false"

Este parámetro admite la normalización de texto en inglés y puede mejorar el rendimiento en escenarios de lectura de números, aunque aumentará ligeramente la latencia. Si no se proporciona, el valor predeterminado es false.

object

Mostrar propiedades

int

predeterminado:"32000"

Rango【8000，16000，22050，24000，32000，44100】Frecuencia de muestreo de la voz generada. Opcional, el valor predeterminado es 32000.

int

predeterminado:"128000"

Rango【32000，64000，128000，256000】Bitrate de la voz generada. Opcional, el valor predeterminado es 128000. Este parámetro solo tiene efecto para audio en formato mp3.

string

predeterminado:"mp3"

Formato de audio generado. El valor predeterminado es mp3, rango [mp3,pcm,flac,wav]. wav solo se admite en salida no streaming.

int

predeterminado:"1"

Número de canales del audio generado. El valor predeterminado es 1: mono. Opciones:1: mono2: estéreo

object

Mostrar propiedades

list

Sustituye texto, símbolos y sus pronunciaciones correspondientes que requieren anotación especial.Sustitución de pronunciación (ajuste de tono / sustitución por la pronunciación de otros caracteres), con el siguiente formato:["燕少飞/(yan4)(shao3)(fei1)","达菲/(da2)(fei1)"，"omg/oh my god"]Los tonos se representan con números: el primer tono (yinping) es 1, el segundo tono (yangping) es 2, el tercer tono (shangsheng) es 3, el cuarto tono (qusheng) es 4, y el tono neutro es 5.

object[]

Obligatorio elegir uno entre este parámetro y voice_id

Mostrar propiedades

string

ID de la voz solicitada. Debe completarse junto con el parámetro weight.

int

Rango [1,100]Peso. Debe completarse junto con voice_id. Admite mezclar hasta 4 voces. El valor debe ser un entero; cuanto mayor sea la proporción de una voz individual, más se parecerá la voz sintetizada a esa voz.

boolean

predeterminado:"false"

Indica si se usa streaming. El valor predeterminado es false, es decir, el streaming no está habilitado.

object

Mostrar propiedades

boolean

predeterminado:"false"

Cuando este parámetro se establece en True, el último chunk del streaming no incluirá los datos hex de la voz completa concatenada. El valor predeterminado es False, es decir, el último chunk incluye los datos hex de la voz completa concatenada.

string

predeterminado:"null"

Mejora la capacidad de reconocimiento para idiomas minoritarios y dialectos especificados. Después de configurarlo, puede mejorar el rendimiento de voz en escenarios del idioma minoritario/dialecto especificado. Si no está claro el tipo de idioma minoritario, puede elegir “auto” y el modelo determinará automáticamente el tipo de idioma minoritario. Admite los siguientes valores:

'Chinese', 'Chinese,Yue', 'English', 'Arabic', 'Russian', 'Spanish', 'French', 'Portuguese', 'German', 'Turkish', 'Dutch', 'Ukrainian', 'Vietnamese', 'Indonesian', 'Japanese', 'Italian', 'Korean', 'Thai', 'Polish', 'Romanian', 'Greek', 'Czech', 'Finnish', 'Hindi', 'Bulgarian', 'Danish', 'Hebrew', 'Malay', 'Persian', 'Slovak', 'Swedish', 'Croatian', 'Filipino', 'Hungarian', 'Norwegian', 'Slovenian', 'Catalan', 'Nynorsk', 'Tamil', 'Afrikaans', 'auto'

string

predeterminado:"hex"

Parámetro que controla la forma del resultado de salida. Los valores opcionales son url hex. El valor predeterminado es hex. Este parámetro solo tiene efecto en escenarios no streaming; los escenarios streaming solo admiten devolver en forma hex. La URL devuelta es válida durante 24 horas.

object

Configuración de efectos de voz. Este parámetro admite los siguientes formatos de audio:

No streaming: mp3, wav, flac
Streaming: mp3

Mostrar propiedades

integer

Ajuste de tono (grave/brillante), rango [-100,100]. Cuanto más se acerque el valor a -100, más grave será la voz; cuanto más se acerque a 100, más brillante será la voz

integer

Ajuste de intensidad (potente/suave), rango [-100,100]. Cuanto más se acerque el valor a -100, más enérgica será la voz; cuanto más se acerque a 100, más suave será la voz

integer

Ajuste de timbre (magnético/nítido), rango [-100,100]. Cuanto más se acerque el valor a -100, más profunda será la voz; cuanto más se acerque el valor a 100, más nítida será la voz

string

Configuración de efectos de sonido. Solo se puede seleccionar uno por solicitud. Valores opcionales:

spacious_echo（eco en espacio abierto）
auditorium_echo（difusión de auditorio）
lofi_telephone（distorsión telefónica）
robotic（sonido electrónico）

Información de respuesta

string

Fragmento de audio sintetizado, codificado en hex, generado según el formato definido en la entrada (audio_setting.format) (mp3/pcm/flac). La forma de retorno se basa en la definición de output_format; cuando stream es true, solo se admite el retorno en formato hex.

number

Estado actual del flujo de audio, devuelto solo cuando stream es true. 1 indica que la síntesis está en curso, 2 indica que la síntesis ha finalizado.

Síntesis de voz asíncrona MiniMax Speech-2.6-hd

Síntesis de voz asíncrona MiniMax Speech-2.6-turbo

Conceptos básicos de API

Modelos de lenguaje

Imágenes

Vídeo

Audio

Síntesis de voz síncrona MiniMax Speech-2.6-turbo

Encabezados de solicitud

Cuerpo de la solicitud

Información de respuesta

​Encabezados de solicitud

​Cuerpo de la solicitud

​Información de respuesta

Encabezados de solicitud

Cuerpo de la solicitud

Información de respuesta