Áudio
MiniMax Speech 2.8 Turbo Síntese de fala assíncrona
POST
MiniMax Speech 2.8 Turbo Síntese de fala assíncrona
Use esta interface para criar uma tarefa assíncrona de síntese de fala. Oferece suporte a entrada por texto ou arquivo; o texto tem limite máximo de 50 mil caracteres, e arquivos têm limite máximo de 100 mil caracteres.
Cabeçalhos da requisição
string
obrigatório
Valores enumerados:
application/jsonstring
obrigatório
Formato de autenticação Bearer: Bearer {{API Key}}.
Corpo da requisição
string
Texto do áudio a ser sintetizado, com limite máximo de 50 mil caracteres. Obrigatório escolher um entre este campo e
• Tags de interjeições: somente quando o modelo selecionado for
text_file_id• Tags de interjeições: somente quando o modelo selecionado for
speech-2.8-hd ou speech-2.8-turbo, é possível inserir tags de interjeição no texto. Interjeições compatíveis: (laughs) (risada), (chuckle) (risinho), (coughs) (tosse), (clear-throat) (limpar a garganta), (groans) (gemido), (breath) (respiração normal), (pant) (ofegar), (inhale) (inspirar), (exhale) (expirar), (gasps) (inspiração súbita), (sniffs) (fungar), (sighs) (suspiro), (snorts) (bufada pelo nariz), (burps) (arroto), (lip-smacking) (estalar os lábios), (humming) (cantarolar), (hissing) (chiado), (emm) (hum), (whistles) (assobio), (sneezes) (espirro), (crying) (soluço/choro), (applause) (aplausos)integer
id do arquivo de texto do áudio a ser sintetizado; o tamanho de um único arquivo deve ser menor que 100 mil caracteres. Formatos de arquivo compatíveis: txt, zip. Obrigatório escolher um entre este campo e
• Arquivo txt: limite de tamanho <100.000 caracteres. Suporta o uso de
• Arquivo zip:
• O pacote compactado deve conter arquivos txt ou json no mesmo formato.
• Formato do arquivo json: oferece suporte aos três campos [
text; após o envio, o formato será validado automaticamente.• Arquivo txt: limite de tamanho <100.000 caracteres. Suporta o uso de
<#x#> para marcar pausas personalizadas. x é a duração da pausa (unidade: segundos), no intervalo [0.01,99.99], com no máximo duas casas decimais. Observe que a pausa deve ser definida entre dois trechos de texto que possam ser pronunciados, e várias marcações de pausa não podem ser usadas consecutivamente• Arquivo zip:
• O pacote compactado deve conter arquivos txt ou json no mesmo formato.
• Formato do arquivo json: oferece suporte aos três campos [
title, content, extra], que representam, respectivamente, título, corpo do texto e informações adicionais. Se os três campos existirem, serão gerados 3 grupos de resultados, totalizando 9 arquivos, armazenados em uma única pasta. Se algum campo não existir ou seu conteúdo estiver vazio, o resultado correspondente a esse campo não será geradoobject
object
object
obrigatório
boolean
padrão:false
Controla a adição de uma marcação rítmica de áudio ao final do áudio sintetizado; o valor padrão é False. Este parâmetro só tem efeito na síntese não streaming
string
Indica se a capacidade de reconhecimento de determinados idiomas minoritários e dialetos deve ser aprimorada. O valor padrão é
null; pode ser definido como auto para permitir que o modelo decida autonomamente.Valores opcionais: Chinese, Chinese,Yue, English, Arabic, Russian, Spanish, French, Portuguese, German, Turkish, Dutch, Ukrainian, Vietnamese, Indonesian, Japanese, Italian, Korean, Thai, Polish, Romanian, Greek, Czech, Finnish, Hindi, Bulgarian, Danish, Hebrew, Malay, Persian, Slovak, Swedish, Croatian, Filipino, Hungarian, Norwegian, Slovenian, Catalan, Nynorsk, Tamil, Afrikaans, autoboolean
padrão:false
Ative este parâmetro para tornar a conexão entre subfrases mais natural; compatível apenas com os modelos
speech-2.8-hd e speech-2.8-turboobject
Informações da resposta
string
Use task_id para solicitar a API de consulta de resultado da tarefa e recuperar a saída gerada.
object
Detalhes adicionais.