Skip to main content
POST
Criar solicitação de conversa
Gera uma resposta do modelo com base no prompt e nos parâmetros especificados

Cabeçalhos da requisição

string
obrigatório
Valores enumerados: application/json
string
obrigatório
Formato de autenticação Bearer: Bearer {{API Key}}.

Corpo da requisição

string
obrigatório
O nome do modelo correspondente. Para nomes de modelos disponíveis, consulte a biblioteca de modelos em: JieKou AI.
string
obrigatório
O prompt usado para gerar a conversa (o prompt pode ser uma string, um array de strings, um array de tokens ou um array de arrays de tokens).
integer
O número máximo de tokens que podem ser produzidos ao gerar a conversa.
A quantidade de tokens do prompt somada a max_tokens não pode exceder o tamanho de contexto do modelo.
boolean | null
Se deve usar transmissão em streaming. O padrão é false; se definido, os tokens serão enviados como data-only server-sent events (SSE) e o fluxo será encerrado com uma mensagem data: [DONE].
object
Opções de resposta em streaming. Defina apenas quando stream estiver definido como true.
integer | null
Quantas conversas gerar para cada prompt. O valor padrão é 1.

Observação: como este parâmetro gera várias conversas, ele pode consumir rapidamente sua cota de cobrança de tokens. Use com cautela e certifique-se de definir valores razoáveis para max_tokens e stop.
Intervalo exigido: 1 < x < 128
integer | null
Se especificado, nosso sistema fará o melhor esforço para realizar amostragem determinística, de modo que requisições repetidas com o mesmo seed e os mesmos parâmetros devem retornar o mesmo resultado.
number | null
O valor padrão é 0. Valores positivos penalizam novos tokens com base em sua frequência de ocorrência no texto atual, reduzindo a probabilidade de o modelo repetir o mesmo conteúdo.

Se o objetivo for apenas reduzir amostras repetidas, valores razoáveis ficam aproximadamente entre 0.1 e 1. Se o objetivo for suprimir fortemente a repetição, o coeficiente pode ser aumentado para 2, mas isso pode reduzir perceptivelmente a qualidade da amostra. Valores negativos podem ser usados para aumentar a probabilidade de repetição.

Veja também presence_penalty, usado para penalizar tokens que aparecem pelo menos uma vez a uma taxa fixa
Intervalo exigido: -2 < x < 2
number | null
O valor padrão é 0. Valores positivos penalizam novos tokens com base em eles aparecerem ou não no texto atual, aumentando a probabilidade de o modelo falar sobre novos tópicos.

Se o objetivo for reduzir ligeiramente amostras repetidas, valores razoáveis ficam aproximadamente entre 0.1 e 1. Se o objetivo for suprimir fortemente a repetição, o coeficiente pode ser aumentado para 2, mas isso pode reduzir significativamente a qualidade da amostra. Valores negativos podem ser usados para aumentar a probabilidade de repetição.

Veja também frequency_penalty, usado para penalizar tokens a uma taxa crescente com base na frequência com que aparecem
Intervalo exigido: -2 < x < 2
number | null
Aplica uma penalidade a tokens repetidos para suprimir ou incentivar a repetição. Um valor de 1.0 significa sem penalidade, permitindo repetição livre. Valores maiores que 1.0 penalizam a repetição, reduzindo a probabilidade de tokens repetidos. Valores entre 0.0 e 1.0 recompensam a repetição, aumentando a chance de tokens repetidos. Para alcançar um bom equilíbrio, geralmente recomenda-se usar 1.2. Observe que, em modelos somente decodificador, a penalidade é aplicada tanto à saída gerada quanto ao prompt.
Intervalo exigido: 0 < x < 2
string | null
Até 4 sequências nas quais a API interromperá a geração de mais tokens. O texto retornado contém a sequência de parada.
number | null
O grau de aleatoriedade na conversa, com valor padrão 1, entre 0 e 2. Valores mais altos (como 0.8) tornam a saída mais aleatória, enquanto valores mais baixos (como 0.2) tornam a saída mais focada e determinística.

Geralmente recomendamos ajustar apenas este parâmetro ou top_p, não ambos ao mesmo tempo.
Intervalo exigido: 0 < x < 2
number | null
Como alternativa a temperature, chamado de nucleus sampling, o modelo considera os resultados dos tokens com massa de probabilidade top_p. Portanto, 0.1 significa considerar apenas os tokens que compõem os 10% superiores da massa de probabilidade. Geralmente recomendamos ajustar apenas este parâmetro ou temperature, não ambos ao mesmo tempo.
Intervalo exigido: 0 < x ≤ 1
integer | null
A amostragem Top-k é outro método de amostragem no qual os k próximos tokens mais prováveis são filtrados, e a massa de probabilidade é redistribuída apenas entre esses k tokens. O valor de k controla o número de candidatos ao próximo token em cada etapa da geração de texto.
Intervalo exigido: 1 < x < 128
number | null
Um valor flutuante que representa a probabilidade mínima para que um token seja considerado, em relação à probabilidade do token mais provável.
Intervalo exigido: 0 ≤ x ≤ 1
map[string, integer]
O padrão é null. Modifica a probabilidade de tokens especificados aparecerem na conversa. Aceita um objeto JSON que mapeia tokens para um valor de viés associado de -100 a 100.
integer | null
Retorna as probabilidades logarítmicas dos logprobs tokens de saída mais prováveis, incluindo também a probabilidade do token selecionado. Por exemplo, se logprobs for definido como 5, a API retornará uma lista das probabilidades logarítmicas dos 5 tokens mais prováveis em cada etapa de geração.
O valor máximo de logprobs é 5.
integer
O padrão é 1. Gera best_of conversas e as processa no servidor, retornando a “melhor” (ou seja, aquela com a maior probabilidade logarítmica por token). Os resultados não podem ser transmitidos em streaming.

Quando usado com n, best_of controla o número de conversas candidatas, e n especifica quantas conversas retornar. best_of deve ser maior que n.

Observação: como este parâmetro gera várias conversas, ele pode consumir rapidamente sua cota de cobrança de tokens. Use com cautela e certifique-se de definir valores razoáveis para max_tokens e stop.

Informações da resposta

object[]
obrigatório
Lista de opções de conversa geradas.
integer
obrigatório
Timestamp Unix em que a resposta foi gerada (em segundos).
string
obrigatório
Identificador exclusivo da resposta.
string
obrigatório
Modelo usado para a conversa.
string
obrigatório
Tipo de objeto, sempre text_completion.
object
obrigatório
Estatísticas de uso.
Para respostas em streaming, o campo usage é incluído no último bloco de resposta retornado.