Saltar al contenido principal
POST
Crear solicitud de conversación
Genera una respuesta del modelo según el prompt y los parámetros especificados

Encabezados de solicitud

Content-Type
string
requerido
Valores enumerados: application/json
Authorization
string
requerido
Formato de autenticación Bearer: Bearer {{API Key}}.

Cuerpo de la solicitud

model
string
requerido
Nombre del modelo correspondiente. Para consultar los nombres de modelos disponibles, consulta la biblioteca de modelos en JieKou AI.
prompt
string
requerido
Prompt utilizado para generar la conversación (el prompt puede ser una cadena, un array de cadenas, un array de tokens o un array de arrays de tokens).
max_tokens
integer
Número máximo de tokens que se pueden generar al crear la conversación.
La cantidad de tokens del prompt más max_tokens no puede superar la longitud de contexto del modelo.
stream
boolean | null
Indica si se usa transmisión en streaming. El valor predeterminado es false; si se establece, los tokens se enviarán como data-only server-sent events (SSE) y el flujo finalizará con un mensaje data: [DONE].
stream_options
object
Opciones de respuesta en streaming. Solo se establece cuando stream está configurado como true.
n
integer | null
Cuántas conversaciones generar para cada prompt. El valor predeterminado es 1.

Nota: dado que este parámetro genera varias conversaciones, puede consumir rápidamente tu cuota de facturación de tokens. Úsalo con precaución y asegúrate de establecer valores razonables para max_tokens y stop.
Rango requerido: 1 < x < 128
seed
integer | null
Si se especifica, nuestro sistema hará todo lo posible para realizar un muestreo determinista, de modo que las solicitudes repetidas con la misma seed y los mismos parámetros deberían devolver el mismo resultado.
frequency_penalty
number | null
El valor predeterminado es 0. Los valores positivos penalizan los nuevos tokens según su frecuencia de aparición en el texto actual, reduciendo así la probabilidad de que el modelo repita el mismo contenido.

Si el objetivo es simplemente reducir muestras repetitivas, los valores razonables están aproximadamente entre 0.1 y 1. Si el objetivo es inhibir fuertemente la repetición, el coeficiente puede aumentarse hasta 2, pero esto puede reducir notablemente la calidad de las muestras. Los valores negativos pueden usarse para aumentar la probabilidad de repetición.

Consulta también presence_penalty, que penaliza a una tasa fija los tokens que aparecen al menos una vez
Rango requerido: -2 < x < 2
presence_penalty
number | null
El valor predeterminado es 0. Los valores positivos penalizan los nuevos tokens según si aparecen en el texto actual, aumentando así la probabilidad de que el modelo hable de temas nuevos.

Si el objetivo es reducir ligeramente las muestras repetitivas, los valores razonables están aproximadamente entre 0.1 y 1. Si el objetivo es inhibir fuertemente la repetición, el coeficiente puede aumentarse hasta 2, pero esto puede reducir significativamente la calidad de las muestras. Los valores negativos pueden usarse para aumentar la probabilidad de repetición.

Consulta también frequency_penalty, que penaliza a una tasa incremental según la frecuencia con la que aparecen los tokens
Rango requerido: -2 < x < 2
repetition_penalty
number | null
Aplica una penalización a los tokens repetidos para inhibir o fomentar la repetición. Un valor de 1.0 significa que no hay penalización y permite la repetición libre. Los valores mayores que 1.0 penalizan la repetición, reduciendo la probabilidad de tokens repetidos. Los valores entre 0.0 y 1.0 recompensan la repetición, aumentando la probabilidad de tokens repetidos. Para lograr un buen equilibrio, normalmente se recomienda usar 1.2. Ten en cuenta que, en modelos solo decodificadores, la penalización se aplica tanto a la salida generada como al prompt.
Rango requerido: 0 < x < 2
stop
string | null
Hasta 4 secuencias en las que la API dejará de generar más tokens. El texto devuelto incluye la secuencia de parada.
temperature
number | null
Grado de aleatoriedad en la conversación; el valor predeterminado es 1 y está entre 0 y 2. Los valores más altos (como 0.8) hacen que la salida sea más aleatoria, mientras que los valores más bajos (como 0.2) hacen que la salida sea más enfocada y determinista.

Por lo general, recomendamos ajustar solo este parámetro o top_p, pero no ambos al mismo tiempo.
Rango requerido: 0 < x < 2
top_p
number | null
Como alternativa a temperature, llamada nucleus sampling, el modelo considera los resultados de los tokens con una masa de probabilidad top_p. Por lo tanto, 0.1 significa que solo se consideran los tokens que constituyen el 10% superior de la masa de probabilidad. Por lo general, recomendamos ajustar solo este parámetro o temperature, pero no ambos al mismo tiempo.
Rango requerido: 0 < x ≤ 1
top_k
integer | null
El muestreo Top-k es otro método de muestreo en el que se filtran los k tokens siguientes más probables y la masa de probabilidad se redistribuye únicamente entre esos k tokens. El valor de k controla la cantidad de candidatos para el siguiente token en cada paso de generación de texto.
Rango requerido: 1 < x < 128
min_p
number | null
Valor flotante que representa la probabilidad mínima para que un token sea considerado, en relación con la probabilidad del token más probable.
Rango requerido: 0 ≤ x ≤ 1
logit_bias
map[string, integer]
El valor predeterminado es null. Modifica la probabilidad de que los tokens especificados aparezcan en la conversación. Acepta un objeto JSON que asigna tokens a un valor de sesgo asociado de -100 a 100.
logprobs
integer | null
Devuelve las probabilidades logarítmicas de los logprobs tokens de salida más probables, incluyendo también la probabilidad del token seleccionado. Por ejemplo, si logprobs se establece en 5, la API devolverá una lista de las probabilidades logarítmicas de los 5 tokens más probables en cada paso de generación.
El valor máximo de logprobs es 5.
best_of
integer
El valor predeterminado es 1. Genera best_of conversaciones y las procesa en el servidor, devolviendo la “mejor” (es decir, la que tiene la probabilidad logarítmica más alta por token). Los resultados no se pueden transmitir en streaming.

Cuando se usa junto con n, best_of controla el número de conversaciones candidatas y n especifica cuántas conversaciones se devuelven. best_of debe ser mayor que n.

Nota: dado que este parámetro genera varias conversaciones, puede consumir rápidamente tu cuota de facturación de tokens. Úsalo con precaución y asegúrate de establecer valores razonables para max_tokens y stop.

Información de respuesta

choices
object[]
requerido
Lista de opciones de conversación generadas.
created
integer
requerido
Marca de tiempo Unix en la que se generó la respuesta (en segundos).
id
string
requerido
Identificador único de la respuesta.
model
string
requerido
Modelo utilizado para la conversación.
object
string
requerido
Tipo de objeto, siempre text_completion.
usage
object
requerido
Estadísticas de uso.
Para respuestas en streaming, el campo usage se incluye en el último bloque de respuesta devuelto.