Crear solicitud de conversación
Modelos de lenguaje
Crear solicitud de conversación
POST
Crear solicitud de conversación
Genera una respuesta del modelo según el prompt y los parámetros especificados
Encabezados de solicitud
Valores enumerados:
application/jsonFormato de autenticación Bearer: Bearer {{API Key}}.
Cuerpo de la solicitud
Nombre del modelo correspondiente. Para consultar los nombres de modelos disponibles, consulta la biblioteca de modelos en JieKou AI.
Prompt utilizado para generar la conversación (el prompt puede ser una cadena, un array de cadenas, un array de tokens o un array de arrays de tokens).
Número máximo de tokens que se pueden generar al crear la conversación.
La cantidad de tokens del prompt más max_tokens no puede superar la longitud de contexto del modelo.
La cantidad de tokens del prompt más max_tokens no puede superar la longitud de contexto del modelo.
Indica si se usa transmisión en streaming. El valor predeterminado es false; si se establece, los tokens se enviarán como data-only server-sent events (SSE) y el flujo finalizará con un mensaje data: [DONE].
Opciones de respuesta en streaming. Solo se establece cuando stream está configurado como true.
Cuántas conversaciones generar para cada prompt. El valor predeterminado es 1.
Nota: dado que este parámetro genera varias conversaciones, puede consumir rápidamente tu cuota de facturación de tokens. Úsalo con precaución y asegúrate de establecer valores razonables para max_tokens y stop.
Rango requerido: 1 < x < 128
Nota: dado que este parámetro genera varias conversaciones, puede consumir rápidamente tu cuota de facturación de tokens. Úsalo con precaución y asegúrate de establecer valores razonables para max_tokens y stop.
Rango requerido: 1 < x < 128
Si se especifica, nuestro sistema hará todo lo posible para realizar un muestreo determinista, de modo que las solicitudes repetidas con la misma seed y los mismos parámetros deberían devolver el mismo resultado.
El valor predeterminado es 0. Los valores positivos penalizan los nuevos tokens según su frecuencia de aparición en el texto actual, reduciendo así la probabilidad de que el modelo repita el mismo contenido.
Si el objetivo es simplemente reducir muestras repetitivas, los valores razonables están aproximadamente entre 0.1 y 1. Si el objetivo es inhibir fuertemente la repetición, el coeficiente puede aumentarse hasta 2, pero esto puede reducir notablemente la calidad de las muestras. Los valores negativos pueden usarse para aumentar la probabilidad de repetición.
Consulta también presence_penalty, que penaliza a una tasa fija los tokens que aparecen al menos una vez
Rango requerido: -2 < x < 2
Si el objetivo es simplemente reducir muestras repetitivas, los valores razonables están aproximadamente entre 0.1 y 1. Si el objetivo es inhibir fuertemente la repetición, el coeficiente puede aumentarse hasta 2, pero esto puede reducir notablemente la calidad de las muestras. Los valores negativos pueden usarse para aumentar la probabilidad de repetición.
Consulta también presence_penalty, que penaliza a una tasa fija los tokens que aparecen al menos una vez
Rango requerido: -2 < x < 2
El valor predeterminado es 0. Los valores positivos penalizan los nuevos tokens según si aparecen en el texto actual, aumentando así la probabilidad de que el modelo hable de temas nuevos.
Si el objetivo es reducir ligeramente las muestras repetitivas, los valores razonables están aproximadamente entre 0.1 y 1. Si el objetivo es inhibir fuertemente la repetición, el coeficiente puede aumentarse hasta 2, pero esto puede reducir significativamente la calidad de las muestras. Los valores negativos pueden usarse para aumentar la probabilidad de repetición.
Consulta también frequency_penalty, que penaliza a una tasa incremental según la frecuencia con la que aparecen los tokens
Rango requerido: -2 < x < 2
Si el objetivo es reducir ligeramente las muestras repetitivas, los valores razonables están aproximadamente entre 0.1 y 1. Si el objetivo es inhibir fuertemente la repetición, el coeficiente puede aumentarse hasta 2, pero esto puede reducir significativamente la calidad de las muestras. Los valores negativos pueden usarse para aumentar la probabilidad de repetición.
Consulta también frequency_penalty, que penaliza a una tasa incremental según la frecuencia con la que aparecen los tokens
Rango requerido: -2 < x < 2
Aplica una penalización a los tokens repetidos para inhibir o fomentar la repetición. Un valor de 1.0 significa que no hay penalización y permite la repetición libre. Los valores mayores que 1.0 penalizan la repetición, reduciendo la probabilidad de tokens repetidos. Los valores entre 0.0 y 1.0 recompensan la repetición, aumentando la probabilidad de tokens repetidos. Para lograr un buen equilibrio, normalmente se recomienda usar 1.2. Ten en cuenta que, en modelos solo decodificadores, la penalización se aplica tanto a la salida generada como al prompt.
Rango requerido: 0 < x < 2
Rango requerido: 0 < x < 2
Hasta 4 secuencias en las que la API dejará de generar más tokens. El texto devuelto incluye la secuencia de parada.
Grado de aleatoriedad en la conversación; el valor predeterminado es 1 y está entre 0 y 2. Los valores más altos (como 0.8) hacen que la salida sea más aleatoria, mientras que los valores más bajos (como 0.2) hacen que la salida sea más enfocada y determinista.
Por lo general, recomendamos ajustar solo este parámetro o top_p, pero no ambos al mismo tiempo.
Rango requerido: 0 < x < 2
Por lo general, recomendamos ajustar solo este parámetro o top_p, pero no ambos al mismo tiempo.
Rango requerido: 0 < x < 2
Como alternativa a temperature, llamada nucleus sampling, el modelo considera los resultados de los tokens con una masa de probabilidad top_p. Por lo tanto, 0.1 significa que solo se consideran los tokens que constituyen el 10% superior de la masa de probabilidad. Por lo general, recomendamos ajustar solo este parámetro o temperature, pero no ambos al mismo tiempo.
Rango requerido: 0 < x ≤ 1
Rango requerido: 0 < x ≤ 1
El muestreo Top-k es otro método de muestreo en el que se filtran los k tokens siguientes más probables y la masa de probabilidad se redistribuye únicamente entre esos k tokens. El valor de k controla la cantidad de candidatos para el siguiente token en cada paso de generación de texto.
Rango requerido: 1 < x < 128
Rango requerido: 1 < x < 128
Valor flotante que representa la probabilidad mínima para que un token sea considerado, en relación con la probabilidad del token más probable.
Rango requerido: 0 ≤ x ≤ 1
Rango requerido: 0 ≤ x ≤ 1
El valor predeterminado es null. Modifica la probabilidad de que los tokens especificados aparezcan en la conversación. Acepta un objeto JSON que asigna tokens a un valor de sesgo asociado de -100 a 100.
Devuelve las probabilidades logarítmicas de los logprobs tokens de salida más probables, incluyendo también la probabilidad del token seleccionado. Por ejemplo, si logprobs se establece en 5, la API devolverá una lista de las probabilidades logarítmicas de los 5 tokens más probables en cada paso de generación.
El valor máximo de logprobs es 5.
El valor máximo de logprobs es 5.
El valor predeterminado es 1. Genera best_of conversaciones y las procesa en el servidor, devolviendo la “mejor” (es decir, la que tiene la probabilidad logarítmica más alta por token). Los resultados no se pueden transmitir en streaming.
Cuando se usa junto con n, best_of controla el número de conversaciones candidatas y n especifica cuántas conversaciones se devuelven. best_of debe ser mayor que n.
Nota: dado que este parámetro genera varias conversaciones, puede consumir rápidamente tu cuota de facturación de tokens. Úsalo con precaución y asegúrate de establecer valores razonables para max_tokens y stop.
Cuando se usa junto con n, best_of controla el número de conversaciones candidatas y n especifica cuántas conversaciones se devuelven. best_of debe ser mayor que n.
Nota: dado que este parámetro genera varias conversaciones, puede consumir rápidamente tu cuota de facturación de tokens. Úsalo con precaución y asegúrate de establecer valores razonables para max_tokens y stop.
Información de respuesta
Lista de opciones de conversación generadas.
Marca de tiempo Unix en la que se generó la respuesta (en segundos).
Identificador único de la respuesta.
Modelo utilizado para la conversación.
Tipo de objeto, siempre text_completion.
Estadísticas de uso.
Para respuestas en streaming, el campo usage se incluye en el último bloque de respuesta devuelto.
Para respuestas en streaming, el campo usage se incluye en el último bloque de respuesta devuelto.