Texto

Chat y completions con el contrato de OpenAI, sobre seis modelos que comparten key y presupuesto.

La llamada

POST /v1/chat/completions con el contrato de OpenAI. Lo que cambia entre modelos es el valor de model — el resto del cuerpo es idéntico, así que probar otro modelo es cambiar un string y volver a correr.

r = client.chat.completions.create(
    model="glm-5.2",
    messages=[
        {"role": "system", "content": "Respondé en español, breve."},
        {"role": "user", "content": "¿Qué es un webhook?"},
    ],
    temperature=0.3,
)

Streaming

stream=True devuelve los tokens a medida que se generan, igual que en OpenAI. Para una interfaz donde alguien está esperando, es la diferencia entre ver la respuesta aparecer y mirar un spinner.

stream = client.chat.completions.create(
    model="llama-groq",
    messages=[{"role": "user", "content": "Contame un chiste"}],
    stream=True,
)
for chunk in stream:
    print(chunk.choices[0].delta.content or "", end="")

Qué modelo elegir

Los seis modelos de texto están en los tres planes: la escalera entre planes es de crédito, velocidad y modalidades, no de catálogo de texto. Cada uno tiene su página con precio, contexto y para qué rinde mejor.

La forma más barata de trabajar es escalonar: mandarle el volumen a un modelo económico y reservar el caro para el tramo difícil. Como todos comparten endpoint y presupuesto, escalonar no agrega infraestructura.

La referencia formal de todas las APIs de TruoCloud vive en docs.truo.cloud. Esta guía cubre el uso del gateway de Truo AI.