Texto
Chat y completions con el contrato de OpenAI, sobre seis modelos que comparten key y presupuesto.
La llamada
POST /v1/chat/completions con el contrato de OpenAI. Lo que cambia entre modelos es el valor de model — el resto del cuerpo es idéntico, así que probar otro modelo es cambiar un string y volver a correr.
r = client.chat.completions.create(
model="glm-5.2",
messages=[
{"role": "system", "content": "Respondé en español, breve."},
{"role": "user", "content": "¿Qué es un webhook?"},
],
temperature=0.3,
)Streaming
stream=True devuelve los tokens a medida que se generan, igual que en OpenAI. Para una interfaz donde alguien está esperando, es la diferencia entre ver la respuesta aparecer y mirar un spinner.
stream = client.chat.completions.create(
model="llama-groq",
messages=[{"role": "user", "content": "Contame un chiste"}],
stream=True,
)
for chunk in stream:
print(chunk.choices[0].delta.content or "", end="")Qué modelo elegir
Los seis modelos de texto están en los tres planes: la escalera entre planes es de crédito, velocidad y modalidades, no de catálogo de texto. Cada uno tiene su página con precio, contexto y para qué rinde mejor.
La forma más barata de trabajar es escalonar: mandarle el volumen a un modelo económico y reservar el caro para el tramo difícil. Como todos comparten endpoint y presupuesto, escalonar no agrega infraestructura.