Llama · Groq
Respuesta casi instantánea para chat y tareas de alto volumen.
llama-groqel valor de model en tu llamadaLo que distingue a este no es tanto qué responde sino cuándo: devuelve tokens a una velocidad que se nota del otro lado de la pantalla. En una interfaz donde alguien está esperando, esa diferencia vale más que un punto de calidad.
El perfil natural es todo lo que ocurre mientras el usuario mira: autocompletado, sugerencias en línea, chat de primera respuesta. Para trabajo por lotes, donde nadie espera, conviene elegir por precio o por profundidad.
Para qué sirve
Interfaces donde se espera la respuesta
Chat, autocompletado y sugerencias, donde el tiempo hasta el primer token es lo que se percibe.
Clasificación en línea
Decidir una categoría o una ruta dentro del propio flujo de la petición.
Primera respuesta de un flujo escalonado
Contestar rápido y, si hace falta, pasar el caso a un modelo con más recorrido.
Cómo se llama
El endpoint es compatible con OpenAI, así que apuntás el SDK que ya usás a https://ai.truo.cloud/v1 con tu key y cambiás el nombre del modelo. No hay SDK propio que aprender.
from openai import OpenAI
client = OpenAI(
base_url="https://ai.truo.cloud/v1",
api_key="sk-...",
)
r = client.chat.completions.create(
model="llama-groq",
messages=[{"role": "user", "content": "Hola"}],
)Cuándo conviene otro
Ninguno es el mejor para todo. Mirá DeepSeek V4 Flash para trabajo por lotes, donde nadie espera del otro lado y decide el precio. Los dos entran por la misma key y descuentan del mismo presupuesto, así que cambiar es cambiar un string.