RápidoModelo de texto

Llama · Groq

Respuesta casi instantánea para chat y tareas de alto volumen.

llama-groqel valor de model en tu llamada

Lo que distingue a este no es tanto qué responde sino cuándo: devuelve tokens a una velocidad que se nota del otro lado de la pantalla. En una interfaz donde alguien está esperando, esa diferencia vale más que un punto de calidad.

El perfil natural es todo lo que ocurre mientras el usuario mira: autocompletado, sugerencias en línea, chat de primera respuesta. Para trabajo por lotes, donde nadie espera, conviene elegir por precio o por profundidad.

Para qué sirve

Interfaces donde se espera la respuesta

Chat, autocompletado y sugerencias, donde el tiempo hasta el primer token es lo que se percibe.

Clasificación en línea

Decidir una categoría o una ruta dentro del propio flujo de la petición.

Primera respuesta de un flujo escalonado

Contestar rápido y, si hace falta, pasar el caso a un modelo con más recorrido.

Cómo se llama

El endpoint es compatible con OpenAI, así que apuntás el SDK que ya usás a https://ai.truo.cloud/v1 con tu key y cambiás el nombre del modelo. No hay SDK propio que aprender.

from openai import OpenAI

client = OpenAI(
    base_url="https://ai.truo.cloud/v1",
    api_key="sk-...",
)

r = client.chat.completions.create(
    model="llama-groq",
    messages=[{"role": "user", "content": "Hola"}],
)

Cuándo conviene otro

Ninguno es el mejor para todo. Mirá DeepSeek V4 Flash para trabajo por lotes, donde nadie espera del otro lado y decide el precio. Los dos entran por la misma key y descuentan del mismo presupuesto, así que cambiar es cambiar un string.

Probar Llama · GroqVer el catálogo completo