https://api.serverlessllmapi.com/v1
Documentación de la API: Inicio rápido
Comienza a usar la API de LLM sin servidor en minutos. Esta guía de inicio rápido cubre la autenticación, peticiones de chat, streaming y llamadas a herramientas con nuestra interfaz compatible con OpenAI.
URL base y autenticación
La API serverless llm utiliza la estructura estándar de endpoints compatible con OpenAI. Para comenzar, necesitas dos piezas de información: tu URL base y tu clave de API.
Utiliza la siguiente URL base para todas las peticiones:
https://api.serverlessllmapi.com/v1
La autenticación se maneja mediante el encabezado Authorization. Crea una cuenta en la página Obtener clave de API para recibir tu clave. Puedes regenerar esta clave en cualquier momento, lo que revoca instantáneamente la anterior. Mantén tu clave segura, ya que proporciona acceso directo a tus créditos prepago.
Primera petición: Finalizaciones de chat
Envía una petición estándar de finalización de chat al endpoint /v1/chat/completions. La API acepta un nombre de modelo, una lista de mensajes y parámetros opcionales. Nuestro ID de modelo predeterminado es uncensored, optimizado para respuestas de alta calidad y sin restricciones.
Aquí tienes un ejemplo básico usando curl para generar una respuesta:
curl https://api.serverlessllmapi.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'La respuesta sigue el formato JSON estándar de OpenAI. Si la petición es exitosa, recibirás un objeto de finalización que contiene el texto generado. Esta simplicidad te permite insertar nuestro endpoint en configuraciones existentes de SDKs de OpenAI simplemente cambiando la URL base y la clave.
Integración con SDK de Python
Usar el SDK oficial de Python de OpenAI es la forma más rápida de integrar. Dado que nuestra API es openai compatible api, solo necesitas sobrescribir la URL base y la clave de API. Esto asegura que tu código existente funcione sin modificaciones.
from openai import OpenAI
client = OpenAI(base_url="https://api.serverlessllmapi.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)Este enfoque te permite aprovechar bibliotecas de Python familiares mientras te beneficias de nuestro modelo sin censura. La ventana de contexto admite hasta 100.000 tokens, permitiendo longitudes de entrada y salida sustanciales dentro de una sola petición. Asegúrate de que tu matriz de mensajes incluya los prompts de sistema y usuario necesarios para guiar eficazmente al modelo.
Integración con SDK de Node.js
Para desarrolladores de JavaScript y TypeScript, el SDK de Node.js de OpenAI proporciona una ruta de integración directa. Configura el cliente con nuestra URL base y tu clave de API para comenzar a hacer peticiones de inmediato.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.serverlessllmapi.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Esta configuración es ideal para funciones sin servidor o servicios de backend que requieren interacciones LLM en tiempo real. La tarifa de pago por uso significa que solo pagas por lo que usas, sin suscripciones mensuales. Los créditos no caducan, por lo que puedes pausar el uso entre proyectos sin perder tu saldo.
Respuestas en streaming (SSE)
Habilita el streaming estableciendo stream: true en tu petición. La API devolverá un flujo de Server-Sent Events (SSE), permitiéndote mostrar tokens a medida que se generan. Esto reduce la latencia percibida para los usuarios finales y mejora la experiencia para aplicaciones de chat.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)Maneja los eventos del flujo en tu código cliente para acumular la respuesta final. El streaming funciona con los SDKs de Python y Node.js cuando se configuran correctamente. Esta función es particularmente útil para la generación de contenido extenso donde la retroalimentación inmediata es valiosa.
Límites de velocidad y restricciones
Comprende las restricciones para asegurar una integración fluida. La API aplica un límite de velocidad de 300 peticiones por minuto por clave de API. El cuerpo de cada petición no debe exceder 8 MB. Si excedes el límite de velocidad, recibirás un código de estado 429.
Los errores de autenticación devuelven un estado 401, indicando una clave inválida o revocada. Si tu crédito prepago se agota, las peticiones devolverán un estado 402. El ID de modelo uncensored no admite incrustaciones, generación de imágenes ni ajuste fino. Limita tus peticiones a finalizaciones de chat basadas en texto para un rendimiento óptimo.
Funciones y límites
Una tabla con cada límite, función y precio.
| Elemento | Valor |
|---|---|
| Formato | compatible con OpenAI: cualquier SDK de OpenAI funciona cambiando la base URL y la clave |
| ID del modelo | uncensored |
| Autenticación | Authorization: Bearer YOUR_KEY |
| Base URL | https://api.serverlessllmapi.com/v1 |
| Endpoints | POST /v1/chat/completions · GET /v1/models |
| Llamadas a funciones | sí: tools, tool_choice; la respuesta trae tool_calls, también en streaming; resultados como role: tool |
| Streaming | sí: server-sent events; el último fragmento incluye el uso de tokens |
| Ventana de contexto | 100.000 tokens (entrada + salida) |
| Parámetros | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Salida máxima | hasta el resto de la ventana de 100.000 tokens; max_tokens opcional (sin límite aparte) |
| Modo JSON | response_format: {"type": "json_object"} |
| Concurrencia | 8 peticiones a la vez por clave |
| Cabeceras | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Tamaño de petición | hasta 8 MB |
| Límite de peticiones | 300 por minuto por clave |
| Caducidad | el crédito pagado no caduca, sin suscripción |
| Facturación | crédito prepago por uso real; errores y rechazos no se cobran |
| Prueba gratis | $0,50 durante 7 días, sin tarjeta · Clave de prueba: 2 solicitudes paralelas, 60 por minuto; límites completos (8 y 300) tras la primera recarga |
| Precio | $0,25 por 1M tokens de entrada · $1,00 por 1M de salida |
| Bono | +5 % desde $50, +10 % desde $100 |
| Recarga | USDT (TRC20) o USDC (Base), cualquier importe entero de $10 a $500 |
| Contenido | contenido adulto permitido; se rechaza el contenido sexual con menores |
| Claves | una clave activa por cuenta; una nueva reemplaza a la anterior |
| Acceso | Google o correo y contraseña |
Errores y qué hacer
Los errores llegan como JSON con un type fijo; las peticiones fallidas o rechazadas no se cobran.
| Código | Tipo | Significado |
|---|---|---|
400 | bad_request | JSON inválido, mensajes vacíos, parámetro incorrecto o contexto demasiado largo |
401 | missing_key · invalid_key · key_revoked | falta la clave, es incorrecta o fue reemplazada |
402 | no_credit | sin crédito: recarga y sigue al instante |
403 | content_blocked | contenido sexual con menores: rechazado, no se cobra |
404 | not_found | endpoint desconocido |
413 | request_too_large | cuerpo mayor de 8 MB |
429 | rate_limited · concurrency | más de 300/min o 8 en paralelo: espera y reintenta |
503 | upstream_busy | modelo ocupado: reintenta en unos segundos |
Preguntas y respuestas
Leer la documentación¿Cuál es el tamaño de la ventana de contexto?
La ventana de contexto admite hasta 100.000 tokens para el prompt de entrada combinado y la finalización de salida. Esto permite conversaciones extensas o el procesamiento de documentos grandes en una sola petición.
¿Cómo manejo el streaming en Python?
Establece el parámetro <code>stream</code> en <code>true</code> en tu llamada a la API. El SDK devolverá un objeto iterable que genera fragmentos de texto a medida que se generan, permitiendo la visualización en tiempo real de las respuestas.
¿Puedo usar esta API con otros SDKs de OpenAI?
Sí, la API es compatible con openai compatible api. Cualquier cliente que admita el formato de API de OpenAI puede conectarse actualizando la URL base y la clave de API. Esto incluye bibliotecas para Node.js, Go y otros lenguajes.
Tu clave está a un formulario de distancia
Crea una cuenta, copia la clave, cambia la URL base. Esa es toda la configuración.