ES ▾

API de LLM sin censura lista para usar

Obtener clave de API
por cada 1M de tokens de entrada
$0,25
Tokens de salida / 1M
$1,00
contexto de tokens
100.000
crédito de prueba
$0,50
peticiones por minuto
300

Serverless LLM APIDocumentación de la API: Inicio rápido

https://api.serverlessllmapi.com/v1

https://api.serverlessllmapi.com/v1

Documentación de la API: Inicio rápido

Comienza a usar la API de LLM sin servidor en minutos. Esta guía de inicio rápido cubre la autenticación, peticiones de chat, streaming y llamadas a herramientas con nuestra interfaz compatible con OpenAI.

URL base y autenticación

La API serverless llm utiliza la estructura estándar de endpoints compatible con OpenAI. Para comenzar, necesitas dos piezas de información: tu URL base y tu clave de API.

Utiliza la siguiente URL base para todas las peticiones:

https://api.serverlessllmapi.com/v1

La autenticación se maneja mediante el encabezado Authorization. Crea una cuenta en la página Obtener clave de API para recibir tu clave. Puedes regenerar esta clave en cualquier momento, lo que revoca instantáneamente la anterior. Mantén tu clave segura, ya que proporciona acceso directo a tus créditos prepago.

Primera petición: Finalizaciones de chat

Envía una petición estándar de finalización de chat al endpoint /v1/chat/completions. La API acepta un nombre de modelo, una lista de mensajes y parámetros opcionales. Nuestro ID de modelo predeterminado es uncensored, optimizado para respuestas de alta calidad y sin restricciones.

Aquí tienes un ejemplo básico usando curl para generar una respuesta:

curl https://api.serverlessllmapi.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

La respuesta sigue el formato JSON estándar de OpenAI. Si la petición es exitosa, recibirás un objeto de finalización que contiene el texto generado. Esta simplicidad te permite insertar nuestro endpoint en configuraciones existentes de SDKs de OpenAI simplemente cambiando la URL base y la clave.

Integración con SDK de Python

Usar el SDK oficial de Python de OpenAI es la forma más rápida de integrar. Dado que nuestra API es openai compatible api, solo necesitas sobrescribir la URL base y la clave de API. Esto asegura que tu código existente funcione sin modificaciones.

from openai import OpenAI

client = OpenAI(base_url="https://api.serverlessllmapi.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Este enfoque te permite aprovechar bibliotecas de Python familiares mientras te beneficias de nuestro modelo sin censura. La ventana de contexto admite hasta 100.000 tokens, permitiendo longitudes de entrada y salida sustanciales dentro de una sola petición. Asegúrate de que tu matriz de mensajes incluya los prompts de sistema y usuario necesarios para guiar eficazmente al modelo.

Integración con SDK de Node.js

Para desarrolladores de JavaScript y TypeScript, el SDK de Node.js de OpenAI proporciona una ruta de integración directa. Configura el cliente con nuestra URL base y tu clave de API para comenzar a hacer peticiones de inmediato.

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.serverlessllmapi.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Esta configuración es ideal para funciones sin servidor o servicios de backend que requieren interacciones LLM en tiempo real. La tarifa de pago por uso significa que solo pagas por lo que usas, sin suscripciones mensuales. Los créditos no caducan, por lo que puedes pausar el uso entre proyectos sin perder tu saldo.

Respuestas en streaming (SSE)

Habilita el streaming estableciendo stream: true en tu petición. La API devolverá un flujo de Server-Sent Events (SSE), permitiéndote mostrar tokens a medida que se generan. Esto reduce la latencia percibida para los usuarios finales y mejora la experiencia para aplicaciones de chat.

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Maneja los eventos del flujo en tu código cliente para acumular la respuesta final. El streaming funciona con los SDKs de Python y Node.js cuando se configuran correctamente. Esta función es particularmente útil para la generación de contenido extenso donde la retroalimentación inmediata es valiosa.

Límites de velocidad y restricciones

Comprende las restricciones para asegurar una integración fluida. La API aplica un límite de velocidad de 300 peticiones por minuto por clave de API. El cuerpo de cada petición no debe exceder 8 MB. Si excedes el límite de velocidad, recibirás un código de estado 429.

Los errores de autenticación devuelven un estado 401, indicando una clave inválida o revocada. Si tu crédito prepago se agota, las peticiones devolverán un estado 402. El ID de modelo uncensored no admite incrustaciones, generación de imágenes ni ajuste fino. Limita tus peticiones a finalizaciones de chat basadas en texto para un rendimiento óptimo.

Funciones y límites

Una tabla con cada límite, función y precio.

ElementoValor
Formatocompatible con OpenAI: cualquier SDK de OpenAI funciona cambiando la base URL y la clave
ID del modelouncensored
AutenticaciónAuthorization: Bearer YOUR_KEY
Base URLhttps://api.serverlessllmapi.com/v1
EndpointsPOST /v1/chat/completions · GET /v1/models
Llamadas a funcionessí: tools, tool_choice; la respuesta trae tool_calls, también en streaming; resultados como role: tool
Streamingsí: server-sent events; el último fragmento incluye el uso de tokens
Ventana de contexto100.000 tokens (entrada + salida)
Parámetrostemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Salida máximahasta el resto de la ventana de 100.000 tokens; max_tokens opcional (sin límite aparte)
Modo JSONresponse_format: {"type": "json_object"}
Concurrencia8 peticiones a la vez por clave
CabecerasX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Tamaño de peticiónhasta 8 MB
Límite de peticiones300 por minuto por clave
Caducidadel crédito pagado no caduca, sin suscripción
Facturacióncrédito prepago por uso real; errores y rechazos no se cobran
Prueba gratis$0,50 durante 7 días, sin tarjeta · Clave de prueba: 2 solicitudes paralelas, 60 por minuto; límites completos (8 y 300) tras la primera recarga
Precio$0,25 por 1M tokens de entrada · $1,00 por 1M de salida
Bono+5 % desde $50, +10 % desde $100
RecargaUSDT (TRC20) o USDC (Base), cualquier importe entero de $10 a $500
Contenidocontenido adulto permitido; se rechaza el contenido sexual con menores
Clavesuna clave activa por cuenta; una nueva reemplaza a la anterior
AccesoGoogle o correo y contraseña

Errores y qué hacer

Los errores llegan como JSON con un type fijo; las peticiones fallidas o rechazadas no se cobran.

CódigoTipoSignificado
400bad_requestJSON inválido, mensajes vacíos, parámetro incorrecto o contexto demasiado largo
401missing_key · invalid_key · key_revokedfalta la clave, es incorrecta o fue reemplazada
402no_creditsin crédito: recarga y sigue al instante
403content_blockedcontenido sexual con menores: rechazado, no se cobra
404not_foundendpoint desconocido
413request_too_largecuerpo mayor de 8 MB
429rate_limited · concurrencymás de 300/min o 8 en paralelo: espera y reintenta
503upstream_busymodelo ocupado: reintenta en unos segundos

Preguntas y respuestas

Leer la documentación
¿Cuál es el tamaño de la ventana de contexto?

La ventana de contexto admite hasta 100.000 tokens para el prompt de entrada combinado y la finalización de salida. Esto permite conversaciones extensas o el procesamiento de documentos grandes en una sola petición.

¿Cómo manejo el streaming en Python?

Establece el parámetro <code>stream</code> en <code>true</code> en tu llamada a la API. El SDK devolverá un objeto iterable que genera fragmentos de texto a medida que se generan, permitiendo la visualización en tiempo real de las respuestas.

¿Puedo usar esta API con otros SDKs de OpenAI?

Sí, la API es compatible con openai compatible api. Cualquier cliente que admita el formato de API de OpenAI puede conectarse actualizando la URL base y la clave de API. Esto incluye bibliotecas para Node.js, Go y otros lenguajes.

Tu clave está a un formulario de distancia

Crea una cuenta, copia la clave, cambia la URL base. Esa es toda la configuración.