NL ▾

Drop-in ongecensureerde LLM-API

API-sleutel aanvragen
per 1M input-tokens
$0,25
Output-tokens / 1M
$1,00
token context
100.000
trial credit
$0,50
requests per minute
300

Serverless LLM APIAPI-documentatie: Quickstart

https://api.serverlessllmapi.com/v1

https://api.serverlessllmapi.com/v1

API-documentatie: Quickstart

Begin met het gebruik van de serverless llm api binnen enkele minuten. Deze quickstart-gids behandelt authenticatie, chatverzoeken, streaming en function calling met onze OpenAI-compatible interface.

Base URL en authenticatie

De serverless llm API gebruikt de standaard OpenAI-compatible endpointstructuur. Om aan de slag te gaan, heb je twee dingen nodig: je base URL en je API-sleutel.

Gebruik de volgende base URL voor alle verzoeken:

https://api.serverlessllmapi.com/v1

Authenticatie wordt afgehandeld via de Authorization-header. Maak een account aan op de pagina API-sleutel ophalen om je sleutel te ontvangen. Je kunt deze sleutel op elk moment opnieuw genereren, waardoor de oude sleutel direct ongeldig wordt. Bewaar je sleutel veilig, omdat deze directe toegang geeft tot je prepaid tegoed.

Eerste verzoek: Chat-completies

Stuur een standaard chat-completion-verzoek naar het /v1/chat/completions-endpoint. De API accepteert een modelnaam, een lijst met berichten en optionele parameters. Ons standaard model-ID is uncensored, geoptimaliseerd voor hoogwaardige, onbeperkte antwoorden.

Hier is een basisvoorbeeld met curl om een antwoord te genereren:

curl https://api.serverlessllmapi.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

Het antwoord volgt de standaard OpenAI JSON-indeling. Als het verzoek succesvol is, ontvang je een completion-object met de gegenereerde tekst. Deze eenvoud stelt je in staat ons endpoint in bestaande OpenAI SDK-configuraties te plaatsen door simpelweg de base URL en sleutel aan te passen.

Python SDK-integratie

Het gebruik van de officiële OpenAI Python SDK is de snelste manier tot integratie. Omdat onze API openai compatible api is, hoef je alleen de base URL en API-sleutel te overschrijven. Dit zorgt ervoor dat je bestaande code zonder aanpassingen werkt.

from openai import OpenAI

client = OpenAI(base_url="https://api.serverlessllmapi.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Deze aanpak stelt je in staat bekende Python-bibliotheken te gebruiken, terwijl je profiteert van ons ongecensureerde model. Het contextvenster ondersteunt tot 100.000 tokens, waardoor je aanzienlijke invoer- en uitvoerlengtes binnen één verzoek kunt verwerken. Zorg ervoor dat je berichtenarray de nodige system- en user-prompts bevat om het model effectief te sturen.

Node.js SDK-integratie

Voor JavaScript- en TypeScript-ontwikkelaars biedt de OpenAI Node SDK een eenvoudige integratiemogelijkheid. Configureer de client met onze base URL en je API-sleutel om direct verzoeken te kunnen uitvoeren.

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.serverlessllmapi.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Deze setup is ideaal voor serverless-functies of backend-diensten die realtime LLM-interacties vereisen. De pay-as-you-go-prijzen betekenen dat je alleen betaalt voor wat je gebruikt, zonder maandelijkse abonnementen. Credits vervallen niet, dus je kunt het gebruik tussen projecten onderbreken zonder je saldo te verliezen.

Streaming-antwoorden (SSE)

Schakel streaming in door stream: true in je verzoek in te stellen. De API retourneert een Server-Sent Events (SSE)-stream, waardoor je tokens kunt weergeven zodra ze worden gegenereerd. Dit vermindert de waargenomen latentie voor eindgebruikers en verbetert de ervaring voor chattoepassingen.

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Verwerk de stream-events in je clientcode om het uiteindelijke antwoord op te bouwen. Streaming werkt met zowel de Python- als de Node SDK's wanneer ze correct zijn geconfigureerd. Deze functie is vooral nuttig voor het genereren van lange teksten, waar directe feedback waardevol is.

Rate limits en beperkingen

Begrijp de beperkingen om een vlotte integratie te garanderen. De API handhaaft een rate limit van 300 verzoeken per minuut per API-sleutel. Elke request body mag niet groter zijn dan 8 MB. Als je het rate limit overschrijdt, ontvang je een 429-statuscode.

Authenticatiefouten retourneren een 401-status, wat wijst op een ongeldige of ingetrokken sleutel. Als je prepaid tegoed opgebruikt is, retourneren verzoeken een 402-status. Het model-ID uncensored ondersteunt geen embeddings, image generation of fine-tuning. Houd je aan tekstgebaseerde chat-completies voor optimale prestaties.

API-specificaties

Alle echte limieten en functies van de API op één plek — controleer ze voordat je opwaardeert.

OnderdeelWaarde
API-formaatOpenAI-compatibel: elke OpenAI-SDK werkt — vervang alleen base URL en sleutel
Model-IDuncensored
AuthenticatieAuthorization: Bearer YOUR_KEY
Base URLhttps://api.serverlessllmapi.com/v1
EndpointsPOST /v1/chat/completions · GET /v1/models
Function callingja — tools, tool_choice; antwoorden bevatten tool_calls, ook bij streaming; resultaten als role: tool
Streamingja — server-sent events; het laatste deel bevat het tokenverbruik
Contextvenster100.000 tokens (invoer + uitvoer)
Parameterstemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Max. uitvoertot de rest van het venster van 100.000 tokens; max_tokens optioneel (geen aparte limiet)
JSON-modusresponse_format: {"type": "json_object"}
Gelijktijdige verzoekentot 8 tegelijk per sleutel
ResponsheadersX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Verzoekgroottetot 8 MB
Rate limit300 verzoeken per minuut per sleutel
Geldigheidbetaald tegoed verloopt niet, geen abonnement
Afrekeningprepaid tegoed op basis van echt verbruik; fouten en weigeringen zijn gratis
Gratis proeftegoed$0,50 voor 7 dagen, zonder kaart · Proefsleutel: 2 parallelle verzoeken, 60 per minuut; volledige limieten (8 en 300) na eerste opwaardering
Prijs$0,25 per 1 mln invoertokens · $1,00 per 1 mln uitvoertokens
Bonus+5% vanaf $50, +10% vanaf $100
OpwaarderenUSDT (TRC20) of USDC (Base), elk heel bedrag van $10 tot $500
Inhoudinhoud voor volwassenen toegestaan; seksuele inhoud met minderjarigen wordt geweigerd
Sleutelséén actieve sleutel per account; een nieuwe vervangt de oude
InloggenGoogle of e-mail en wachtwoord

Foutcodes

Fouten komen als JSON met een vaste type; mislukte of geweigerde verzoeken kosten niets.

CodeTypeBetekenis
400bad_requestongeldige JSON, lege berichten, verkeerde parameter of context te lang
401missing_key · invalid_key · key_revokedsleutel ontbreekt, is onjuist of is vervangen
402no_creditgeen tegoed — waardeer op en ga direct verder
403content_blockedseksuele inhoud met minderjarigen — geweigerd, niet gerekend
404not_foundonbekend endpoint
413request_too_largebody groter dan 8 MB
429rate_limited · concurrencymeer dan 300/min of 8 tegelijk — wacht en probeer opnieuw
503upstream_busymodel bezet — probeer het over enkele seconden opnieuw

Vragen en antwoorden

Lees de documentatie
Wat is de grootte van het contextvenster?

Het contextvenster ondersteunt tot 100.000 tokens voor de gecombineerde input-prompt en output-completion. Dit stelt je in staat uitgebreide gesprekken of grote documentverwerking in één verzoek uit te voeren.

Hoe verwerk ik streaming in Python?

Stel de <code>stream</code>-parameter in op <code>true</code> in je API-aanroep. De SDK retourneert een iterabel object dat tekstchunks oplevert zodra ze worden gegenereerd, waardoor je antwoorden in realtime kunt weergeven.

Kan ik deze API gebruiken met andere OpenAI SDK's?

Ja, de API is openai compatible api. Elke client die het OpenAI API-formaat ondersteunt, kan verbinding maken door de base URL en API-sleutel aan te passen. Dit omvat bibliotheken voor Node.js, Go en andere talen.

Je sleutel is nog maar één formulier verwijderd

Maak een account aan, kopieer de sleutel, pas de base URL aan. Dat is de hele setup.