https://api.serverlessllmapi.com/v1
API-documentatie: Quickstart
Begin met het gebruik van de serverless llm api binnen enkele minuten. Deze quickstart-gids behandelt authenticatie, chatverzoeken, streaming en function calling met onze OpenAI-compatible interface.
Base URL en authenticatie
De serverless llm API gebruikt de standaard OpenAI-compatible endpointstructuur. Om aan de slag te gaan, heb je twee dingen nodig: je base URL en je API-sleutel.
Gebruik de volgende base URL voor alle verzoeken:
https://api.serverlessllmapi.com/v1
Authenticatie wordt afgehandeld via de Authorization-header. Maak een account aan op de pagina API-sleutel ophalen om je sleutel te ontvangen. Je kunt deze sleutel op elk moment opnieuw genereren, waardoor de oude sleutel direct ongeldig wordt. Bewaar je sleutel veilig, omdat deze directe toegang geeft tot je prepaid tegoed.
Eerste verzoek: Chat-completies
Stuur een standaard chat-completion-verzoek naar het /v1/chat/completions-endpoint. De API accepteert een modelnaam, een lijst met berichten en optionele parameters. Ons standaard model-ID is uncensored, geoptimaliseerd voor hoogwaardige, onbeperkte antwoorden.
Hier is een basisvoorbeeld met curl om een antwoord te genereren:
curl https://api.serverlessllmapi.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'Het antwoord volgt de standaard OpenAI JSON-indeling. Als het verzoek succesvol is, ontvang je een completion-object met de gegenereerde tekst. Deze eenvoud stelt je in staat ons endpoint in bestaande OpenAI SDK-configuraties te plaatsen door simpelweg de base URL en sleutel aan te passen.
Python SDK-integratie
Het gebruik van de officiële OpenAI Python SDK is de snelste manier tot integratie. Omdat onze API openai compatible api is, hoef je alleen de base URL en API-sleutel te overschrijven. Dit zorgt ervoor dat je bestaande code zonder aanpassingen werkt.
from openai import OpenAI
client = OpenAI(base_url="https://api.serverlessllmapi.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)Deze aanpak stelt je in staat bekende Python-bibliotheken te gebruiken, terwijl je profiteert van ons ongecensureerde model. Het contextvenster ondersteunt tot 100.000 tokens, waardoor je aanzienlijke invoer- en uitvoerlengtes binnen één verzoek kunt verwerken. Zorg ervoor dat je berichtenarray de nodige system- en user-prompts bevat om het model effectief te sturen.
Node.js SDK-integratie
Voor JavaScript- en TypeScript-ontwikkelaars biedt de OpenAI Node SDK een eenvoudige integratiemogelijkheid. Configureer de client met onze base URL en je API-sleutel om direct verzoeken te kunnen uitvoeren.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.serverlessllmapi.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Deze setup is ideaal voor serverless-functies of backend-diensten die realtime LLM-interacties vereisen. De pay-as-you-go-prijzen betekenen dat je alleen betaalt voor wat je gebruikt, zonder maandelijkse abonnementen. Credits vervallen niet, dus je kunt het gebruik tussen projecten onderbreken zonder je saldo te verliezen.
Streaming-antwoorden (SSE)
Schakel streaming in door stream: true in je verzoek in te stellen. De API retourneert een Server-Sent Events (SSE)-stream, waardoor je tokens kunt weergeven zodra ze worden gegenereerd. Dit vermindert de waargenomen latentie voor eindgebruikers en verbetert de ervaring voor chattoepassingen.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)Verwerk de stream-events in je clientcode om het uiteindelijke antwoord op te bouwen. Streaming werkt met zowel de Python- als de Node SDK's wanneer ze correct zijn geconfigureerd. Deze functie is vooral nuttig voor het genereren van lange teksten, waar directe feedback waardevol is.
Rate limits en beperkingen
Begrijp de beperkingen om een vlotte integratie te garanderen. De API handhaaft een rate limit van 300 verzoeken per minuut per API-sleutel. Elke request body mag niet groter zijn dan 8 MB. Als je het rate limit overschrijdt, ontvang je een 429-statuscode.
Authenticatiefouten retourneren een 401-status, wat wijst op een ongeldige of ingetrokken sleutel. Als je prepaid tegoed opgebruikt is, retourneren verzoeken een 402-status. Het model-ID uncensored ondersteunt geen embeddings, image generation of fine-tuning. Houd je aan tekstgebaseerde chat-completies voor optimale prestaties.
API-specificaties
Alle echte limieten en functies van de API op één plek — controleer ze voordat je opwaardeert.
| Onderdeel | Waarde |
|---|---|
| API-formaat | OpenAI-compatibel: elke OpenAI-SDK werkt — vervang alleen base URL en sleutel |
| Model-ID | uncensored |
| Authenticatie | Authorization: Bearer YOUR_KEY |
| Base URL | https://api.serverlessllmapi.com/v1 |
| Endpoints | POST /v1/chat/completions · GET /v1/models |
| Function calling | ja — tools, tool_choice; antwoorden bevatten tool_calls, ook bij streaming; resultaten als role: tool |
| Streaming | ja — server-sent events; het laatste deel bevat het tokenverbruik |
| Contextvenster | 100.000 tokens (invoer + uitvoer) |
| Parameters | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Max. uitvoer | tot de rest van het venster van 100.000 tokens; max_tokens optioneel (geen aparte limiet) |
| JSON-modus | response_format: {"type": "json_object"} |
| Gelijktijdige verzoeken | tot 8 tegelijk per sleutel |
| Responsheaders | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Verzoekgrootte | tot 8 MB |
| Rate limit | 300 verzoeken per minuut per sleutel |
| Geldigheid | betaald tegoed verloopt niet, geen abonnement |
| Afrekening | prepaid tegoed op basis van echt verbruik; fouten en weigeringen zijn gratis |
| Gratis proeftegoed | $0,50 voor 7 dagen, zonder kaart · Proefsleutel: 2 parallelle verzoeken, 60 per minuut; volledige limieten (8 en 300) na eerste opwaardering |
| Prijs | $0,25 per 1 mln invoertokens · $1,00 per 1 mln uitvoertokens |
| Bonus | +5% vanaf $50, +10% vanaf $100 |
| Opwaarderen | USDT (TRC20) of USDC (Base), elk heel bedrag van $10 tot $500 |
| Inhoud | inhoud voor volwassenen toegestaan; seksuele inhoud met minderjarigen wordt geweigerd |
| Sleutels | één actieve sleutel per account; een nieuwe vervangt de oude |
| Inloggen | Google of e-mail en wachtwoord |
Foutcodes
Fouten komen als JSON met een vaste type; mislukte of geweigerde verzoeken kosten niets.
| Code | Type | Betekenis |
|---|---|---|
400 | bad_request | ongeldige JSON, lege berichten, verkeerde parameter of context te lang |
401 | missing_key · invalid_key · key_revoked | sleutel ontbreekt, is onjuist of is vervangen |
402 | no_credit | geen tegoed — waardeer op en ga direct verder |
403 | content_blocked | seksuele inhoud met minderjarigen — geweigerd, niet gerekend |
404 | not_found | onbekend endpoint |
413 | request_too_large | body groter dan 8 MB |
429 | rate_limited · concurrency | meer dan 300/min of 8 tegelijk — wacht en probeer opnieuw |
503 | upstream_busy | model bezet — probeer het over enkele seconden opnieuw |
Vragen en antwoorden
Lees de documentatieWat is de grootte van het contextvenster?
Het contextvenster ondersteunt tot 100.000 tokens voor de gecombineerde input-prompt en output-completion. Dit stelt je in staat uitgebreide gesprekken of grote documentverwerking in één verzoek uit te voeren.
Hoe verwerk ik streaming in Python?
Stel de <code>stream</code>-parameter in op <code>true</code> in je API-aanroep. De SDK retourneert een iterabel object dat tekstchunks oplevert zodra ze worden gegenereerd, waardoor je antwoorden in realtime kunt weergeven.
Kan ik deze API gebruiken met andere OpenAI SDK's?
Ja, de API is openai compatible api. Elke client die het OpenAI API-formaat ondersteunt, kan verbinding maken door de base URL en API-sleutel aan te passen. Dit omvat bibliotheken voor Node.js, Go en andere talen.
Je sleutel is nog maar één formulier verwijderd
Maak een account aan, kopieer de sleutel, pas de base URL aan. Dat is de hele setup.