DE ▾

Sofort einsetzbare unzensierte LLM-API

API-Schlüssel erhalten
pro 1M Input-Token
$0,25
Output-Token / 1M
$1,00
Token-Kontext
100.000
Testguthaben
$0,50
Anfragen pro Minute
300

Serverless LLM APIAPI-Dokumentation: Schnellstart

https://api.serverlessllmapi.com/v1

https://api.serverlessllmapi.com/v1

API-Dokumentation: Schnellstart

Nutze die serverless llm api in Minuten. Dieser Schnellstart-Leitfaden behandelt Authentifizierung, Chat-Anfragen, Streaming und Function Calling mit unserer OpenAI-kompatiblen Schnittstelle.

Base URL und Authentifizierung

Die serverless llm API verwendet die Standardstruktur der OpenAI-kompatiblen Endpunkte. Um zu beginnen, benötigst du zwei Informationen: deine Base URL und deinen API-Schlüssel.

Verwende die folgende Base URL für alle Anfragen:

https://api.serverlessllmapi.com/v1

Die Authentifizierung erfolgt über den Authorization-Header. Erstelle ein Konto auf der Seite API-Schlüssel abrufen, um deinen Schlüssel zu erhalten. Du kannst diesen Schlüssel jederzeit neu generieren, wodurch der alte sofort ungültig wird. Behalte deinen Schlüssel sicher aufbewahrt, da er direkten Zugriff auf deine Prepaid-Guthaben gewährt.

Erste Anfrage: Chat-Vervollständigungen

Sende eine Standard-Chat-Vervollständigungsanfrage an den Endpunkt /v1/chat/completions. Die API akzeptiert eine Modell-ID, eine Liste von Nachrichten und optionale Parameter. Unsere Standard-Modell-ID ist uncensored, die für hochwertige, uneingeschränkte Antworten optimiert ist.

Hier ist ein einfaches Beispiel mit curl zur Generierung einer Antwort:

curl https://api.serverlessllmapi.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

Die Antwort folgt dem Standard-OpenAI-JSON-Format. Bei erfolgreicher Anfrage erhältst du ein Completion-Objekt, das den generierten Text enthält. Diese Einfachheit ermöglicht es dir, unseren Endpunkt in bestehende OpenAI-SDK-Konfigurationen einzufügen, indem du einfach die Base URL und den Schlüssel änderst.

Python-SDK-Integration

Die Verwendung des offiziellen OpenAI Python SDK ist der schnellste Weg zur Integration. Da unsere API openai compatible api ist, musst du nur die Base URL und den API-Schlüssel überschreiben. Dies stellt sicher, dass dein bestehender Code ohne Änderungen funktioniert.

from openai import OpenAI

client = OpenAI(base_url="https://api.serverlessllmapi.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Dieser Ansatz ermöglicht es dir, vertraute Python-Bibliotheken zu nutzen und gleichzeitig von unserem unzensierten Modell zu profitieren. Das Kontextfenster unterstützt bis zu 100.000 Token, was erhebliche Eingabe- und Ausgabelängen innerhalb einer einzigen Anfrage ermöglicht. Stelle sicher, dass dein Nachrichten-Array die erforderlichen System- und User-Prompts enthält, um das Modell effektiv zu steuern.

Node.js-SDK-Integration

Für JavaScript- und TypeScript-Entwickler bietet das OpenAI Node SDK einen straightforward Integrationspfad. Konfiguriere den Client mit unserer Base URL und deinem API-Schlüssel, um sofort Anfragen zu stellen.

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.serverlessllmapi.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Dieses Setup ist ideal für serverless Functions oder Backend-Dienste, die Echtzeit-LLM-Interaktionen erfordern. Die Pay as you go-Preisgestaltung bedeutet, dass du nur für das zahlst, was du nutzt, ohne monatliche Abonnements. Guthaben verfällt nie, sodass du die Nutzung zwischen Projekten pausieren kannst, ohne deinen Saldo zu verlieren.

Streaming-Antworten (SSE)

Aktiviere Streaming, indem du stream: true in deiner Anfrage setzt. Die API gibt einen Server-Sent Events (SSE)-Stream zurück, der es dir ermöglicht, Token in Echtzeit anzuzeigen, während sie generiert werden. Dies reduziert die wahrgenommene Latenz für Endbenutzer und verbessert das Erlebnis für Chat-Anwendungen.

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Verarbeite die Stream-Ereignisse in deinem Client-Code, um die finale Antwort zu akkumulieren. Streaming funktioniert mit sowohl dem Python- als auch dem Node-SDK, wenn es korrekt konfiguriert ist. Diese Funktion ist besonders nützlich für die Generierung von Langtext, wo sofortiges Feedback wertvoll ist.

Ratenlimits und Einschränkungen

Verstehe die Einschränkungen, um eine reibungslose Integration zu gewährleisten. Die API erzwingt ein Ratenlimit von 300 Anfragen pro Minute pro API-Schlüssel. Jeder Anfragekörper darf 8 MB nicht überschreiten. Wenn du das Ratenlimit überschreitest, erhältst du einen 429-Statuscode.

Authentifizierungsfehler geben einen 401-Status zurück, der einen ungültigen oder widerrufenen Schlüssel anzeigt. Wenn dein Prepaid-Guthaben aufgebraucht ist, geben Anfragen einen 402-Status zurück. Die Modell-ID uncensored unterstützt keine Embeddings, Bildgenerierung oder Fine-Tuning. Bleibe bei textbasierten Chat-Vervollständigungen für optimale Leistung.

Funktionen und Limits

Eine Tabelle mit jedem Limit, jeder Funktion und jedem Preis.

MerkmalWert
API-FormatOpenAI-kompatibel: jedes OpenAI-SDK funktioniert – nur Base-URL und Schlüssel ändern
Modell-IDuncensored
AuthentifizierungAuthorization: Bearer YOUR_KEY
Base-URLhttps://api.serverlessllmapi.com/v1
EndpunktePOST /v1/chat/completions · GET /v1/models
Function Callingja – tools, tool_choice; Antworten mit tool_calls, auch im Stream; Ergebnisse als role: tool
Streamingja – Server-Sent Events, der letzte Chunk enthält die Token-Nutzung
Kontextfenster100.000 Tokens (Eingabe + Ausgabe)
Parametertemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Max. Ausgabebis zum Rest des 100.000-Token-Fensters; max_tokens optional (kein separates Limit)
JSON-Modusresponse_format: {"type": "json_object"}
Parallelität8 gleichzeitige Anfragen pro Schlüssel
Antwort-HeaderX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Anfragegrößebis 8 MB
Ratenlimit300 Anfragen pro Minute und Schlüssel
Gültigkeitbezahltes Guthaben verfällt nie, kein Abo
AbrechnungPrepaid-Guthaben nach echter Nutzung; Fehler und Ablehnungen sind kostenlos
Testguthaben$0,50 für 7 Tage, ohne Karte · Testschlüssel: 2 parallele Anfragen, 60 pro Minute; volle Limits (8 und 300) nach erster Aufladung
Preis$0,25 pro 1 Mio. Eingabe-Tokens · $1,00 pro 1 Mio. Ausgabe-Tokens
Bonus+5 % ab $50, +10 % ab $100
AufladenUSDT (TRC20) oder USDC (Base), jeder ganze Betrag von $10 bis $500
InhalteInhalte für Erwachsene erlaubt; sexuelle Inhalte mit Minderjährigen werden abgelehnt
Schlüsselein aktiver Schlüssel pro Konto; ein neuer ersetzt den alten
AnmeldungGoogle oder E-Mail und Passwort

Fehler und Lösungen

Fehler kommen als JSON mit festem type; fehlgeschlagene oder abgelehnte Anfragen kosten nichts.

CodeTypBedeutung
400bad_requestungültiges JSON, leere Nachrichten, falscher Parameter oder Kontext zu lang
401missing_key · invalid_key · key_revokedSchlüssel fehlt, ist falsch oder wurde ersetzt
402no_creditkein Guthaben – aufladen, dann geht es sofort weiter
403content_blockedsexuelle Inhalte mit Minderjährigen – abgelehnt, nicht berechnet
404not_foundunbekannter Endpunkt
413request_too_largeAnfrage größer als 8 MB
429rate_limited · concurrencyüber 300/Min. oder 8 parallel – kurz warten
503upstream_busyModell ausgelastet – in Sekunden erneut versuchen

Fragen und Antworten

Dokumentation lesen
Wie groß ist das Kontextfenster?

Das Kontextfenster unterstützt bis zu 100.000 Token für die kombinierte Eingabe-Prompt und die Ausgabe-Vervollständigung. Dies ermöglicht umfangreiche Gespräche oder die Verarbeitung großer Dokumente in einer einzigen Anfrage.

Wie handhabe ich Streaming in Python?

Setze den <code>stream</code>-Parameter in deiner API-Anfrage auf <code>true</code>. Das SDK gibt ein iterierbares Objekt zurück, das Textchunks ausgibt, sobald sie generiert werden, was eine Echtzeitanzeige der Antworten ermöglicht.

Kann ich diese API mit anderen OpenAI-SDKs verwenden?

Ja, die API ist openai compatible api. Jeder Client, der das OpenAI-API-Format unterstützt, kann sich verbinden, indem er die Base URL und den API-Schlüssel aktualisiert. Dies umfasst Bibliotheken für Node.js, Go und andere Sprachen.

Dein Schlüssel ist nur ein Formular entfernt

Erstelle ein Konto, kopiere den Schlüssel, ändere die Base URL. Das ist die gesamte Einrichtung.