https://api.serverlessllmapi.com/v1
Documentation API : Démarrage rapide
Commencez à utiliser l'API LLM serverless en quelques minutes. Ce guide de démarrage rapide couvre l'authentification, les requêtes de chat, le streaming et l'appel de fonctions avec notre interface compatible OpenAI.
URL de base et authentification
L'API LLM serverless utilise la structure standard des endpoints compatibles OpenAI. Pour commencer, vous avez besoin de deux éléments : votre URL de base et votre clé API.
Utilisez l'URL de base suivante pour toutes les requêtes :
https://api.serverlessllmapi.com/v1
L'authentification est gérée via l'en-tête Authorization. Créez un compte sur la page Clé API pour recevoir votre clé. Vous pouvez régénérer cette clé à tout moment, ce qui révoque instantanément l'ancienne. Conservez votre clé en sûreté, car elle donne un accès direct à vos crédits prépayés.
Première requête : Complétions de chat
Envoyez une requête standard de complétion de chat à l'endpoint /v1/chat/completions. L'API accepte un nom de modèle, une liste de messages et des paramètres optionnels. Notre ID de modèle par défaut est uncensored, optimisé pour des réponses de haute qualité et sans restriction.
Voici un exemple de base utilisant curl pour générer une réponse :
curl https://api.serverlessllmapi.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'La réponse suit le format JSON standard d'OpenAI. Si la requête est réussie, vous recevrez un objet de complétion contenant le texte généré. Cette simplicité vous permet de remplacer notre endpoint dans les configurations existantes des SDK OpenAI en modifiant simplement l'URL de base et la clé.
Intégration SDK Python
L'utilisation du SDK Python officiel d'OpenAI est le moyen le plus rapide d'intégrer notre service. Notre API étant compatible avec l'API OpenAI, vous n'avez qu'à remplacer l'URL de base et la clé API. Cela garantit que votre code existant fonctionne sans modification.
from openai import OpenAI
client = OpenAI(base_url="https://api.serverlessllmapi.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)Cette approche vous permet de tirer parti des bibliothèques Python familières tout en bénéficiant de notre modèle sans censure. La fenêtre de contexte prend en charge jusqu'à 100 000 tokens, permettant des longueurs d'entrée et de sortie substantielles dans une seule requête. Assurez-vous que votre tableau de messages inclut les prompts système et utilisateur nécessaires pour guider efficacement le modèle.
Intégration SDK Node.js
Pour les développeurs JavaScript et TypeScript, le SDK Node.js d'OpenAI offre un chemin d'intégration simple. Configurez le client avec notre URL de base et votre clé API pour commencer à effectuer des requêtes immédiatement.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.serverlessllmapi.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Cette configuration est idéale pour les fonctions serverless ou les services backend qui nécessitent des interactions LLM en temps réel. La tarification à l'usage signifie que vous ne payez que ce que vous utilisez, sans abonnements mensuels. Les crédits n'expirent jamais, vous pouvez donc suspendre l'utilisation entre les projets sans perdre votre solde.
Réponses en streaming (SSE)
Activez le streaming en définissant stream: true dans votre requête. L'API renverra un flux Server-Sent Events (SSE), vous permettant d'afficher les tokens au fur et à mesure de leur génération. Cela réduit la latence perçue pour les utilisateurs finaux et améliore l'expérience pour les applications de chat.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)Gérez les événements de flux dans votre code client pour accumuler la réponse finale. Le streaming fonctionne avec les SDK Python et Node.js lorsqu'ils sont configurés correctement. Cette fonctionnalité est particulièrement utile pour la génération de contenu long où un retour immédiat est précieux.
Limites de débit et contraintes
Comprenez les contraintes pour assurer une intégration fluide. L'API applique une limite de débit de 300 requêtes par minute par clé API. Le corps de chaque requête ne doit pas dépasser 8 MB. Si vous dépassez la limite de débit, vous recevrez un code de statut 429.
Les erreurs d'authentification renvoient un statut 401, indiquant une clé invalide ou révoquée. Si votre crédit prépayé est épuisé, les requêtes retourneront un statut 402. L'ID de modèle uncensored ne prend pas en charge les embeddings, la génération d'images ou le fine-tuning. Limitez-vous aux complétions de chat textuelles pour des performances optimales.
Fonctions et limites
Toutes les limites et fonctions réelles de l'API au même endroit — vérifiez-les avant de recharger.
| Élément | Valeur |
|---|---|
| Format | compatible OpenAI : tout SDK OpenAI fonctionne en changeant la base URL et la clé |
| ID du modèle | uncensored |
| Authentification | Authorization: Bearer YOUR_KEY |
| Base URL | https://api.serverlessllmapi.com/v1 |
| Endpoints | POST /v1/chat/completions · GET /v1/models |
| Appel de fonctions | oui — tools, tool_choice ; réponse avec tool_calls, aussi en streaming ; résultats en role: tool |
| Streaming | oui — server-sent events ; le dernier bloc contient l'usage des tokens |
| Fenêtre de contexte | 100 000 tokens (entrée + sortie) |
| Paramètres | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Sortie max. | jusqu'au reste de la fenêtre de 100 000 tokens ; max_tokens optionnel (pas de plafond distinct) |
| Mode JSON | response_format: {"type": "json_object"} |
| Concurrence | 8 requêtes simultanées par clé |
| En-têtes | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Taille | jusqu'à 8 Mo par requête |
| Limite de débit | 300 requêtes par minute et par clé |
| Validité | le crédit payé n'expire jamais, sans abonnement |
| Facturation | crédit prépayé selon l'usage réel ; erreurs et refus gratuits |
| Essai gratuit | 0,50 $ pendant 7 jours, sans carte · Clé d'essai : 2 requêtes parallèles, 60 par minute ; limites complètes (8 et 300) après la 1re recharge |
| Prix | 0,25 $ par million de tokens en entrée · 1,00 $ par million en sortie |
| Bonus | +5 % dès 50 $, +10 % dès 100 $ |
| Recharge | USDT (TRC20) ou USDC (Base), tout montant entier de 10 $ à 500 $ |
| Contenu | contenu adulte autorisé ; tout contenu sexuel impliquant des mineurs est refusé |
| Clés | une clé active par compte ; une nouvelle remplace l'ancienne |
| Connexion | Google ou e-mail et mot de passe |
Erreurs et solutions
Les erreurs arrivent en JSON avec un type stable ; les requêtes échouées ou refusées ne sont pas facturées.
| Code | Type | Signification |
|---|---|---|
400 | bad_request | JSON invalide, messages vides, mauvais paramètre ou contexte trop long |
401 | missing_key · invalid_key · key_revoked | clé absente, erronée ou remplacée |
402 | no_credit | plus de crédit — rechargez, la reprise est immédiate |
403 | content_blocked | contenu sexuel impliquant des mineurs — refusé, non facturé |
404 | not_found | endpoint inconnu |
413 | request_too_large | corps supérieur à 8 Mo |
429 | rate_limited · concurrency | au-delà de 300/min ou 8 en parallèle — patientez |
503 | upstream_busy | modèle occupé — réessayez dans quelques secondes |
Questions et réponses
Lire la documentationQuelle est la taille de la fenêtre de contexte ?
La fenêtre de contexte prend en charge jusqu'à 100 000 tokens pour le prompt d'entrée combiné et la complétion de sortie. Cela permet des conversations étendues ou le traitement de grands documents dans une seule requête.
Comment gérer le streaming en Python ?
Définissez le paramètre <code>stream</code> sur <code>true</code> dans votre appel API. Le SDK renverra un objet itérable qui restitue des blocs de texte au fur et à mesure de leur génération, permettant l'affichage en temps réel des réponses.
Puis-je utiliser cette API avec d'autres SDK OpenAI ?
Oui, l'API est compatible avec l'API OpenAI. Tout client qui prend en charge le format de l'API OpenAI peut se connecter en mettant à jour l'URL de base et la clé API. Cela inclut les bibliothèques pour Node.js, Go et d'autres langages.
Votre clé est à un formulaire de vous
Créez un compte, copiez la clé, modifiez l'URL de base. C'est toute la configuration.