FR ▾

API LLM sans curation, prête à l'emploi

Obtenir une clé API
par 1M tokens d'entrée
$0,25
Tokens de sortie / 1M
$1,00
fenêtre de contexte de tokens
100 000
crédit d'essai
$0,50
requêtes par minute
300

Serverless LLM APIDocumentation API : Démarrage rapide

https://api.serverlessllmapi.com/v1

https://api.serverlessllmapi.com/v1

Documentation API : Démarrage rapide

Commencez à utiliser l'API LLM serverless en quelques minutes. Ce guide de démarrage rapide couvre l'authentification, les requêtes de chat, le streaming et l'appel de fonctions avec notre interface compatible OpenAI.

URL de base et authentification

L'API LLM serverless utilise la structure standard des endpoints compatibles OpenAI. Pour commencer, vous avez besoin de deux éléments : votre URL de base et votre clé API.

Utilisez l'URL de base suivante pour toutes les requêtes :

https://api.serverlessllmapi.com/v1

L'authentification est gérée via l'en-tête Authorization. Créez un compte sur la page Clé API pour recevoir votre clé. Vous pouvez régénérer cette clé à tout moment, ce qui révoque instantanément l'ancienne. Conservez votre clé en sûreté, car elle donne un accès direct à vos crédits prépayés.

Première requête : Complétions de chat

Envoyez une requête standard de complétion de chat à l'endpoint /v1/chat/completions. L'API accepte un nom de modèle, une liste de messages et des paramètres optionnels. Notre ID de modèle par défaut est uncensored, optimisé pour des réponses de haute qualité et sans restriction.

Voici un exemple de base utilisant curl pour générer une réponse :

curl https://api.serverlessllmapi.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

La réponse suit le format JSON standard d'OpenAI. Si la requête est réussie, vous recevrez un objet de complétion contenant le texte généré. Cette simplicité vous permet de remplacer notre endpoint dans les configurations existantes des SDK OpenAI en modifiant simplement l'URL de base et la clé.

Intégration SDK Python

L'utilisation du SDK Python officiel d'OpenAI est le moyen le plus rapide d'intégrer notre service. Notre API étant compatible avec l'API OpenAI, vous n'avez qu'à remplacer l'URL de base et la clé API. Cela garantit que votre code existant fonctionne sans modification.

from openai import OpenAI

client = OpenAI(base_url="https://api.serverlessllmapi.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Cette approche vous permet de tirer parti des bibliothèques Python familières tout en bénéficiant de notre modèle sans censure. La fenêtre de contexte prend en charge jusqu'à 100 000 tokens, permettant des longueurs d'entrée et de sortie substantielles dans une seule requête. Assurez-vous que votre tableau de messages inclut les prompts système et utilisateur nécessaires pour guider efficacement le modèle.

Intégration SDK Node.js

Pour les développeurs JavaScript et TypeScript, le SDK Node.js d'OpenAI offre un chemin d'intégration simple. Configurez le client avec notre URL de base et votre clé API pour commencer à effectuer des requêtes immédiatement.

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.serverlessllmapi.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Cette configuration est idéale pour les fonctions serverless ou les services backend qui nécessitent des interactions LLM en temps réel. La tarification à l'usage signifie que vous ne payez que ce que vous utilisez, sans abonnements mensuels. Les crédits n'expirent jamais, vous pouvez donc suspendre l'utilisation entre les projets sans perdre votre solde.

Réponses en streaming (SSE)

Activez le streaming en définissant stream: true dans votre requête. L'API renverra un flux Server-Sent Events (SSE), vous permettant d'afficher les tokens au fur et à mesure de leur génération. Cela réduit la latence perçue pour les utilisateurs finaux et améliore l'expérience pour les applications de chat.

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Gérez les événements de flux dans votre code client pour accumuler la réponse finale. Le streaming fonctionne avec les SDK Python et Node.js lorsqu'ils sont configurés correctement. Cette fonctionnalité est particulièrement utile pour la génération de contenu long où un retour immédiat est précieux.

Limites de débit et contraintes

Comprenez les contraintes pour assurer une intégration fluide. L'API applique une limite de débit de 300 requêtes par minute par clé API. Le corps de chaque requête ne doit pas dépasser 8 MB. Si vous dépassez la limite de débit, vous recevrez un code de statut 429.

Les erreurs d'authentification renvoient un statut 401, indiquant une clé invalide ou révoquée. Si votre crédit prépayé est épuisé, les requêtes retourneront un statut 402. L'ID de modèle uncensored ne prend pas en charge les embeddings, la génération d'images ou le fine-tuning. Limitez-vous aux complétions de chat textuelles pour des performances optimales.

Fonctions et limites

Toutes les limites et fonctions réelles de l'API au même endroit — vérifiez-les avant de recharger.

ÉlémentValeur
Formatcompatible OpenAI : tout SDK OpenAI fonctionne en changeant la base URL et la clé
ID du modèleuncensored
AuthentificationAuthorization: Bearer YOUR_KEY
Base URLhttps://api.serverlessllmapi.com/v1
EndpointsPOST /v1/chat/completions · GET /v1/models
Appel de fonctionsoui — tools, tool_choice ; réponse avec tool_calls, aussi en streaming ; résultats en role: tool
Streamingoui — server-sent events ; le dernier bloc contient l'usage des tokens
Fenêtre de contexte100 000 tokens (entrée + sortie)
Paramètrestemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Sortie max.jusqu'au reste de la fenêtre de 100 000 tokens ; max_tokens optionnel (pas de plafond distinct)
Mode JSONresponse_format: {"type": "json_object"}
Concurrence8 requêtes simultanées par clé
En-têtesX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Taillejusqu'à 8 Mo par requête
Limite de débit300 requêtes par minute et par clé
Validitéle crédit payé n'expire jamais, sans abonnement
Facturationcrédit prépayé selon l'usage réel ; erreurs et refus gratuits
Essai gratuit0,50 $ pendant 7 jours, sans carte · Clé d'essai : 2 requêtes parallèles, 60 par minute ; limites complètes (8 et 300) après la 1re recharge
Prix0,25 $ par million de tokens en entrée · 1,00 $ par million en sortie
Bonus+5 % dès 50 $, +10 % dès 100 $
RechargeUSDT (TRC20) ou USDC (Base), tout montant entier de 10 $ à 500 $
Contenucontenu adulte autorisé ; tout contenu sexuel impliquant des mineurs est refusé
Clésune clé active par compte ; une nouvelle remplace l'ancienne
ConnexionGoogle ou e-mail et mot de passe

Erreurs et solutions

Les erreurs arrivent en JSON avec un type stable ; les requêtes échouées ou refusées ne sont pas facturées.

CodeTypeSignification
400bad_requestJSON invalide, messages vides, mauvais paramètre ou contexte trop long
401missing_key · invalid_key · key_revokedclé absente, erronée ou remplacée
402no_creditplus de crédit — rechargez, la reprise est immédiate
403content_blockedcontenu sexuel impliquant des mineurs — refusé, non facturé
404not_foundendpoint inconnu
413request_too_largecorps supérieur à 8 Mo
429rate_limited · concurrencyau-delà de 300/min ou 8 en parallèle — patientez
503upstream_busymodèle occupé — réessayez dans quelques secondes

Questions et réponses

Lire la documentation
Quelle est la taille de la fenêtre de contexte ?

La fenêtre de contexte prend en charge jusqu'à 100 000 tokens pour le prompt d'entrée combiné et la complétion de sortie. Cela permet des conversations étendues ou le traitement de grands documents dans une seule requête.

Comment gérer le streaming en Python ?

Définissez le paramètre <code>stream</code> sur <code>true</code> dans votre appel API. Le SDK renverra un objet itérable qui restitue des blocs de texte au fur et à mesure de leur génération, permettant l'affichage en temps réel des réponses.

Puis-je utiliser cette API avec d'autres SDK OpenAI ?

Oui, l'API est compatible avec l'API OpenAI. Tout client qui prend en charge le format de l'API OpenAI peut se connecter en mettant à jour l'URL de base et la clé API. Cela inclut les bibliothèques pour Node.js, Go et d'autres langages.

Votre clé est à un formulaire de vous

Créez un compte, copiez la clé, modifiez l'URL de base. C'est toute la configuration.