https://api.serverlessllmapi.com/v1
Documentazione API: Guida rapida
Inizia a utilizzare l'API LLM serverless in pochi minuti. Questa guida rapida copre l'autenticazione, le richieste di chat, lo streaming e la chiamata di strumenti con la nostra interfaccia compatibile con OpenAI.
URL di base e autenticazione
L'API serverless llm utilizza la struttura standard degli endpoint compatibile con OpenAI. Per iniziare, hai bisogno di due informazioni: il tuo URL di base e la tua chiave API.
Utilizza il seguente URL di base per tutte le richieste:
https://api.serverlessllmapi.com/v1
L'autenticazione viene gestita tramite l'intestazione Authorization. Crea un account nella pagina Ottieni chiave API per ricevere la tua chiave. Puoi rigenerare questa chiave in qualsiasi momento, revocando istantaneamente quella vecchia. Mantieni la chiave al sicuro, poiché fornisce accesso diretto ai tuoi crediti prepagati.
Prima richiesta: Completamenti chat
Invia una richiesta standard di completamento chat all'endpoint /v1/chat/completions. L'API accetta un nome del modello, un elenco di messaggi e parametri opzionali. Il nostro ID modello predefinito è uncensored, ottimizzato per risposte di alta qualità e senza restrizioni.
Ecco un esempio di base che utilizza curl per generare una risposta:
curl https://api.serverlessllmapi.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'La risposta segue il formato JSON standard di OpenAI. Se la richiesta ha esito positivo, riceverai un oggetto di completamento contenente il testo generato. Questa semplicità ti consente di sostituire il nostro endpoint nelle configurazioni SDK OpenAI esistenti semplicemente modificando l'URL di base e la chiave.
Integrazione SDK Python
L'utilizzo dell'SDK Python ufficiale di OpenAI è il modo più veloce per integrare. Poiché la nostra API è compatibile con OpenAI, è sufficiente sovrascrivere l'URL di base e la chiave API. Questo garantisce che il tuo codice esistente funzioni senza modifiche.
from openai import OpenAI
client = OpenAI(base_url="https://api.serverlessllmapi.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)Questo approccio ti consente di sfruttare le librerie Python familiari beneficiando al contempo del nostro modello senza censura. La finestra di contesto supporta fino a 100.000 token, consentendo lunghezze di input e output consistenti in una singola richiesta. Assicurati che la tua matrice di messaggi includa i prompt di sistema e utente necessari per guidare efficacemente il modello.
Integrazione SDK Node.js
Per gli sviluppatori JavaScript e TypeScript, l'SDK Node di OpenAI offre un percorso di integrazione semplice. Configura il client con il nostro URL di base e la tua chiave API per iniziare a effettuare richieste immediatamente.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.serverlessllmapi.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Questa configurazione è ideale per funzioni serverless o servizi backend che richiedono interazioni LLM in tempo reale. Il prezzo a consumo significa che paghi solo per ciò che usi, senza abbonamenti mensili. I crediti non scadono, quindi puoi interrompere l'uso tra i progetti senza perdere il saldo.
Risposte in streaming (SSE)
Abilita lo streaming impostando stream: true nella tua richiesta. L'API restituirà uno stream Server-Sent Events (SSE), consentendoti di visualizzare i token man mano che vengono generati. Ciò riduce la latenza percepita per gli utenti finali e migliora l'esperienza per le applicazioni di chat.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)Gestisci gli eventi di stream nel codice client per accumulare la risposta finale. Lo streaming funziona sia con gli SDK Python che Node.js se configurati correttamente. Questa funzione è particolarmente utile per la generazione di contenuti di lunga durata dove il feedback immediato è prezioso.
Limiti di velocità e vincoli
Comprendi i vincoli per garantire un'integrazione fluida. L'API impone un limite di richieste di 300 richieste al minuto per chiave API. Il corpo di ogni richiesta non deve superare 8 MB. Se superi il limite di velocità, riceverai un codice di stato 429.
Gli errori di autenticazione restituiscono un codice di stato 401, indicando una chiave non valida o revocata. Se il tuo credito prepagato è esaurito, le richieste restituiranno un codice di stato 402. L'ID modello uncensored non supporta embedding, generazione di immagini o affinamento. Attieniti ai completamenti di chat basati su testo per prestazioni ottimali.
Scheda tecnica dell'API
Tutti i limiti e le funzioni reali dell'API in un unico posto: controllali prima di ricaricare.
| Voce | Valore |
|---|---|
| Formato | compatibile OpenAI: qualsiasi SDK OpenAI funziona cambiando base URL e chiave |
| ID modello | uncensored |
| Autenticazione | Authorization: Bearer YOUR_KEY |
| Base URL | https://api.serverlessllmapi.com/v1 |
| Endpoint | POST /v1/chat/completions · GET /v1/models |
| Function calling | sì — tools, tool_choice; risposte con tool_calls anche in streaming; risultati come role: tool |
| Streaming | sì — server-sent events; l'ultimo blocco riporta l'uso dei token |
| Finestra di contesto | 100.000 token (input + output) |
| Parametri | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Output massimo | fino al resto della finestra di 100.000 token; max_tokens opzionale (nessun limite separato) |
| Modalità JSON | response_format: {"type": "json_object"} |
| Concorrenza | 8 richieste contemporanee per chiave |
| Header | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Dimensione | fino a 8 MB per richiesta |
| Limite di frequenza | 300 richieste al minuto per chiave |
| Scadenza | il credito pagato non scade, nessun abbonamento |
| Fatturazione | credito prepagato in base all'uso reale; errori e rifiuti gratuiti |
| Prova gratuita | $0,50 per 7 giorni, senza carta · Chiave di prova: 2 richieste parallele, 60 al minuto; limiti completi (8 e 300) dopo la prima ricarica |
| Prezzo | $0,25 per 1M token in input · $1,00 per 1M in output |
| Bonus | +5% da $50, +10% da $100 |
| Ricarica | USDT (TRC20) o USDC (Base), qualsiasi importo intero da $10 a $500 |
| Contenuti | contenuti per adulti consentiti; rifiutati i contenuti sessuali con minori |
| Chiavi | una chiave attiva per account; una nuova sostituisce la precedente |
| Accesso | Google oppure e-mail e password |
Codici di errore
Gli errori arrivano in JSON con un type fisso; le richieste fallite o rifiutate non si pagano.
| Codice | Tipo | Significato |
|---|---|---|
400 | bad_request | JSON non valido, messaggi vuoti, parametro errato o contesto troppo lungo |
401 | missing_key · invalid_key · key_revoked | chiave mancante, errata o sostituita |
402 | no_credit | credito esaurito — ricarica e riparti subito |
403 | content_blocked | contenuti sessuali con minori — rifiutato, non addebitato |
404 | not_found | endpoint sconosciuto |
413 | request_too_large | corpo oltre 8 MB |
429 | rate_limited · concurrency | oltre 300/min o 8 in parallelo — attendi e riprova |
503 | upstream_busy | modello occupato — riprova tra pochi secondi |
Domande e risposte
Leggi la documentazioneQual è la dimensione della finestra di contesto?
La finestra di contesto supporta fino a 100.000 token per il prompt di input combinato e il completamento di output. Ciò consente conversazioni estese o l'elaborazione di documenti di grandi dimensioni in una singola richiesta.
Come gestire lo streaming in Python?
Imposta il parametro <code>stream</code> su <code>true</code> nella tua chiamata API. L'SDK restituirà un oggetto iterabile che restituisce chunk di testo man mano che vengono generati, consentendo la visualizzazione in tempo reale delle risposte.
Posso usare questa API con altri SDK OpenAI?
Sì, l'API è compatibile con OpenAI. Qualsiasi client che supporta il formato dell'API OpenAI può connettersi aggiornando l'URL di base e la chiave API. Questo include le librerie per Node.js, Go e altri linguaggi.
La tua chiave è a un modulo di distanza
Crea un account, copia la chiave, modifica l'URL di base. È tutta qui la configurazione.