Begrip van ongecensureerde inferentie
Wanneer ontwikkelaars een ongecensureerde chat-oplossing zoeken, staan ze vaak voor de afweging tussen flexibiliteit en kosten. Aggregators mengen meerdere modellen, wat latentie en onvoorspelbaar gedrag introduceert. Onze aanpak is eenvoudiger: we draaien één toegewijd, open-weight groot taalmodel op onze eigen servers. Dit zorgt voor consistent gedrag en verwijdert de ruis van modelrouting.
Het model is afgestemd om zonder inhoudsweigeringen te antwoorden voor wettelijk volwassen gebruik, wat het ideaal maakt voor creatief schrijven, roleplay of veiligheidsonderzoek waar standaardmodellen genuanceerde onderwerpen mogelijk blokkeren. Het is geen GPT, Claude of een model van een andere leverancier. De enige harde limiet die altijd geldt, is de weigering van seksuele inhoud met minderjarigen. Alle andere inhoud, van controversiële meningen tot expliciete fictieve scènes, is toegestaan. Deze single-engine-benadering betekent dat je precies weet wat je krijgt: tekst in, tekst uit, zonder verborgen aggregatielogica.
API-sleutelinstelling en authenticatie
Aan de slag met de ongecensureerde api is direct mogelijk. Je kunt je aanmelden via "Doorgaan met Google" of door een e-mailadres en wachtwoord op te geven. Er is geen telefoonnummer nodig en voor de initiële proefperiode is geen creditcard vereist. Na het aanmaken wordt je API-sleutel direct op het scherm getoond.
Elk account is beperkt tot één actieve sleutel. Als je een nieuwe sleutel genereert, wordt de oude vervangen. Deze sleutel wordt gebruikt om je verzoeken te authenticeren bij de basis-URL: https://api.uncensoredchat.top/v1. Deze URL is compatibel met de officiële OpenAI SDK's en elke client die het OpenAI-protocol ondersteunt. Werk gewoon de basis-URL van je client bij en stel de API-sleutel in de autorisatieheader in. De ongecensureerde ai api-sleutel is de enige referentie die je nodig hebt om verzoeken te versturen.
De chat-completie-payload construeren
Om de ongecensureerde chat-api te gebruiken, stuur je een POST-verzoek naar /v1/chat/completions. De payload volgt de standaard OpenAI-indeling, wat de integratie eenvoudig maakt als je al bekend bent met de OpenAI-API. Je moet het model-ID als "uncensored" opgeven. Dit vertelt de server je verzoek naar onze toegewijde inferentie-engine te routeren.
Het contextvenster ondersteunt in totaal 100.000 tokens, inclusief zowel de prompt als de completion. Je kunt een maximum output van 32.000 tokens per verzoek instellen. Als je max_tokens niet opgeeft, is de limiet standaard 2.048 tokens. Dit is voldoende voor de meeste standaardgebruiksscenario's, maar staat langere outputs toe wanneer nodig. Je kunt ook parameters instellen zoals temperature, top_p, stop en seed om de willekeurigheid en reproduceerbaarheid van de antwoorden te bepalen. De request body is beperkt tot 8 MB.
Streaming-antwoorden afhandelen
Voor toepassingen die baat hebben bij real-time feedback, ondersteunt de API streaming via Server-Sent Events (SSE). Wanneer je stream: true instelt in je verzoek, retourneert de server een stream van chunks. Elke chunk bevat een deel van het antwoord. De laatste chunk bevat de tokengebruiksstatistieken, zodat je het verbruik nauwkeurig kunt bijhouden.
Streaming is vooral nuttig voor chatinterfaces waar gebruikers directe tekstweergave verwachten. Het vermindert de waargenomen latentie vergeleken met wachten op het volledige antwoord. De chatbot-api zorgt ervoor dat alle standaardparameters worden ondersteund in streamingmodus. Je kunt de stream parseren met elke standaard SSE-clientbibliotheek. Let op: fouten of weigeringen worden niet in rekening gebracht, dus je kunt veilig streamen zonder je zorgen te maken over kosten voor mislukte verzoeken.
Function calling en tools inschakelen
Moderne LLM-toepassingen vereisen vaak gestructureerde interacties. Onze LLM-API ondersteunt function calling, ook wel tools genoemd. Je kunt een reeks functies definiëren in de tools parameter van je verzoek. Het model beslist vervolgens wanneer het een functie moet aanroepen op basis van de invoer van de gebruiker. Dit is nuttig voor taken zoals het extraheren van gegevens uit tekst, het uitvoeren van berekeningen of het triggeren van externe acties.
Je kunt tool_choice opgeven om het model te forceren een specifieke functie aan te roepen of het de keuze over te laten. De response_format parameter kan worden ingesteld op {"type": "json_object"} om te garanderen dat de output geldige JSON is, wat handig is bij het parseren van functieargumenten. Deze combinatie van tools en JSON-modus maakt de ongecensureerde api tot een krachtige keuze voor het bouwen van autonome agenten of complexe workflows die gestructureerde gegevensextrahering vereisen.
JSON-uitvoermodus afdwingen
Bij het integreren van LLM's in softwarepipelines is een betrouwbare outputindeling cruciaal. Door response_format in te stellen op {"type": "json_object"}, geef je het model de instructie alleen geldige JSON terug te geven. Dit elimineert de behoefte aan complexe regex-parsing of foutafhandeling voor slecht gevormde tekst. Het is vooral nuttig wanneer je gestructureerde gegevens extrahert of configuratiebestanden genereert.
Deze modus werkt samen met function calling, maar kan ook worden gebruikt voor eenvoudige gegevensextraheringstaken. Het model zal proberen zich aan de JSON-structuur te houden, hoewel het nog steeds gebonden is aan de inherente mogelijkheden van het model. Voor de beste resultaten geef je duidelijke instructies in de systeemprompt over de verwachte JSON-schema. Deze functie maakt de ongecensureerde chatbot-api tot een robuuste keuze voor backenddiensten die voorspelbare, machine-leesbare outputs vereisen.
Rate limits en gelijktijdige verzoeken beheren
Om eerlijk gebruik en stabiliteit te garanderen, handhaaft de nsfw-api specifieke rate limits. Je mag 300 verzoeken per minuut per API-sleutel versturen. Daarnaast kun je maximaal 8 gelijktijdige verzoeken tegelijk per sleutel hebben. Deze limiet voor gelijktijdige verzoeken is belangrijk voor toepassingen die meerdere parallelle verzoeken versturen, zoals batchverwerking of realtime chatsystemen.
Als je deze limieten overschrijdt, ontvang je een 429 Too Many Requests-fout. Het wordt aanbevolen om exponentiële backoff in je client te implementeren om deze fouten soepel af te handelen. De limiet van 8 MB voor de request body geldt ook voor elk verzoek. Deze limieten zijn consistent en transparant, zodat je je infrastructuur daarop kunt afstemmen. In tegenstelling tot sommige providers verbergen we deze limieten niet achter complexe tierstructuren; ze gelden uniform voor alle prepaid-gebruikers.
Facturatie en tokenberekening
Prijzen zijn eenvoudig: $0,25 per 1M input tokens en $1,00 per 1M output tokens. Je betaalt alleen voor wat je gebruikt, zonder maandelijkse abonnementen of verborgen kosten.tegoed wordt opgewaardeerd via crypto, en fouten of weigeringen zijn gratis. Dit betekent dat je alleen betaalt voor succesvolle voltooiingen. Het prepaid tegoed vervalt nooit, dus je kunt opwaarderen wanneer het jou uitkomt.
Opwaarderen met crypto wordt geaccepteerd in USDT (TRC20) of USDC (Base). Je kunt elk geheel bedrag van $10 tot $500 storten. Voor hogere stortingen bieden we bonus tegoed: +5% voor stortingen van $50 of meer, en +10% voor stortingen van $100 of meer. Er worden geen creditcards, PayPal of bankoverschrijvingen geaccepteerd. Je kunt je saldo en gebruik controleren in het dashboard. Als je een fout maakt, zoals een dubbele charge, kun je via de Support-pagina een correctie aanvragen, maar tegoed wordt niet terugbetaald omdat het nooit verloopt.
Privacy en inhoudslimieten
Privacy is een belangrijk aandachtspunt voor veel ontwikkelaars. Bij het aanmelden heb je alleen een e-mailadres nodig. Je prompts worden niet gebruikt voor het trainen van het model, waardoor je gegevens privé blijven. Dit is een aanzienlijk voordeel voor bedrijven die de API gebruiken voor eigendom van inhoud of gevoelige informatie. Het ongecensureerde chat model is ontworpen voor wettelijk volwassen gebruik, maar het handhaaft een harde limiet op seksuele inhoud met minderjarigen. Verzoeken die dergelijke inhoud bevatten, worden geweigerd.
Deze enkele inhoudslimiet staat een breed scala aan andere volwassen thema's, fictief geweld of controversiële meningen toe zonder onnodige censuur. Het model is geen GPT, Claude of een model van een andere leverancier, dus het gedrag is uniek voor onze tuning. Door de inferentie-engine eenvoudig en toegewijd te houden, zorgen we ervoor dat de privacy- en inhoudsbeleid consistent en voorspelbaar is. Je kunt erop vertrouwen dat je gegevens niet worden gebruikt om andere modellen te verbeteren, en je gebruik wordt niet gemonitord voor reclamedoeleinden.