Comprendre l'inférence sans censure
Lorsque les développeurs recherchent une solution de chat sans censure, ils font souvent face à un compromis entre flexibilité et coût. Les agrégateurs mélangent plusieurs modèles, introduisant de la latence et un comportement imprévisible. Notre approche est plus simple : nous exécutons un seul grand modèle de langage à poids ouverts dédié sur nos propres serveurs. Cela garantit un comportement cohérent et supprime le bruit du routage de modèles.
Le modèle est ajusté pour répondre sans refus de contenu pour une utilisation adulte légale, ce qui le rend idéal pour l'écriture créative, le jeu de rôle ou la recherche en sécurité où les modèles standard pourraient bloquer des sujets nuancés. Il ne s'agit pas de GPT, Claude ou de tout autre modèle de fournisseur. La seule limite stricte qui s'applique toujours est le refus du contenu sexuel impliquant des mineurs. Tous les autres contenus, des opinions controversées aux scènes explicites de fiction, sont autorisés. Cette approche à moteur unique signifie que vous savez exactement ce que vous obtenez : texte en, texte sortant, sans logique d'agrégation cachée.
Configuration de la clé API et authentification
La prise en main de l'API de chat sans censure est conçue pour être immédiate. Vous pouvez vous inscrire en utilisant « Continuer avec Google » ou en fournissant une adresse e-mail et un mot de passe. Aucun numéro de téléphone n'est requis, et aucune carte bancaire n'est nécessaire pour l'essai initial. Une fois créée, votre clé API s'affiche immédiatement à l'écran.
Chaque compte est limité à une clé active. Si vous générez une nouvelle clé, l'ancienne est remplacée. Cette clé est utilisée pour authentifier vos requêtes vers l'URL de base : https://api.uncensoredchat.top/v1. Cette URL est compatible avec les SDK OpenAI officiels et tout client prenant en charge le protocole OpenAI. Mettez simplement à jour l'URL de base de votre client et définissez la clé API dans l'en-tête d'autorisation. La clé api sans censure est la seule information d'identification dont vous avez besoin pour commencer à envoyer des requêtes.
Construction du payload de complétion de chat
Pour utiliser l'api de chat sans censure, vous envoyez une requête POST vers /v1/chat/completions. Le payload suit le format standard OpenAI, ce qui rend l'intégration simple si vous connaissez déjà l'API OpenAI. Vous devez spécifier l'ID du modèle comme "uncensored". Cela indique au serveur de router votre requête vers notre moteur d'inférence dédié.
La fenêtre de contexte prend en charge 100 000 tokens au total, incluant à la fois le prompt et la complétion. Vous pouvez définir une sortie maximale de 32 000 tokens par requête. Si vous ne spécifiez pas max_tokens, la limite par défaut est de 2 048 tokens. Cela suffit pour la plupart des cas d'utilisation standards, mais permet des sorties plus longues si nécessaire. Vous pouvez également définir des paramètres comme temperature, top_p, stop et seed pour contrôler l'aléatoire et la reproductibilité des réponses. Le corps de la requête est limité à 8 Mo.
Gestion des réponses en streaming
Pour les applications bénéficiant d'une rétroaction en temps réel, l'API prend en charge le streaming via les Server-Sent Events (SSE). Lorsque vous définissez stream: true dans votre requête, le serveur renvoie un flux de chunks. Chaque chunk contient une partie de la réponse. Le dernier chunk inclut les statistiques d'utilisation des tokens, vous permettant de suivre la consommation avec précision.
Le streaming est particulièrement utile pour les interfaces de chat où les utilisateurs s'attendent à une apparition immédiate du texte. Il réduit la latence perçue par rapport à l'attente de la réponse complète. L'API de chatbot sans censure garantit que tous les paramètres standards sont pris en charge en mode streaming. Vous pouvez analyser le flux à l'aide de n'importe quelle bibliothèque cliente SSE standard. Notez que les erreurs ou les refus ne sont pas facturés, vous pouvez donc streamer en toute sécurité sans vous soucier des coûts pour les requêtes échouées.
Activation de l'appel de fonctions et des outils
Les applications LLM modernes nécessitent souvent des interactions structurées. Notre API LLM sans censure prend en charge l'appel de fonctions, également appelé outils. Vous pouvez définir un ensemble de fonctions dans le paramètre tools de votre requête. Le modèle décidera ensuite quand appeler une fonction en fonction de l'entrée de l'utilisateur. Cela est utile pour des tâches comme l'extraction de données à partir de texte, l'exécution de calculs ou le déclenchement d'actions externes.
Vous pouvez spécifier tool_choice pour forcer le modèle à appeler une fonction spécifique ou lui laisser le choix. Le paramètre response_format peut être défini sur {"type": "json_object"} pour garantir que la sortie est un JSON valide, ce qui est utile lors de l'analyse des arguments de fonction. Cette combinaison d'outils et du mode JSON fait de l'API sans censure un choix puissant pour la création d'agents autonomes ou de workflows complexes nécessitant une extraction de données structurée.
Forcer le mode de sortie JSON
Lors de l'intégration de LLM dans des pipelines logiciels, le format de sortie fiable est critique. En définissant response_format sur {"type": "json_object"}, vous instruisez le modèle à ne renvoyer que du JSON valide. Cela élimine le besoin d'analyse regex complexe ou de gestion d'erreurs pour le texte mal formé. C'est particulièrement utile lorsque vous extrayez des données structurées ou générez des fichiers de configuration.
Ce mode fonctionne en conjonction avec l'appel de fonctions, mais peut également être utilisé pour des tâches simples d'extraction de données. Le modèle tentera de respecter la structure JSON, bien qu'il soit toujours limité par les capacités inhérentes du modèle. Pour de meilleurs résultats, fournissez des instructions claires dans le prompt système concernant le schéma JSON attendu. Cette fonctionnalité fait de l'API de chatbot sans filtre un choix robuste pour les services backend nécessitant des sorties prévisibles et lisibles par machine.
Gestion des limites de débit et de la concurrence
Pour garantir une utilisation équitable et la stabilité, l'API NSFW applique des limites de débit spécifiques. Vous avez droit à 300 requêtes par minute par clé API. De plus, vous pouvez avoir jusqu'à 8 requêtes simultanées en même temps par clé. Cette limite de concurrence est importante pour les applications qui envoient plusieurs requêtes simultanées, comme le traitement par lots ou les systèmes de chat en temps réel.
Si vous dépassez ces limites, vous recevrez une erreur 429 Too Many Requests. Il est recommandé d'implémenter une rétrogradation exponentielle dans votre client pour gérer ces erreurs avec élégance. La limite de corps de requête de 8 Mo s'applique également à chaque requête. Ces limites sont cohérentes et transparentes, vous permettant de planifier votre infrastructure en conséquence. Contrairement à certains fournisseurs, nous ne cachons pas ces limites derrière des structures de niveaux complexes ; elles s'appliquent uniformément à tous les utilisateurs prépayés.
Facturation et calcul des tokens
La tarification est simple : 0,25 $ par 1M de tokens d'entrée et 1,00 $ par 1M de tokens de sortie. Vous ne payez que ce que vous utilisez, sans abonnements mensuels ni frais cachés. Le crédit est rechargé via crypto, et les erreurs ou les refus sont gratuits. Cela signifie que vous ne payez que pour les complétions réussies. Le crédit prépayé n'expire jamais, vous pouvez donc recharger lorsque cela vous arrange.
Les recharges crypto sont acceptées en USDT (TRC20) ou USDC (Base). Vous pouvez déposer n'importe quel montant entier de 10 $ à 500 $. Pour les dépôts plus importants, nous offrons un crédit bonus : +5 % pour les dépôts de 50 $ ou plus, et +10 % pour les dépôts de 100 $ ou plus. Aucune carte, PayPal ou virement bancaire n'est accepté. Vous pouvez vérifier votre solde et votre utilisation dans le tableau de bord. Si vous faites une erreur, comme un double débit, vous pouvez demander une correction via la page Support, mais le crédit lui-même n'est pas remboursé car il n'expire jamais.
Confidentialité et limites de contenu
La confidentialité est une préoccupation majeure pour de nombreux développeurs. Lors de votre inscription, vous n'avez besoin que d'une adresse e-mail. Vos prompts ne sont pas utilisés pour l'entraînement du modèle, garantissant que vos données restent privées. C'est un avantage significatif pour les entreprises utilisant l'API pour du contenu propriétaire ou des informations sensibles. Le modèle de chat sans censure est conçu pour une utilisation adulte légale, mais il impose une limite stricte sur le contenu sexuel impliquant des mineurs. Les requêtes contenant un tel contenu seront refusées.
Cette limite de contenu unique permet une large gamme d'autres thèmes pour adultes, de violence fictive ou d'opinions controversées sans censure inutile. Le modèle n'est pas GPT, Claude ou tout autre modèle de fournisseur, donc son comportement est unique à notre ajustement. En gardant le moteur d'inférence simple et dédié, nous nous assurons que les politiques de confidentialité et de contenu sont cohérentes et prévisibles. Vous pouvez avoir confiance que vos données ne sont pas utilisées pour améliorer d'autres modèles, et votre utilisation n'est pas surveillée à des fins publicitaires.