DE ▾
API-Schlüssel erhalten

LLM Non CensureGuide

Unzensierte KI: Schritt-für-Schritt-API-Integrationsleitfaden

Die Integration einer unzensierten KI in deine Anwendungen ermöglicht es dir, die volle kreative Freiheit zu bewahren, sei es für Fiktion, Forschung oder Erwachseneninhalte, ohne die willkürlichen Ablehnungen von General-Modellen. Dieser technische Leitfaden erklärt, wie du von einem schweren lokalen Modell zu einer zuverlässigen, OpenAI-kompatiblen API ohne Zensur wechselst, für eine schnelle und nahtlose Integration.

Aktualisiert

Schlüsselinformationen

  1. Eine unzensierte KI setzt keine subjektiven Grenzen für erwachsene, kontroverse oder kreative Themen.

  2. Die OpenAI-kompatible API vereinfacht die technische Integration durch Wiederverwendung bestehender SDKs und Logik.

  3. Das unzensierte Modell unterstützt ein Kontextfenster von 100.000 Token, um lange Gespräche oder umfangreiche Dokumente zu verarbeiten.

  4. Das Pay-as-you-go-Modell eliminiert Fixkosten für eine preismäßige Abrechnung entsprechend deiner tatsächlichen Nutzung.

Was ist eine unzensierte KI?

Im Gegensatz zu allgemeinen Modellen, die starre Moderationsschichten anwenden, ist ein unzensiertes Modell darauf ausgelegt, auf eine breite Palette von Prompts zu antworten, ohne systematisch abzulehnen. Diese Modelle sind oft speziell angepasst (fine-tuned), um erwachsene Themen, fiktionale Gewalt, kontroverse Meinungen oder kreative Nuancen zu tolerieren, die große Anbieter oft als riskant betrachten.

Das Grundprinzip ist einfach: Das Modell bewertet die Relevanz und Qualität der Antwort, nicht die Konformität zu einer auferlegten sozialen Norm. Dies ermöglicht es Entwicklern, vollständige und nuancierte Antworten abzurufen, die für Anwendungen zur Geschichtenerzählung, Rollenspielen oder der Analyse sensibler Daten unerlässlich sind.

Es ist wichtig zu beachten, dass „unzensiert“ nicht „ohne jegliche Grenze“ bedeutet. Zum Beispiel blockiert unser Modell spezifisch sexuelle Inhalte, die Minderjährige involvieren, eine logische und rechtliche Grenze, die systematisch gilt. Im Übrigen ist die Freiheit vollständig.

Warum eine API statt eines lokalen Modells nutzen?

Ein Large Language Model (LLM) lokal auszuführen bietet totale Autonomie, erfordert jedoch teure Hardware-Infrastruktur und ständige Wartung. Eine gehostete API für unzensierte KI verlagert diese Komplexität auf einen Diensteanbieter, sodass du dich auf die Entwicklung deiner Anwendung konzentrieren kannst.

  • Verwaltete Infrastruktur: Keine Notwendigkeit, GPUs, Treiber-Updates oder Serverneustarts zu verwalten.
  • Skalierbarkeit: Die API übernimmt die Last für dich, mit klaren Grenzen (300 Anfragen pro Minute pro Schlüssel).
  • Vorhersehbare Kosten: Mit einem Pay-as-you-go-Modell zahlst du nur, was du verbrauchst, ohne obligatorisches monatliches Abonnement.

Darüber hinaus standardisiert die Nutzung einer OpenAI-kompatiblen API die Integration. Du musst kein proprietäres Protokoll lernen; du verwendest einfach die Bibliotheken, die du bereits kennst.

Technische Voraussetzungen für die Integration

Um eine LLM-API effektiv zu integrieren, benötigst du eine Entwicklungsumgebung, die HTTP-Anfragen und Streaming verarbeiten kann. Hier sind die wichtigsten Elemente:

  • API-Schlüssel: Eindeutiger Identifikator zur Authentifizierung deiner Anfragen beim Dienst.
  • SDK-Bibliothek: Bevorzuge das offizielle OpenAI-SDK oder ein kompatibles Äquivalent, um die Verwaltung von Headern und Authentifizierung zu vereinfachen.
  • Streaming-Verwaltung: Unverzichtbar für eine gute Benutzererfahrung, da sie es ermöglicht, die Antwort Token für Token anzuzeigen, anstatt auf das Ende der Verarbeitung zu warten.
  • Lastgrenzen: Sei dir der Grenzen für die Anforderungskörpergröße (8 MB) bewusst, um 413-Fehler zu vermeiden.

Die Kompatibilität mit der OpenAI-Schnittstelle garantiert, dass dein Code portabel und einfach zu warten bleibt, selbst wenn du dich entscheidest, den Modellanbieter in Zukunft zu wechseln.

Schritt 1: Konto erstellen und Schlüssel abrufen

Der erste Schritt zum Zugriff auf eine unzensierte LLM-API ist die Erstellung eines Kontos. Auf unserer Plattform ist der Prozess minimalistisch: Für den Einstieg ist keine Kreditkarte erforderlich.

  1. Gehe zur Registrierungsseite und gib eine E-Mail-Adresse und ein Passwort an.
  2. Nach der Registrierung wird dein API-Schlüssel sofort angezeigt. Kopiere ihn und bewahre ihn sicher auf.
  3. Du erhältst automatisch ein kostenloses Testguthaben von 0,50 $, das 7 Tage gültig ist, um die Integration risikofrei zu testen.

Jedes Konto ist mit einem einzigen API-Schlüssel verknüpft. Wenn du den Zugriff widerrufen oder die Umgebung wechseln musst (z. B. von der Entwicklung zur Produktion), kannst du den Schlüssel jederzeit über dein Dashboard neu generieren. Der alte Schlüssel wird sofort ungültig.

Schritt 2: OpenAI-kompatiblen Client konfigurieren

Um unseren Dienst zu nutzen, musst du deinen Client so konfigurieren, dass er auf unsere Base URL zeigt, anstatt auf die von OpenAI. Dies geschieht normalerweise durch Festlegen der Umgebungsvariable OPENAI_BASE_URL oder durch explizites Übergeben des Parameters base_url in deinem SDK.

  • Base URL: https://api.llmnoncensure.com/v1
  • Modell-ID: uncensored

Diese Konfiguration ermöglicht es deiner Anwendung, exakt dieselben Methoden wie chat.completions.create() zu verwenden, die du auch mit GPT-4 nutzen würdest, sendet die Daten jedoch an unsere dedizierte Infrastruktur. Stelle sicher, dass dein SDK auf dem neuesten Stand ist, um die neuesten Funktionen wie Function Calling zu nutzen.

Schritt 3: Erster API-Aufruf mit Streaming

Streaming ist entscheidend für interaktive Anwendungen. Es ermöglicht dem Benutzer, die Antwort in Echtzeit entstehen zu sehen. Hier ist, wie du eine Basisanfrage strukturierst:

  • Verwende die Methode POST auf dem Endpunkt /v1/chat/completions.
  • Setze den Parameter stream auf true.
  • Sende deine Nachrichtenliste im Anfragetext.

Der Server gibt einen Server-Sent Events (SSE)-Datenstrom zurück. Jedes Ereignis enthält einen Antwortfragment. Dein Client muss diese Fragmente aggregieren, um den vollständigen Text anzuzeigen. Diese Methode reduziert die wahrgenommene Latenz und bietet ein flüssiges Erlebnis.

Schritt 4: Verwaltung langer Kontexte (100k Token)

Unser Modell unterstützt ein Kontextfenster von 100.000 Token, was für die meisten Anwendungsfälle erheblich ist. So kannst du lange Gesprächsverläufe oder große Dokumente als Eingabe senden.

Achte auf die Speicherverwaltung auf Client-Seite: Obwohl das Modell 100k Token verarbeiten kann, beträgt die Grenze für die Größe des Anfragetextes 8 MB. Stelle sicher, dass dein JSON-Anfragetext diese Grenze nicht überschreitet. Für Anwendungsfälle, die mehr Kontext benötigen, erwäge, ältere Gespräche zusammenzufassen oder Dokumente in Chunks aufzuteilen.

Die effektive Verwaltung des Kontexts ist entscheidend, um die Konsistenz in Chat- oder virtuellen Assistenten-Anwendungen aufrechtzuerhalten und gleichzeitig die Token-Kosten zu optimieren.

Schritt 5: Kostenoptimierung mit Pay as you go

Unser Preismodell ist transparent und ohne Abonnement. Du zahlst nur für die verbrauchten Token.

  • Eingabe-Token: 0,25 $ pro Million Token.
  • Ausgabe-Token: 1,00 $ pro Million Token.

Du lädst dein Konto mit einem Prepaid-Guthaben auf (ab 10 $). Bei Aufladungen von 50 $ wird ein Bonus von +5 % gewährt, bei 100 $ +10 %. Das Guthaben verfällt nie, sodass du ohne Druck testen kannst. Dieser Ansatz ist ideal für Projekte mit unregelmäßigen Nutzungsspitzen, da du nicht für ungenutzte Kapazität zahlst.

Häufig gestellte Fragen

Blockiert das Modell alle Erwachseneninhalte?

Nein, das Modell wurde speziell darauf trainiert, legale Erwachseneninhalte nicht abzulehnen. Es gilt jedoch immer eine strenge Grenze: Sexuelle Inhalte mit Minderjährigen werden blockiert. Im Übrigen hast du volle Freiheit für Fiktion, Kunst oder Analyse.

Kann ich dieses Modell für kommerzielle Anwendungen verwenden?

Ja, die Nutzung ist frei und ohne Einschränkung der Nutzungsart. Du zahlst nur für die über dein Prepaid-Guthaben verbrauchten Token. Es gibt keine zusätzlichen Gebühren für die kommerzielle Nutzung, keine Lizenzgebühren pro Anwendung und keine spezifischen Volumengrenzen außer dem Ratenlimit (300 Anfragen/Minute).

Was ist der Unterschied zwischen diesem Modell und GPT-4 oder Claude?

Im Gegensatz zu GPT-4 oder Claude, die strenge Moderationsschichten und Compliance-Regeln anwenden, ist dieses Modell auf Antwortfreiheit optimiert. Es basiert nicht auf der Architektur dieser großen Modelle, sondern ist ein Open-Weight-Modell, das darauf ausgelegt ist, Nuancen, kontroverse Themen und erwachsene Inhalte ohne systematische Ablehnung zu tolerieren.

Werden meine Daten zum Training des Modells verwendet?

Nein, deine Prompts und Antworten werden nicht zum Training des Modells verwendet. Die Vertraulichkeit ist garantiert: Du zahlst für eine dedizierte Rechenleistung über dein Konto, ohne langfristige Verpflichtungen und ohne Weitergabe deiner Daten an Dritte.

Dein Schlüssel ist nur einen Schritt entfernt

Erstelle ein Konto, kopiere den Schlüssel, ändere die Basis-URL. Das ist alles.

API-Schlüssel erhaltenDokumentation lesen