Anfrageform
Chat-Completions mit Tool-Aufrufen und Streaming. Wenn Ihr Gerüst das spricht, ist die Änderung eine Basis-URL.
Wenn Sie ein Agenten-Gerüst aufsetzen, ist der Endpunkt ein Konfigurationswert. Bei den meisten Gerüsten ist das eine Zeile — alles Kaufmännische drumherum übernehmen wir.
Ein Harness ist das Gerüst um ein Modell: die Schleife, die Werkzeuge aufruft, Zustand hält, wiederholt und entscheidet, wann es fertig ist. Das ist echte Ingenieursarbeit — und genau der Teil, den Sie nicht neu schreiben sollten. Der Modellendpunkt darunter ist ein Konfigurationswert.
Gerüste, die auf der OpenAI-kompatiblen Anfrageform aufbauen, nehmen eine Basis-URL und einen Schlüssel. Richten Sie beides auf uns, und das Gerüst läuft weiter — gleiche Werkzeuge, gleiche Prompts, gleiche Schleife. Wenn Ihr Gerüst um das native SDK eines anderen Anbieters herum gebaut ist, sagen Sie es uns, und wir sind ehrlich, ob das eine Sache von fünf Minuten oder ein echtes Projekt ist.
Chat-Completions mit Tool-Aufrufen und Streaming. Wenn Ihr Gerüst das spricht, ist die Änderung eine Basis-URL.
1 Mio. Token Kontext und bis zu 384K Ausgabe. Agentenschleifen sammeln schnell Kontext an — das ist meist mehr Spielraum, als Sie brauchen.
Agentenschleifen schicken bei jedem Schritt ein wachsendes Präfix erneut. Prompt-Caching hält das bezahlbar — und ist meist das Erste, was wir mit Ihnen ansehen.
Bitten Sie uns um einen begrenzten Schlüssel und fahren Sie Ihr echtes Gerüst dagegen. Der Test an Ihrer eigenen Last schlägt jeden Benchmark, den wir zeigen könnten.
Ja — Tool-Aufrufe und Streaming gehören zur Chat-Completions-Form, und die offiziellen SDKs laufen unverändert. Wenn Ihr Gerüst eine Anbieter-Abstraktion hat, fügen Sie uns als weiteren Anbieter hinzu.
Auf GitHub gibt es quelloffene Gerüste; wir sind keines davon. Wir sind der Endpunkt, auf den ein Gerüst zeigt, nicht das Gerüst selbst — wenn Sie Ihres in einem Repository gefunden haben, liegt die Änderung in seiner Konfiguration und nicht im Code: Basis-URL und API-Schlüssel, dann gegen Ihre eigene Last laufen lassen.
Die Parallelität geht bei Flash bis 2.500, der Kontext liegt bei 1 Mio. Token. Sehr lange autonome Läufe werden meist durch Ihr eigenes Zeitbudget begrenzt, nicht durch die API. Nennen Sie uns Ihre Spitzenparallelität, dann bestätigen wir schriftlich, was wir zusagen können.
Ja, und das ist ein vernünftiger Einstieg. Lassen Sie Ihr direktes Konto konfiguriert, schicken Sie einen Anteil zu uns und vergleichen Sie an Ihren eigenen Zahlen.
Das Gerüst ist Ihres und das Modell ist DeepSeeks — wir stellen den Endpunkt und die kaufmännische Beziehung. Wenn etwas bricht, haben Sie eine namentlich bekannte Ansprechperson statt einer Ticket-Warteschlange, und wir helfen Ihnen herauszufinden, welche Schicht schuld ist.
Wir bedienen DeepSeek V4.1 Flash und V4.1 Pro. Wenn Ihr Gerüst eine ganz andere Modellfamilie braucht, sind wir der falsche Anbieter, und wir sagen es.
WIR ÜBERNEHMENSIE TUN
1
Sagen Sie uns Ihr Volumen
Token-Verbrauch pro Monat und was Sie heute einsetzen. Wenn wir Ihre aktuellen Kosten nicht unterbieten, sagen wir das.
2
Wir kalkulieren und vertragen
Eine feste Ansprechperson, eine verhandelbare Vereinbarung, eine Rechnung.
- base_url="…"
+ base_url="…"
# sonst ändert sich nichts3
Sie ändern eine Zeile
Richten Sie Ihren bestehenden Client auf unseren Endpunkt. Behalten Sie einen Ausweichweg.
Schicken Sie uns Ihr Monatsvolumen und Ihren aktuellen Anbieter. Wir antworten in der Regel innerhalb eines Werktags — mit einem Preis und einer festen Ansprechperson.