DeepSeek V4.1 Flash · Unternehmenszugang

Künstliche Intelligenz für Unternehmen — ohne eine Zeile Code zu ändern.

Tauschen Sie eine Zeile — die base_url — und lassen Sie dieselben Lasten auf DeepSeek V4.1 Flash laufen. Wir übernehmen Vertrag, Rechnung und Ansprechperson. Die Ersparnis bleibt bei Ihnen.

35 % unter dem offiziellen Listenpreis von DeepSeek 1 Mio. Token Kontext · 384K maximale Ausgabe Bild- und Videoeingabe direkt im Modell OpenAI-kompatible API

Gebaut für Teams, die Rechnungslesen, Dokumentextraktion und Klassifizierung im großen Stil fahren.

Das Problem

Die meisten Teams zahlen Spitzenmodell-Preise für Arbeit, die ein Flash-Modell genauso gut erledigt.

Es fängt fast immer gleich an: Jemand nimmt das stärkste verfügbare Modell, bringt es in Produktion, und es funktioniert. Zwei Jahre später ist die Last zehnmal so groß — und niemand hat zurückgefragt, ob es das stärkste Modell noch braucht.

01

Die Rechnung wächst mit der Last

Rechnungslesen, Feldextraktion, Klassifizierung, Zusammenfassungen — hohes Volumen, wenig Schlussfolgern. Genau da hört die Modellklasse auf, eine Rolle zu spielen, und nur der Preis zählt.

  • Hohes Volumen
  • Wenig Schlussfolgern
  • Preissensibel
02

Die Beschaffung kommt nicht durch

Self-Service-APIs sind für Einzelpersonen gebaut: kein Ansprechpartner, eine Standardvereinbarung, die sich nicht ändern lässt, Guthaben statt Bestellung, eine Anmeldung, die Firmen-Domains ablehnt.

  • Braucht Vertrag
  • Braucht Rechnung
  • Braucht Ansprechperson
03

Niemand hat die Umstellung im Plan

Die Entwicklung hat eine Roadmap. Eine laufende Pipeline umzubauen, um Geld zu sparen, ist niemandes Priorität — bis jemand fragt, warum sich die KI-Position verdoppelt hat.

  • Niemandes Roadmap
  • Kein Migrationsprojekt
  • Eine Zeile zu ändern
Leistungsumfang

Was Sie tatsächlich bekommen.

Alles hier stammt aus der veröffentlichten Spezifikation des Modells — keine Benchmark-Show, keine erfundenen Zahlen.

1 Mio. Token Kontext

Ein ganzer Vertrag, eine komplette Schadenakte oder ein mehrere hundert Seiten starkes PDF passen hinein — ohne vorher eine Chunking-Pipeline zu bauen.

1.000.000 Token

384K Token Ausgabe

Strukturierte Extraktion im großen Stil — lange JSON-Arrays, komplette Dokumentneufassungen, Massenklassifizierung in einer einzigen Antwort.

384.000 Token

Bild- und Videoeingabe direkt

Belege, Scans, Screenshots und Filmmaterial gehen direkt hinein — kein separater OCR-Stack, den Sie daneben betreiben und bezahlen müssen.

Vision-Eingabe

Nebenzeiten zum halben Preis

Batch-Jobs, nächtliche Nachläufe und Neuverarbeitungsläufe wandern in die Nebenzeiten und kosten den halben Satz. Veröffentlichte Preise, keine Aktion.

50 % Nebenzeiten
Schema des Ablaufs: zwei Stufen nebeneinander.

GESCANNTE EINGABE

nativ gelesen

Beispiel-Layout. Keine echten Rechnungsdaten.

STRUKTURIERTE AUSGABE

Bild hinein, Felder heraus

{
  "vendor": "…",
  "invoice_number": "…",
  "issue_date": "…",
  "line_items": [
    { "description": "…", "qty": … },
    { … }
  ],
  "tax": …,
  "total": …
}

Feldnamen gezeigt, Werte weggelassen.

Links die gescannte Eingabe, rechts der strukturierte Datensatz. Das Diagramm zeigt, welche Felder gelesen werden; Werte fehlen, weil sie von Ihrem Schema abhängen.
So läuft es

Drei Schritte — und nur einer davon liegt bei Ihnen.

Kein Migrationsprojekt. Keine Beschaffungs-Odyssee. Keine Änderung an Ihrer Anwendung außer dem Endpunkt.

SCHRITT 01

Nennen Sie uns Ihr Volumen

Schicken Sie uns Ihren monatlichen Token-Verbrauch und was Sie heute fahren. Wenn wir Ihre aktuellen Kosten nicht unterbieten können, sagen wir das.

SCHRITT 02

Wir kalkulieren, vertragen und stellen in Rechnung

Eine feste Ansprechperson, ein Vertrag, den Ihre Rechtsabteilung verhandeln kann, und eine ordentliche Rechnung für Ihre Buchhaltung.

SCHRITT 03

Sie ändern eine Zeile

Richten Sie Ihren bestehenden OpenAI-kompatiblen Client auf unseren Endpunkt. Lassen Sie Ihren heutigen Anbieter als Rückfall konfiguriert.

WIR ÜBERNEHMENSIE TUN

Schema des Ablaufs: drei Stufen, durch Pfeile verbunden; die mittlere Stufe ist hervorgehoben.
  1. 1

    Sagen Sie uns Ihr Volumen

    Token-Verbrauch pro Monat und was Sie heute einsetzen. Wenn wir Ihre aktuellen Kosten nicht unterbieten, sagen wir das.

    • Angebot
    • Vertrag
    • Rechnung
  2. 2

    Wir kalkulieren und vertragen

    Eine feste Ansprechperson, eine verhandelbare Vereinbarung, eine Rechnung.

    - base_url="…"
    + base_url="…"
    # sonst ändert sich nichts
  3. 3

    Sie ändern eine Zeile

    Richten Sie Ihren bestehenden Client auf unseren Endpunkt. Behalten Sie einen Ausweichweg.

Schritt 1 und 2 liegen bei uns. Nur Schritt 3 landet auf Ihrer Seite — und es ist eine Änderung an der base_url.Schema des Anschlusses. Kein Screenshot.
Anwendungen

Wo Teams künstliche Intelligenz für Unternehmen einsetzen.

Jede dieser Lasten hat eine eigene Seite mit dem vollständigen Aufbau — die Form der Last, der API-Aufruf und was sie gegen das kostet, was Sie heute fahren.

Rechnungslesen

Positionen, Steuer, Summen und Lieferantendaten aus Eingangsrechnungen — auch aus gescannten und abfotografierten.

  • Kreditorenbuchhaltung
  • Scan oder PDF
  • Hohes Volumen
Zur Seite Rechnungslesen

Dokumentextraktion

Verträge, Schadenakten und Formulare werden zu strukturierten Datensätzen — lange Dokumente gehen am Stück hinein, ohne Chunking-Pipeline.

  • Lange Dokumente
  • Ganze Datei in einem Aufruf
  • Ihr Schema
Zur Seite Dokumentextraktion

Klassifizierung und Weiterleitung

Eingehende Tickets, E-Mails und Dokumente in die richtige Warteschlange sortieren — hohes Volumen, und die Genauigkeitslatte liegt klar im Flash-Bereich.

  • Triage
  • Ihre Warteschlangen
  • Gleichbleibende Kosten pro Vorgang
Zur Seite Klassifizierung

Scans und Belege lesen

Abfotografierte Belege und schlechte Scans liest das Modell direkt — kein separater OCR-Dienst, den Sie daneben betreiben müssen.

  • Spesenerfassung
  • Kein OCR-Stack
  • Echte Fotos
Zur Seite Belege lesen

Code-Unterstützung

Vervollständigung, Review und Testerzeugung in Ihrer eigenen Werkzeugkette — ein Endpunkt, also passt es in das, was Ihr Team schon benutzt.

  • Ihr Editor
  • Gleiches SDK
  • Große Ausgabe
Zur Seite Code-Unterstützung

Synthetische Daten

Datensätze aus Ihren eigenen Beispielen und Regeln — nicht aus einem bloßen Prompt erfunden, und gegen Ihr Schema geprüft.

  • Ihre eigenen Beispiele
  • Ihre Regeln und Ihr Schema
  • Batch-freundlich
Zur Seite Synthetische Daten

Das sind die sechs Lasten, die wir am häufigsten sehen. Wenn Ihre nicht dabei ist, beschreiben Sie sie im Formular unten — oder lesen Sie wie wir im Vergleich zum Direktbezug abschneiden.

Bis zum Ja

Niemand unterschreibt das allein.

Wer es will und wer es stoppen kann, sind meist verschiedene Personen. Das bekommt jede von ihnen zu hören.

“Können wir die Bedingungen anpassen?”

Vertragsbedingungen sind verhandelbar

Wir sind nicht auf eine feste Standardvereinbarung beschränkt. Wir unterzeichnen einen Auftragsverarbeitungsvertrag und arbeiten die Fragen Ihrer Rechtsabteilung durch, bevor Sie sich binden.

Recht

“Wie wird das verbucht?”

Wir stellen Ihnen in Rechnung

Überweisung. Eine Monatsrechnung mit dem Detail, das Ihre Buchhaltung braucht. Zahlungsziele sind für etablierte Konten möglich.

Finanzen

“Und wenn es nicht klappt?”

Behalten Sie Ihren heutigen Anbieter als Rückfall

Wir sind ein zweiter Kanal, kein Ersatz. Lassen Sie Ihre bestehende Konfiguration stehen und leiten Sie einen Teil des Verkehrs zu uns. Zurück geht es genauso wie hin.

Entwicklung

EINE ZEILE ÄNDERT SICH

Schema des Ablaufs: drei Stufen, durch Pfeile verbunden; die mittlere Stufe ist hervorgehoben.

Ihre Anwendung

Das OpenAI-SDK, das Sie schon ausliefern.

api.workhorseapi.com

Gleiche Anfrageform. Gleiches Streaming.

WORKHORSE-ENDPUNKT

DeepSeek V4.1 Flash

1 Mio. Kontext · 384K Ausgabe

die Antwort kommt auf demselben Weg zurück

WAS WIR DRUMHERUM REGELN

  • Vertrag, über den sich verhandeln lässt
  • Eine Monatsrechnung
  • Eine feste Ansprechperson
  • Auftragsverarbeitungsvertrag
Ihre Anwendung spricht mit einem Endpunkt. Wir sitzen zwischen ihr und dem Modell — und übernehmen alles Kaufmännische drumherum.Schema des Anfragewegs. Kein Screenshot.
Preise

35 % unter dem offiziellen Listenpreis von DeepSeek.

Das ist der Anker für jedes Angebot. Wo Ihre eigene Zahl landet, hängt vom Volumen, der Cache-Trefferquote und dem Anteil ab, der in die Nebenzeiten wandern kann — sagen Sie uns das, und wir schicken sie Ihnen.

  • Abrechnung pro Token — Sie zahlen, was Sie verbrauchen
  • Aufrufe in den Nebenzeiten kosten den halben Satz
  • Cache-Treffer werden zu einem reduzierten Satz abgerechnet
  • Eine Monatsrechnung, zahlbar per Überweisung
  • Preise verstehen sich zzgl. der anfallenden Steuern

Schicken Sie uns Ihre Last, holen Sie sich einen Preis

Nennen Sie uns Ihr monatliches Token-Volumen und was Sie heute fahren. Wir melden uns mit einem Satz und einem direkten Vergleich zu Ihrer aktuellen Rechnung.

  • Antwort meist innerhalb eines Werktags
  • Feste Ansprechperson
  • Keine Karte nötig
Angebot anfordern
Häufige Fragen

Fragen, die vor der Unterschrift kommen.

Ist das die offizielle DeepSeek-API?

Nein. Wir sind ein unabhängiger Anbieter — nicht mit DeepSeek verbunden und von DeepSeek nicht empfohlen. Wir verkaufen Zugang zu DeepSeek V4.1 Flash weiter und übernehmen das Kaufmännische drumherum: Vertrag, Rechnungsstellung, Abwicklung und eine feste Ansprechperson.

Wenn Ihnen Self-Service reicht, ist der Direktbezug eine völlig vernünftige Option.

Wie bezahlen wir?

Per Überweisung gegen eine Monatsrechnung. Auf dieser Website gibt es keinen Bezahlvorgang — wir nehmen hier keine Kartenzahlungen an. Der Preis wird mit Ihrer Ansprechperson vereinbart und im Vertrag bestätigt.

Bekommen wir Rechnungen und Verträge?

Ja, beides. Die Vertragsbedingungen sind verhandelbar, und wir können einen Auftragsverarbeitungsvertrag unterzeichnen. Das ist der praktische Hauptunterschied zu einer Self-Service-API, deren Standardvereinbarung üblicherweise nicht geändert werden kann.

Wie schnell können wir umstellen?

Meist am selben Tag. Die API ist OpenAI-kompatibel, in den meisten Codebasen ist es also eine Änderung an base_url und am API-Schlüssel — sonst nichts. Wir begleiten Ihre Entwickler dabei.

Wie steht es um Daten und Datenschutz?

Wir verarbeiten Anfragedaten, um Ihre Anfragen zu bedienen, und verkaufen sie nicht. Das vollständige Bild steht in unserer Datenschutzerklärung und im Auftragsverarbeitungsvertrag. Sagen Sie uns, wenn Sie Anforderungen an den Speicherort haben — wir bestätigen vorab, was wir abbilden können.

Wie wird der Nebenzeiten-Preis angewendet?

Aufrufe in den Nebenzeiten werden zum halben Satz abgerechnet. Das passt zu Batch-Lasten — nächtliche Nachläufe, Massen-Neuverarbeitung, periodische Extraktionsläufe —, bei denen ein Verzug von ein paar Stunden nichts kostet.

Wie unterscheidet sich das von OpenRouter?

OpenRouter leitet über eine sehr breite Modellpalette. Wir machen eine Sache: DeepSeek V4.1 Flash, so günstig wie möglich, mit geregeltem kaufmännischem Ablauf. Wenn Sie ein Dutzend Modellfamilien hinter einem Schlüssel brauchen, sind sie die bessere Wahl. Wenn DeepSeek die Arbeit macht, sind wir üblicherweise der günstigere Weg.

Vergleich mit OpenRouter

Was passiert bei einem Ausfall?

Sie bekommen eine feste Ansprechperson — einen Menschen, keine Ticket-Warteschlange. Lassen Sie Ihren heutigen Anbieter als Rückfall konfiguriert, damit aus einem schlechten Tag kein Ausfall wird.

Was kann es nicht?

Es ist ein Modell der Flash-Klasse, kein Spitzenmodell zum Schlussfolgern. Komplexes mehrstufiges Schlussfolgern und harte Mathematik sind bei einem größeren Modell besser aufgehoben. Audioeingabe nimmt es ebenfalls nicht. Wenn Ihre Last eines davon braucht, sagen wir es Ihnen, statt Ihnen etwas zu verkaufen, das nicht passt.

Unterstützen Sie auch andere Sprachen als Deutsch?

Ja — das Modell trägt mehrsprachige Lasten gut, einschließlich Übersetzung und Extraktion aus fremdsprachigen Dokumenten. Sagen Sie uns, welche Sprachen für Sie zählen, und wir bestätigen es vorab.

Ist die DeepSeek-API OpenAI-kompatibel?

Ja. Die Endpunkte folgen dem OpenAI-Chat-Completions-Schema, die offiziellen openai-SDKs — und alles, was darauf aufbaut — funktionieren also unverändert. Für die meisten Teams besteht die ganze Umstellung aus base_url plus dem API-Schlüssel.

Wie viel passt durch einen einzelnen Aufruf?

V4.1 Flash nimmt ein Kontextfenster von 1 Mio. Token und gibt bis zu 384K Token zurück. Das deckt lange Dokumente, Aufträge über mehrere Dateien und große Extraktionschargen ab, ohne alles von Hand zu zerteilen.

Wie sehen die Ratenbegrenzungen aus?

Die Parallelität geht bei Flash bis 2.500. Die Grenzen Ihres Kontos setzen wir beim Onboarding, auf Basis des Volumens, das Sie uns nennen — geben Sie uns Ihre Spitzenparallelität, und wir bestätigen schriftlich, worauf wir uns festlegen können.

Unterstützt es Batch-Verarbeitung?

Ja, und beim Batch wird die Rechnung interessant. Kombiniert mit den Nebenzeiten liegt der Satz pro Token beim halben Spitzensatz. Das passt zu nächtlichen Nachläufen und periodischer Neuverarbeitung, bei denen ein paar Stunden Verzug nichts kosten.

Wie wirkt sich Prompt-Caching auf die Rechnung aus?

Zwischengespeicherte Eingabe-Token werden zu einem deutlich niedrigeren Satz abgerechnet als frische. Wenn Sie bei jedem Aufruf denselben großen Anfangsteil mitschicken — ein Schema, einen langen Anweisungsblock, einen festen Satz Beispiele —, ist Caching meist der größte Hebel auf der Rechnung. Wir schauen uns Ihre Prompt-Struktur mit Ihnen an.

Können wir es für OCR und Dokumentextraktion nutzen?

Genau dafür setzen die meisten unserer Kunden es ein. Flash nimmt Bildeingabe direkt an, Scans von Rechnungen, Belegen und Formularen gehen also unmittelbar hinein — ohne separaten OCR-Schritt davor. Videoeingabe funktioniert ebenfalls.

Können wir einen AVV unterzeichnen, und ist der Vertrag anpassbar?

Beides ja. Wir können einen Auftragsverarbeitungsvertrag unterzeichnen, und die Rahmenvereinbarung ist verhandelbar. Eine Self-Service-API kann ihre Standardbedingungen üblicherweise nicht ändern — genau dort endet meist die rechtliche Prüfung.

Bieten Sie ein SLA?

Wir schreiben Zusagen zu Reaktionszeit und Verfügbarkeit in den Vertrag und sagen Ihnen vor der Unterschrift klar, was wir zusichern können und was nicht. Eine pauschale Verfügbarkeitszahl, die wir anschließend verteidigen müssten, veröffentlichen wir nicht.

Wie verfolgen wir Verbrauch und Kosten?

Sie bekommen eine feste Ansprechperson und eine monatliche, aufgeschlüsselte Rechnung. Sagen Sie uns, was Ihre Buchhaltung darauf sehen muss, und wir richten die Aufstellung danach aus.

Welche Länder können Sie bedienen?

Wir prüfen Unternehmen und Endnutzer vor dem Onboarding gegen die geltenden Exportkontroll- und Sanktionsvorgaben. Sagen Sie uns, wo Ihre Gesellschaft und Ihre Nutzer sitzen, und wir bestätigen es, bevor Sie sich binden.

Was passiert, wenn wir wieder weg wollen?

Nichts hält Sie. Ihre Anbindung ist eine base_url und ein Schlüssel — derselbe Code läuft gegen jeden OpenAI-kompatiblen Endpunkt. Es gibt kein eigenes SDK, das man wieder ausbauen müsste.

Wie fangen wir an?

Nennen Sie uns Ihr Monatsvolumen und was Sie heute fahren, über das Formular unten. Wir melden uns meist innerhalb eines Werktags mit einem Preis und einer festen Ansprechperson.

Angebot anfordern

Sagen Sie uns, was Sie heute einsetzen.

Jede Anfrage wird von einem Menschen gelesen. Wir antworten in der Regel innerhalb eines Werktags — mit einem Preis und einem Vergleich zu Ihrer aktuellen Rechnung.

  • Antwort in der Regel innerhalb eines Werktags
  • Eine feste Ansprechperson statt Ticket-Warteschlange
  • Vertragsbedingungen, über die sich verhandeln lässt
  • Keine Kreditkarte, nichts zu installieren