OCR-API für Entwickler

OCR als ein Aufruf in Ihrem bestehenden Stack.

Sie schicken Bilddaten, Sie bekommen JSON nach Ihrem Schema zurück. Derselbe Client, den Sie schon benutzen — kein neues SDK, kein separater OCR-Dienst.

Wie der Aufruf aussieht

Die Anfrageform ist die Chat-Completions-Form, die Sie kennen: Sie legen das Bild als Teil der Nachricht hinein und beschreiben im Prompt, welche Felder Sie wollen. Zurück kommt JSON.

Weil das Modell das Bild selbst liest, entfällt die Zwischenstufe. Es gibt keinen Dienst, der erst Text erkennt und den Sie dann noch einmal aufrufen müssen — und damit auch keine zweite Stelle, an der etwas schiefgehen kann.

Was Sie einstellen können

Ausgabeschema

Sie definieren die Felder. Die Ausgabe kommt in dieser Struktur zurück.

  • Ihr Schema
  • JSON

Eingabeformate

PNG, JPEG und PDF-Seiten. Auch Aufnahmen, die nicht im Studio entstanden sind.

  • PNG · JPEG · PDF

Lange Dokumente

Bis zu 1 Mio. Token Kontext. Sie müssen nicht in Seitenhäppchen zerlegen.

  • 1 Mio. Kontext
  • Kein Chunking

Kosten pro Aufruf

Abgerechnet pro Token. Prompt-Caching senkt wiederkehrende Eingaben deutlich.

  • Pro Token
  • Caching

Was wir vor dem Start brauchen

Zwei Sätze: Was Sie verarbeiten (Rechnungen, Formulare, Ausweise, Etiketten) und wie viele Seiten im Monat. Damit können wir rechnen und Ihnen sagen, ob Flash oder Pro die bessere Wahl ist. Für die meisten OCR-Aufgaben reicht Flash.

Danach geben wir Ihnen einen begrenzten Schlüssel, und Sie fahren Ihre eigene Last dagegen. Wenn etwas an Ihren echten Dokumenten nicht funktioniert, sehen wir es dort — nicht erst nach dem Rollout.

Häufige Fragen

Brauchen wir ein neues SDK?

Nein. Es ist die OpenAI-kompatible Anfrageform. Wenn Sie den OpenAI-Client schon einsetzen, ist die Änderung Basis-URL und Schlüssel.

Können wir unsere eigene OCR damit ersetzen?

Nicht unbedingt. Wenn Ihre bestehende OCR bei sauberen Scans gut läuft, liegt der Gewinn vor allem bei den schwierigen Fällen. Testen Sie genau die, bevor Sie etwas ablösen.

Wie gehen Sie mit mehrseitigen PDFs um?

Das ganze Dokument kann in einen Aufruf, bis 1 Mio. Token. Ob Sie das nutzen oder seitenweise arbeiten, ist eine Kosten- und Latenzfrage, keine technische Grenze.

Gibt es eine Testphase?

Wir geben Ihnen einen begrenzten Schlüssel, mit dem Sie Ihre echte Last testen können. Ein dauerhaft kostenloses Kontingent haben wir nicht.

Wie sieht die Fehlerbehandlung aus?

Sie bekommen die Antwort in Ihrem Schema; die Kennzeichnung unsicherer Felder legen Sie fest. Wir liefern die Struktur, Ihre Anwendung entscheidet, was eine Ausnahme ist.

OCR-API

Schema des Ablaufs: drei Stufen, durch Pfeile verbunden; die mittlere Stufe ist hervorgehoben.

Eingabe

Bilddaten über die API

PNG · JPEG · PDF-Seiten

DeepSeek V4.1 Flash

Ausgabe

JSON zurück in Ihrem Schema

derselbe Client, den Sie schon nutzen

  • Native Bildeingabe, kein OCR-Schritt
  • OpenAI-kompatible Anfrageform
  • Strukturierte Ausgabe nach Ihrer Vorgabe
Bilddaten über die API, JSON nach Ihrem Schema zurück.Schema des Lastprofils. Kein Screenshot.

Sagen Sie uns, was Sie heute einsetzen.

Schicken Sie uns Ihr Monatsvolumen und Ihren aktuellen Anbieter. Wir antworten in der Regel innerhalb eines Werktags — mit einem Preis und einer festen Ansprechperson.