DeepSeek OCR

Bilder und Video, direkt gelesen.

Das Flash-Modell nimmt Bilder als Eingabe, nicht nur Text. Das heißt: kein separater OCR-Dienst, keine Vorschaltstufe, die bei schlechten Scans zusammenbricht.

Warum das anders ist als eine klassische OCR-Pipeline

Eine klassische Pipeline hat drei Stufen: Bild vorverarbeiten, Text erkennen, Text auswerten. Jede Stufe ist ein eigener Dienst, jede hat eigene Fehlerbilder, und bei einem schiefen Foto bricht meistens die erste.

Wir gehen einen anderen Weg. Das Modell nimmt das Bild direkt entgegen und gibt das Ergebnis in der Form zurück, die Sie vorgeben — Felder, Tabellen, Datensätze. Die Vorverarbeitung entfällt, und damit auch die Stelle, an der die meisten Pipelines scheitern.

Was typischerweise durchläuft

Rechnungen und Belege

Lieferant, Positionen, Steuer, Summen — als Datensatz statt als Textblock.

  • Kreditorenbuchhaltung
  • Belege

Handyfotos

Aufnahmen unter realen Bedingungen — schief, unscharf, mit Schatten.

  • Ohne Vorverarbeitung
  • Unebenes Licht

Tabellen und Formulare

Zeilen und Spalten bleiben Zeilen und Spalten, nicht ein Haufen Wörter.

  • Struktur erhalten
  • Nach Ihrem Schema

Lange Dokumente

Bis zu 1 Mio. Token Kontext — ganze Verträge in einem Aufruf statt in Häppchen.

  • 1 Mio. Kontext
  • Kein Chunking

Was Sie uns sagen sollten

Für ein belastbares Angebot brauchen wir zwei Dinge: ungefähr wie viele Seiten oder Dokumente im Monat, und ob die Vorlagen überwiegend gleich aussehen oder stark schwanken. Beides verändert die Kalkulation mehr als die reine Stückzahl.

Wenn Sie uns drei bis fünf echte Beispiele schicken, testen wir daran — mit denselben Modellen, die Sie bekommen. Was dabei nicht funktioniert, sagen wir Ihnen, bevor Sie unterschreiben.

Häufige Fragen

Ist das ein eigener OCR-Dienst?

Nein. Es ist ein Modell mit nativer Bildeingabe — kein separater OCR-Dienst und keine eigene Vorverarbeitungsstufe.

Wie genau ist die Erkennung?

Das hängt an Ihren Vorlagen, und wir geben Ihnen keine pauschale Trefferquote. Wir testen an Ihren eigenen Beispielen und berichten, was durchläuft und was nicht — inklusive der Fälle, die scheitern.

Unterstützt es Video?

Das Flash-Modell nimmt Videoeingabe an. Wenn Sie Video verarbeiten wollen, beschreiben Sie uns die Länge und das Volumen — das ist ein anderer Rechenweg als Bilder.

Können wir die Ausgabeform selbst festlegen?

Ja. Sie geben das Schema vor, und die Ausgabe kommt in dieser Form zurück. Sie müssen sich nicht an eine feste Ausgabestruktur halten.

Was passiert mit den hochgeladenen Dokumenten?

Sie werden nur zur Ausführung Ihrer Anfrage verarbeitet. Die Unterauftragnehmer stehen namentlich im Auftragsverarbeitungsvertrag, die Löschbedingungen schriftlich im Vertrag.

Ersetzt das unsere bestehende OCR?

Nicht unbedingt. Wenn Ihre bestehende OCR bei sauberen Scans gut funktioniert, ist der Gewinn vor allem bei den schwierigen Fällen — Fotos, schiefe Seiten, gemischte Formate. Testen Sie es an genau denen.

Schema des Ablaufs: zwei Stufen nebeneinander.

GESCANNTE EINGABE

nativ gelesen

Beispiel-Layout. Keine echten Rechnungsdaten.

STRUKTURIERTE AUSGABE

Bild hinein, Felder heraus

{
  "vendor": "…",
  "invoice_number": "…",
  "issue_date": "…",
  "line_items": [
    { "description": "…", "qty": … },
    { … }
  ],
  "tax": …,
  "total": …
}

Feldnamen gezeigt, Werte weggelassen.

Bild hinein, Felder heraus — ohne Vorschaltstufe.

Sagen Sie uns, was Sie heute einsetzen.

Schicken Sie uns Ihr Monatsvolumen und Ihren aktuellen Anbieter. Wir antworten in der Regel innerhalb eines Werktags — mit einem Preis und einer festen Ansprechperson.