Lê o documento do jeito que chegou.
Escaneamentos tortos, fotos com sombra, PDF de 200 páginas, quadros de vídeo. O modelo lê a imagem diretamente, sem uma cadeia de OCR na frente.
Por que o multimodal faz diferença
A forma habitual de ler um documento é encadear dois sistemas: um OCR que converte a imagem em texto, e um modelo que interpreta esse texto. Cada passo perde algo. O OCR erra em uma tabela e o modelo, que nunca viu a página, não consegue perceber.
Aqui o modelo vê a página. Uma tabela com células mescladas, um carimbo sobre um número, uma assinatura na margem: coisas que um OCR achata e que o modelo consegue interpretar porque está olhando para elas.
O que ele lê
- PDF nativo, PDF escaneado e fotos de celular
- Documentos com várias colunas, tabelas e formulários
- Idiomas misturados na mesma página
- Quadros de vídeo, quando o dado está em uma gravação
Onde ele rende de verdade
| Caso | O que sai |
|---|---|
| Faturas de fornecedor | Fornecedor, itens, impostos e total como registro |
| Romaneios e notas de entrega | Referências e quantidades conferidas com o pedido |
| Relatórios em PDF | Tabelas convertidas em linhas, não em parágrafos soltos |
| Arquivo histórico | Digitalização em massa de um acervo que ninguém quer digitar |
Um aviso honesto
Nenhum leitor de documentos é infalível. O que podemos fazer é devolver a confiança por campo, para que o seu sistema saiba o que revisar e o que pode considerar correto. Conte-nos o seu caso e dizemos qual precisão dá para esperar antes de você assinar qualquer coisa.
EXTRAÇÃO DE DOCUMENTOS
Entrada
Contrato · processo · formulário
até 1 M de tokens de contexto
DeepSeek V4.1 Flash
Saída
Registro estruturado, campo a campo
o esquema que você definir
- Os documentos longos entram inteiros
- Sem pipeline de divisão para montar
- Você decide a forma de saída
Conte-nos o que você usa hoje.
Envie-nos seu volume mensal e seu provedor atual. Respondemos normalmente dentro de um dia útil — com um preço e um contato fixo.