A fatura cresce com a carga
Ler faturas, extrair campos, classificar, resumir — muito volume e pouco raciocínio. É exatamente aí que a linha do modelo deixa de importar e só o preço importa.
Mude uma linha — a base_url — e leve as mesmas cargas de trabalho para o
DeepSeek V4.1 Flash. Nós fornecemos o contrato, a fatura e uma pessoa de contato.
A economia fica com você.
from openai import OpenAI client = OpenAI(- base_url="https://api.deepseek.com/v1",- api_key=os.environ["DEEPSEEK_API_KEY"],+ base_url="https://api.workhorseapi.com/v1",+ api_key=os.environ["WORKHORSE_API_KEY"],) # todo o resto continua igual
Pensado para times que movem leitura de faturas, extração de documentos e classificação em grande escala.
Quase sempre começa igual: alguém pega o modelo mais potente que encontra, coloca em produção e funciona. Dois anos depois, a carga é dez vezes maior — e ninguém voltou a perguntar se o modelo mais potente ainda é realmente necessário.
Ler faturas, extrair campos, classificar, resumir — muito volume e pouco raciocínio. É exatamente aí que a linha do modelo deixa de importar e só o preço importa.
As APIs de autoatendimento são pensadas para pessoas físicas: ninguém ao telefone, um contrato padrão que não pode ser alterado, saldo em vez de pedido, e um cadastro que recusa domínios corporativos.
O desenvolvimento tem o seu roteiro. Refazer um pipeline em produção para economizar dinheiro não é prioridade de ninguém — até que alguém pergunte por que o orçamento de IA dobrou.
Tudo o que está aqui vem da ficha publicada do modelo — sem desfiles de benchmarks nem números inventados.
Cabe um contrato inteiro, um processo de sinistro completo ou um PDF de várias centenas de páginas — sem montar antes um pipeline de divisão.
1 M tokensExtração estruturada em grande escala: matrizes JSON longas, documentos reescritos por completo, classificação em massa em uma única resposta.
384K tokensRecibos, escaneamentos, capturas de tela e material de vídeo entram do jeito que chegam — sem uma pilha de OCR separada para manter e pagar à parte.
Entrada de visãoOs lotes, os reprocessamentos noturnos e as execuções periódicas vão para os horários fora de pico e custam a metade. Preços publicados, não uma promoção.
50 % fora de picoENTRADA ESCANEADA
leitura nativa
Layout de exemplo. Sem dados reais de fatura.
SAÍDA ESTRUTURADA
imagem dentro, campos fora
{
"vendor": "…",
"invoice_number": "…",
"issue_date": "…",
"line_items": [
{ "description": "…", "qty": … },
{ … }
],
"tax": …,
"total": …
}
Nomes de campo exibidos; os valores são omitidos.
Sem projeto de migração. Sem odisseia de compras. Sem tocar na sua aplicação além do endpoint.
Envie o seu consumo mensal de tokens e o que você está usando hoje. Se não conseguirmos ficar abaixo do seu custo atual, nós avisamos.
Uma pessoa de contato fixa, um contrato que o seu departamento jurídico pode negociar e uma fatura em ordem para a sua contabilidade.
Aponte o seu cliente compatível com a OpenAI atual para o nosso endpoint. Deixe o seu fornecedor atual configurado como reserva.
DO NOSSO LADODO SEU LADO
1
Conte-nos o seu volume
Consumo de tokens por mês e o que você usa hoje. Se não conseguirmos ficar abaixo do seu custo atual, nós avisamos.
2
Calculamos e assinamos
Uma pessoa de contato fixa, um acordo negociável, uma fatura.
- base_url="…"
+ base_url="…"
# nada mais muda3
Você muda uma linha
Aponte o seu cliente atual para o nosso endpoint. Deixe um caminho de volta preparado.
base_url.Diagrama da sequência de implantação. Não é uma captura de tela.Cada uma dessas cargas tem a sua própria página com a abordagem completa: a forma da carga, a chamada à API e o que custa frente ao que você paga hoje.
Linhas, impostos, totais e dados do fornecedor a partir de faturas recebidas — incluindo as escaneadas e as fotografadas.
Ir para Leitura de faturasContratos, processos e formulários viram registros estruturados — os documentos longos entram inteiros, sem pipeline de divisão.
Ir para Extração de documentosOrdenar tickets, e-mails e documentos recebidos para a fila certa — muito volume, e o nível de precisão necessário cai direto no terreno do Flash.
Ir para ClassificaçãoO modelo lê diretamente os recibos fotografados e os escaneamentos ruins — sem um serviço de OCR separado para manter ao lado.
Ir para Ler recibosAutocompletar, revisão e geração de testes dentro das suas próprias ferramentas — é um endpoint, então encaixa no que o seu time já usa.
Ir para Assistência de códigoConjuntos gerados a partir dos seus próprios exemplos e regras — não inventados a partir de um prompt solto, e validados contra o seu esquema.
Ir para Dados sintéticosEstas são as seis cargas que mais vemos. Se a sua não está aqui, descreva-a no formulário abaixo — ou leia como nos comparamos a contratar diretamente com a DeepSeek.
Quem quer e quem pode barrar quase nunca são a mesma pessoa. Isto é o que cada uma delas ouve.
“É possível adaptar as condições?”
Não estamos presos a uma única condição padrão. Assinamos um acordo de tratamento de dados e tratamos as perguntas do seu departamento jurídico antes de você se comprometer.
“Como isso é contabilizado?”
Transferência bancária. Uma fatura mensal com o detalhamento que a sua contabilidade precisa. Para contas consolidadas, é possível acordar prazos de pagamento.
“E se não der certo?”
Somos um segundo canal, não uma substituição. Deixe a sua configuração atual onde está e envie uma parte do tráfego para nós. Voltar atrás é tão fácil quanto entrar.
MUDE UMA LINHA
A sua aplicação
O SDK da OpenAI que você já tem em produção.
api.workhorseapi.com
A mesma forma de requisição. O mesmo streaming.
ENDPOINT DA WORKHORSE
DeepSeek V4.1 Flash
1 M de contexto · 384K de saída
a resposta volta pelo mesmo caminho
O QUE GESTIONAMOS EM VOLTA
Esse é o ponto de partida de qualquer proposta. O seu número concreto depende do volume, da taxa de acerto do cache e da parte que puder ir para os horários fora de pico — conte-nos isso e nós enviamos.
Diga-nos o seu volume mensal de tokens e o que você está usando hoje. Respondemos com uma tarifa e uma comparação direta com a sua fatura atual.
Solicitar orçamentoNão. Somos um fornecedor independente — não temos vínculo com a DeepSeek nem contamos com a sua recomendação. Revendemos acesso ao DeepSeek V4.1 Flash e assumimos a parte administrativa em volta: contrato, faturamento, gestão e uma pessoa de contato fixa.
Se autoatendimento for suficiente para você, contratar diretamente é uma opção perfeitamente razoável.
Por transferência bancária contra fatura mensal. Neste site não há nenhum processo de pagamento — aqui não aceitamos cartões. O preço é acertado com a sua pessoa de contato e confirmado no contrato.
Sim, os dois. As condições do contrato são negociáveis e podemos assinar um acordo de tratamento de dados. Essa é a principal diferença prática em relação a uma API de autoatendimento, cuja condição padrão normalmente não pode ser modificada.
Normalmente no mesmo dia. A API é compatível com a OpenAI, então na maioria das bases de código é uma mudança de base_url e de chave de API — nada mais. Acompanhamos os seus desenvolvedores no processo.
Tratamos os dados das requisições para atender às suas solicitações e não os vendemos. O quadro completo está na nossa política de privacidade e no acordo de tratamento de dados. Diga-nos se você tem requisitos sobre onde eles ficam hospedados — confirmamos de antemão o que podemos cobrir.
As chamadas fora de pico são faturadas pela metade. Isso encaixa com cargas em lote — reprocessamentos noturnos, reexecuções em massa, extrações periódicas — onde um atraso de algumas horas não custa nada.
O OpenRouter encaminha para uma gama muito ampla de modelos. Nós fazemos uma coisa: DeepSeek V4.1 Flash, o mais barato possível e com um processo comercial organizado. Se você precisa de uma dúzia de famílias de modelos atrás de uma única chave, eles são a melhor opção. Se o trabalho é feito pelo DeepSeek, por aqui costuma sair mais barato.
Você tem uma pessoa de contato fixa — uma pessoa, não uma fila de tickets. Deixe o seu fornecedor atual configurado como reserva, para que um dia ruim não vire uma interrupção do serviço.
É um modelo da linha Flash, não um modelo de ponta de raciocínio. O raciocínio complexo em várias etapas e a matemática pesada ficam melhor em um modelo maior. Ele também não aceita entrada de áudio. Se a sua carga precisa de algo disso, nós avisamos em vez de vender algo que não encaixa.
Sim — o modelo lida bem com cargas multilíngues, incluindo tradução e extração de documentos em outros idiomas. Diga-nos quais idiomas importam para você e confirmamos de antemão.
Sim. Os endpoints seguem o esquema de chat completions da OpenAI, então os SDKs oficiais de openai — e tudo o que se apoia neles — funcionam sem mudanças. Para a maioria dos times, toda a mudança consiste na base_url mais a chave de API.
O V4.1 Flash aceita uma janela de contexto de 1 M de tokens e devolve até 384K tokens. Isso cobre documentos longos, pedidos com vários arquivos e grandes lotes de extração sem dividir tudo à mão.
A concorrência no Flash chega a dois mil e quinhentos. Os limites da sua conta nós definimos durante o cadastro, a partir do volume que você indicar — diga-nos a sua concorrência de pico e confirmamos por escrito a que nos comprometemos.
Sim, e é nos lotes que a fatura fica interessante. Combinado com os horários fora de pico, a tarifa por token fica pela metade da de pico. Encaixa com reprocessamentos noturnos e reexecuções periódicas, onde um atraso de algumas horas não custa nada.
Os tokens de entrada em cache são faturados a uma tarifa bem mais baixa que os novos. Se em cada chamada você envia o mesmo bloco inicial grande — um esquema, um bloco longo de instruções, um conjunto fixo de exemplos —, o cache costuma ser a maior alavanca da fatura. Revisamos a estrutura dos seus prompts com você.
É exatamente para isso que a maioria dos nossos clientes usa. O Flash aceita entrada de imagem diretamente, então escaneamentos de faturas, recibos e formulários entram do jeito que chegam — sem um passo de OCR separado na frente. A entrada de vídeo também funciona.
As duas coisas, sim. Podemos assinar um acordo de tratamento de dados, e o contrato principal é negociável. Uma API de autoatendimento normalmente não pode modificar as suas condições padrão — e é aí que a análise jurídica costuma parar.
Escrevemos compromissos de tempo de resposta e disponibilidade no contrato, e dizemos com clareza antes de assinar o que podemos comprometer e o que não podemos. Não publicamos um percentual de disponibilidade genérico que depois teríamos que defender.
Você tem uma pessoa de contato fixa e uma fatura mensal detalhada. Diga-nos o que a sua contabilidade precisa ver nela e ajustamos o detalhamento a isso.
Verificamos empresas e usuários finais antes do cadastro em relação à normativa vigente de controle de exportações e sanções. Diga-nos onde estão a sua empresa e os seus usuários e confirmamos antes de você se comprometer.
Nada impede. A sua integração é uma base_url e uma chave — o mesmo código funciona contra qualquer endpoint compatível com a OpenAI. Não há um SDK próprio para desmontar.
Conte-nos o seu volume mensal e o que você está usando hoje, pelo formulário abaixo. Costumamos responder em um dia útil com um preço e uma pessoa de contato fixa.
Cada solicitação é lida por uma pessoa. Respondemos normalmente dentro de um dia útil — com um preço e uma comparação com a sua fatura atual.