Ir para o conteúdo

Unlimited OCR Works: leitura de 40+ páginas

Recentemente foi liberado um novo modelo de OCR chamado Unlimited OCR Works, capaz de processar documentos com mais de 40 páginas em uma única passagem, mantendo memória e velocidade constantes.

Funcionamento técnico

O núcleo da inovação está no mecanismo de Reference Sliding Window Attention (RSWA). Essa técnica preserva um cache fixo de vetores key‑value durante toda a fase de decodificação, de modo que o uso de memória não cresce com o tamanho do documento.

Observação

O RSWA permite que o consumo de memória seja independente se o arquivo tem 5 ou 50 páginas.

O modelo possui 3 bilhões de parâmetros, porém, durante a inferência, apenas 500 milhões são efetivamente ativados. Essa característica faz com que o comportamento de computação se assemelhe ao de um modelo menor, enquanto a capacidade de compreensão permanece semelhante à de um modelo grande.

Características principais

  • Leitura de 40+ páginas em uma única passagem, sem degradação de desempenho.
  • Conversão de PDF integrada e batching para processar pastas inteiras desde o início.
  • Servidor compatível com a API da OpenAI, permitindo substituição direta em fluxos existentes.
  • Disponível como código aberto nos repositórios GitHub e Hugging Face.

Dica

Para aproveitar o batching, basta apontar o servidor para uma pasta contendo vários PDFs; ele retornará os resultados em lote, otimizando o throughput.

Comparação com OCRs tradicionais

Característica OCR tradicional Unlimited OCR Works
Crescimento de memória com páginas Linear (aumenta conforme o tamanho) Constante (cache fixo)
Velocidade de processamento Diminui com documentos longos Permanece estável
Parâmetros ativos na inferência Total do modelo (ex.: 3B) Apenas 500M ativados
Integração com APIs existentes Geralmente requer adaptadores Servidor OpenAI‑compatible

Como utilizar

Depois de clonar o repositório GitHub ou baixar o modelo do Hugging Face, basta iniciar o servidor local:

python -m unlimited_ocr.server --model_path <path> --port 8000

O servidor expõe um endpoint semelhante ao da OpenAI, permitindo chamadas como:

curl -X POST http://localhost:8000/v1/ocr \
     -F "file=@relatorio_anual.pdf"

Atenção

Certifique‑se de que o ambiente tenha suporte a CUDA se desejar usar a aceleração de GPU; caso contrário, a inferência cairá para CPU e pode aumentar levemente o tempo de resposta.

Pontos-chave

  • O Unlimited OCR Works processa documentos longos sem aumento de memória ou perda de velocidade graças ao Reference Sliding Window Attention.
  • Apesar de ter 3 B de parâmetros, apenas 500 M são utilizados na inferência,

Ferramentas e Tecnologias

  • [[Unlimited OCR Works]]
  • [[Hugging Face]]
  • [[GitHub]]
  • [[OpenAI API]]

Nota pessoal

https://x.com/i/status/2072055317840761325

Tags

ocr #modelo-de-linguagem #atenção-sliding-window #código-aberto #API-compatível