Unlimited OCR Works: leitura de 40+ páginas¶
Recentemente foi liberado um novo modelo de OCR chamado Unlimited OCR Works, capaz de processar documentos com mais de 40 páginas em uma única passagem, mantendo memória e velocidade constantes.
Funcionamento técnico¶
O núcleo da inovação está no mecanismo de Reference Sliding Window Attention (RSWA). Essa técnica preserva um cache fixo de vetores key‑value durante toda a fase de decodificação, de modo que o uso de memória não cresce com o tamanho do documento.
Observação
O RSWA permite que o consumo de memória seja independente se o arquivo tem 5 ou 50 páginas.
O modelo possui 3 bilhões de parâmetros, porém, durante a inferência, apenas 500 milhões são efetivamente ativados. Essa característica faz com que o comportamento de computação se assemelhe ao de um modelo menor, enquanto a capacidade de compreensão permanece semelhante à de um modelo grande.
Características principais¶
- Leitura de 40+ páginas em uma única passagem, sem degradação de desempenho.
- Conversão de PDF integrada e batching para processar pastas inteiras desde o início.
- Servidor compatível com a API da OpenAI, permitindo substituição direta em fluxos existentes.
- Disponível como código aberto nos repositórios GitHub e Hugging Face.
Dica
Para aproveitar o batching, basta apontar o servidor para uma pasta contendo vários PDFs; ele retornará os resultados em lote, otimizando o throughput.
Comparação com OCRs tradicionais¶
| Característica | OCR tradicional | Unlimited OCR Works |
|---|---|---|
| Crescimento de memória com páginas | Linear (aumenta conforme o tamanho) | Constante (cache fixo) |
| Velocidade de processamento | Diminui com documentos longos | Permanece estável |
| Parâmetros ativos na inferência | Total do modelo (ex.: 3B) | Apenas 500M ativados |
| Integração com APIs existentes | Geralmente requer adaptadores | Servidor OpenAI‑compatible |
Como utilizar¶
Depois de clonar o repositório GitHub ou baixar o modelo do Hugging Face, basta iniciar o servidor local:
O servidor expõe um endpoint semelhante ao da OpenAI, permitindo chamadas como:
Atenção
Certifique‑se de que o ambiente tenha suporte a CUDA se desejar usar a aceleração de GPU; caso contrário, a inferência cairá para CPU e pode aumentar levemente o tempo de resposta.
Pontos-chave¶
- O Unlimited OCR Works processa documentos longos sem aumento de memória ou perda de velocidade graças ao Reference Sliding Window Attention.
- Apesar de ter 3 B de parâmetros, apenas 500 M são utilizados na inferência,
Ferramentas e Tecnologias¶
- [[Unlimited OCR Works]]
- [[Hugging Face]]
- [[GitHub]]
- [[OpenAI API]]
Nota pessoal
https://x.com/i/status/2072055317840761325