Compreensão de documentos
Todo documento passa por extração na mesma ordem: texto nativo primeiro, reconhecimento óptico só quando não há texto nativo. Ler a camada de texto de um PDF é exato; reconhecer a imagem é estimativa, e a estimativa vem com a confiança medida.
- PDF com camada de texto, PDF digitalizado, imagem, DOCX, XLSX, CSV e TXT
- Reconhecimento óptico local, em WebAssembly, sem enviar página para fora
- Abaixo de 55% de confiança o texto é descartado em vez de indexado