Tainacan OCR Search
Plugin WordPress que torna PDFs e imagens das coleções Tainacan pesquisáveis via OCR (Tesseract + OCRmyPDF) — fluxo guiado para fichas médicas e relatórios escaneados.
by Marcos Sigismundo · github.com/marcossigismundo/tainacan-ocr-search · website
Install
No release zip yet. The repository archive installs, but the folder name will carry the branch suffix and updates will not flow:
wp plugin install https://github.com/marcossigismundo/tainacan-ocr-search/archive/refs/heads/main.zipAplica OCR (Tesseract + OCRmyPDF) em PDFs e imagens das coleções Tainacan, deixando o conteúdo pesquisável pela busca textual nativa.
Description
O Tainacan OCR Search é um plugin pensado para acervos com fichas médicas, relatórios escaneados e outros documentos em imagem. Ele:
- Verifica automaticamente se Tesseract e OCRmyPDF estão disponíveis no servidor.
- Adiciona ao Tesseract uma camada de texto invisível por baixo das páginas escaneadas (preserva o visual original).
- Processa anexos em lote, por coleção, com barra de progresso e log.
- Reindexa o item-pai no Tainacan para que o conteúdo apareça na busca textual.
- Pode rodar OCR automaticamente em novos uploads.
- 100% on-premises — nenhum documento sai do servidor (LGPD).
Dependências
- Tesseract OCR com pacote de idioma
por. - OCRmyPDF.
- (Opcional)
pdftotext(poppler-utils) para extração de texto puro. - (Opcional) PHP Imagick para converter imagens isoladas em PDF.
Linux: sudo apt install tesseract-ocr tesseract-ocr-por ocrmypdf poppler-utils
macOS: brew install tesseract tesseract-lang ocrmypdf poppler
Windows: instale o Tesseract UB-Mannheim e pip install ocrmypdf.
Uso
- Ative o plugin (com Tainacan já ativo).
- Vá em Tainacan → OCR Search.
- Siga os 4 passos da página: verificar dependências, configurar, processar em lote, e (opcional) rodar
wp tainacan index-content --collection=allpara reindexar o acervo inteiro.