Qué puede leer el OCR y qué no
El reconocimiento de caracteres convierte la foto de una página en texto buscable. Lo bien que lo haga lo decide casi por completo el escaneo y no el programa.
¿Qué añade el OCR a un PDF?
Una capa de texto invisible colocada detrás de la imagen de la página. La página sigue viéndose exactamente igual, y las palabras ahora se pueden seleccionar, buscar y leer con un lector de pantalla, porque existen como texto por debajo de la imagen.
No se sustituye nada. El escaneo sigue siendo el documento visible y el texto reconocido está detrás, y por eso un error de reconocimiento cambia lo que encuentra una búsqueda sin cambiar lo que ve una persona.
¿Qué escaneos lee bien?
Páginas planas, rectas y con buen contraste, de texto impreso normal, a unos 300 ppp. En esas condiciones el reconocimiento moderno es lo bastante preciso como para que una página de prosa vuelva con un puñado de errores como mucho, casi siempre en la puntuación.
También lee razonablemente tablas y columnas impresas, aunque puede devolverlas en un orden que se lee raro. El orden de lectura es una conjetura sobre la maqueta y no un dato guardado en la imagen, y una página a dos columnas es donde esa conjetura falla más a menudo.
¿Dónde tiene problemas?
Escritura a mano, fotos tomadas en ángulo, escaneos pálidos o mal iluminados, tipografías decorativas o muy pequeñas y páginas hechas sobre todo de sellos y firmas. Por debajo de unos 150 ppp la precisión se cae rápido por limpia que esté la página.
El idioma también cuenta. El reconocimiento se entrena por idioma, y una página en alemán leída con un modelo inglés pierde primero las diéresis y las palabras compuestas largas. Elige el idioma del documento y no el de tu interfaz.
¿Cómo debo tratar el resultado?
Como un índice buscable y no como una transcripción. Es exactamente lo adecuado para encontrar cuál de doscientas facturas escaneadas menciona a un proveedor, y es lo equivocado para pegarlo en un contrato sin leerlo.
Cuando un documento tiene que ser exacto palabra por palabra, compara el texto extraído con la página. Son unos minutos de trabajo y es la única forma de saberlo, porque el reconocimiento no sabe cuándo se equivoca: un error seguro de sí mismo tiene el mismo aspecto que una lectura correcta.
Por dónde seguir
OCR de PDF añade la capa de texto y te deja elegir antes el idioma, PDF a texto te enseña lo que produjo realmente el reconocimiento, y exportar las páginas como imágenes muestra lo que el motor tuvo que leer.
Qué cambian de verdad los ppp y la calidad cubre la resolución mínima que necesita el reconocimiento, y por qué editar texto en un PDF es limitado explica por qué una capa reconocida sigue sin poder editarse como un documento.