Imágenes

Extraer texto de imágenes

Convierte una foto, una captura o un escaneo en texto que puedes copiar, corregir y descargar.

Qué es y para qué sirve

El OCR (del inglés Optical Character Recognition, «reconocimiento óptico de caracteres») es la tecnología que convierte la imagen de un texto en texto de verdad, editable y buscable. Para tu ordenador, una foto de una factura es solo un montón de píxeles de colores: no sabe que ahí pone un importe. El OCR analiza esa cuadrícula de píxeles, localiza las manchas que parecen letras y decide, una a una, qué carácter es cada una.

Sirve para dejar de teclear lo que ya está escrito en algún sitio. Una captura de pantalla de la que no se puede seleccionar el texto, la foto de una pizarra al terminar una reunión, un documento escaneado, el ticket de un gasto, la ficha técnica de un aparato o un PDF viejo que en realidad es una imagen. En lugar de copiar a mano, se lee la imagen y se obtiene el texto en segundos.

Esta herramienta usa Tesseract, el motor de OCR libre que mantiene una comunidad desde hace décadas, compilado a WebAssembly para que funcione dentro del navegador. Eso quiere decir que tu imagen no se sube a ninguna parte: el motor y el modelo del idioma se descargan a tu equipo la primera vez, y el reconocimiento lo hace tu propio procesador.

Casos de uso

  • Copiar el texto de una captura de pantalla, de un vídeo pausado o de una aplicación que no deja seleccionar.
  • Pasar a texto la foto de una pizarra, de unos apuntes o de la diapositiva de una charla.
  • Sacar los datos de un ticket, una factura o un albarán escaneado para meterlos en una hoja de cálculo.
  • Recuperar el contenido de un documento antiguo digitalizado como imagen.
  • Leer el número de serie, el modelo o la referencia de la etiqueta de un aparato.
  • Extraer el texto de una infografía o de un cartel para reutilizarlo o traducirlo.
  • Convertir en texto buscable una imagen que vas a archivar.

Cómo se usa

  1. Arrastra la imagen, pégala directamente con Ctrl+V o elígela con el botón.
  2. Selecciona el idioma en el que está escrito el texto; si mezcla dos, marca también inglés.
  3. Pulsa «Extraer el texto» y espera unos segundos.
  4. Corrige lo que haga falta en el cuadro de texto, que es editable.
  5. Copia el resultado o descárgalo como archivo .txt.

Qué incluye Extraer texto de imágenes

  • Nueve idiomas: español, inglés, catalán, gallego, euskera, portugués, francés, italiano y alemán.
  • Admite dos idiomas a la vez, para textos que mezclan español e inglés.
  • Arrastrar y soltar, selector de archivo y pegado directo desde el portapapeles.
  • Formatos PNG, JPG, WEBP, BMP y GIF, hasta 20 MB.
  • Opción de unir los renglones en párrafos, para que el texto no salga cortado línea a línea.
  • Indicador de confianza y tiempo de proceso, para saber si el resultado es fiable.
  • El texto se puede editar antes de copiarlo o descargarlo en .txt.

Preguntas frecuentes

¿Se sube mi imagen a algún servidor?
No. El motor de reconocimiento se descarga a tu navegador y trabaja ahí, con tu procesador. La imagen no viaja a ninguna parte, ni siquiera a nosotros, así que puedes usarlo con documentos que no te apetece dar a un servicio ajeno.
¿Por qué la primera vez tarda más?
Porque hay que descargar el motor de OCR y el modelo del idioma, unos 6 MB en total. A partir de ahí quedan guardados en la caché del navegador: los siguientes reconocimientos empiezan de inmediato, y de hecho la herramienta sigue funcionando sin conexión.
¿Qué precisión tiene?
Con una captura de pantalla nítida el resultado suele ser casi perfecto. Con una foto hecha a pulso, torcida o con poca luz, baja bastante. El porcentaje de confianza que aparece al terminar es una buena señal: por encima del 85% el texto suele estar bien; por debajo, conviene repasarlo.
¿Cómo consigo un resultado mejor?
Encuadra solo la zona con texto, procura que salga recto y bien iluminado, y usa la mayor resolución posible sin llegar a la foto borrosa. El texto oscuro sobre fondo claro se lee mucho mejor que al revés, y las tipografías corrientes mejor que las decorativas o manuscritas.
¿Reconoce texto escrito a mano?
Mal. Tesseract está entrenado con texto impreso; con letra manuscrita los resultados son pobres salvo que sea una caligrafía muy regular y separada. Para manuscritos hacen falta modelos distintos.
¿Puedo extraer el texto de un PDF?
De momento no directamente: la herramienta admite imágenes. Si tu PDF es un escaneo, exporta o captura la página como PNG o JPG y súbela aquí.
¿Mantiene el formato, las tablas y las columnas?
Devuelve el texto plano, respetando los saltos de línea que detecta. Las tablas y las columnas se pierden como estructura, aunque el contenido sale. Si el texto era un párrafo corrido, marca la casilla de unir renglones para recomponerlo.
¿Qué es Tesseract?
Un motor de OCR de código abierto que nació en los laboratorios de HP en los años ochenta, siguió Google y hoy mantiene la comunidad. Es el estándar libre del sector, y aquí se usa su versión compilada a WebAssembly para que funcione dentro del navegador.

Privacidad

Extraer texto de imágenes funciona íntegramente en tu navegador. No hay servidor detrás: los datos que introduces no se envían a ninguna parte y desaparecen al cerrar la pestaña.