
Cómo obtener texto de una captura de pantalla en C#
Muchas personas por ahí se estarán preguntando "¿Qué es una captura de pantalla OCR?" Otros podrían preguntarse cómo convertir una captura de pantalla de cualquier texto a un formato digital editable o a formato .txt o .doc. Si eres una de estas personas, entonces no te preocupes más porque tenemos las soluciones perfectas para ti.
En este artículo, discutiremos diferentes herramientas que te permitirán realizar OCR, Reconocimiento Óptico de Caracteres, en capturas de pantalla.
Existen muchas herramientas OCR, pero hoy usaremos IronOCR para extraer texto de capturas de pantalla.
1. IronOCR
IronOCR es una biblioteca de software para los lenguajes de programación C# y VB.NET, diseñada para permitir a los desarrolladores agregar capacidades de OCR (Reconocimiento Óptico de Caracteres) a sus aplicaciones. La biblioteca puede usarse para reconocer texto en imágenes y convertirlo en texto legible por máquina. La biblioteca está construida sobre el motor OCR Tesseract, que se considera uno de los motores OCR más precisos disponibles.
IronOCR se puede usar para leer texto de imágenes en muchos formatos de archivo diferentes, incluidos PNG, JPG, TIFF y PDF. También ofrece una gama de características avanzadas para trabajar con el reconocimiento de texto, como la capacidad de reconocer múltiples idiomas, así como la habilidad de reconocer texto en imágenes que han sido giradas o inclinadas. Además, los desarrolladores pueden usar IronOCR para integrar rápidamente la funcionalidad OCR en sus aplicaciones, ya que ofrece una API simple y fácil de usar que se puede llamar desde códigos C# o VB.NET. Usando IronOCR, puedes elegir tu idioma OCR y realizar OCR en imágenes, archivos PDF digitales y archivos PDF escaneados.
IronOCR se considera una buena opción para los desarrolladores que desean agregar funcionalidad OCR a sus aplicaciones. Es de código abierto, fácil de usar e integrar, rápido, preciso y actualizado con las últimas tecnologías OCR.
2. Características de IronOCR
IronOCR proporciona una amplia gama de características que ayudan a los desarrolladores a integrar la funcionalidad OCR en sus aplicaciones. Algunas de las características clave de IronOCR incluyen:
- Soporte multilingüe: IronOCR puede reconocer texto en más de 60 idiomas, incluidos inglés, español, alemán, francés, italiano y chino.
- Detección automática de la orientación del texto: IronOCR puede detectar automáticamente la orientación del texto en una imagen, incluso si la imagen ha sido girada o inclinada.
- Compatibilidad con una amplia gama de formatos de imagen: IronOCR puede leer texto de imágenes en muchos formatos de archivo diferentes, incluidos PNG, JPG, TIFF y PDF.
- Ajustes de reconocimiento personalizables: Los desarrolladores pueden personalizar los ajustes de reconocimiento para mejorar la precisión del reconocimiento en tipos específicos de imágenes o casos de uso.
- Capacidad para reconocer texto de documentos escaneados y PDFs con múltiples páginas.
- Fast reconocimiento y alta precisión: IronOCR utiliza el motor OCR Tesseract, uno de los motores OCR más precisos y ampliamente utilizados que existen.
- API fácil de usar: IronOCR ofrece una API sencilla y fácil de usar a la que se puede acceder desde código C# o VB.NET, lo que facilita la integración de la funcionalidad OCR en cualquier aplicación.
En general, IronOCR es una herramienta poderosa que proporciona una amplia gama de características para ayudar a los desarrolladores a agregar funcionalidad OCR a sus aplicaciones.
3. Creación de un nuevo proyecto en Visual Studio
Abre Visual Studio y ve al menú Archivo. Selecciona "Nuevo Proyecto" y luego selecciona Aplicación de Consola.
Introduce el nombre del proyecto y selecciona la ruta en el cuadro de texto correspondiente. Luego, haga clic en el botón Crear. Seleccione el framework .NET requerido, como en la captura de pantalla a continuación:
Creando un nuevo proyecto en Visual Studio
El proyecto de Visual Studio ahora generará la estructura para la aplicación de consola. Una vez terminado, se abrirá el archivo program.cs, en el cual puedes escribir y ejecutar código fuente.
El archivo program.cs, generado desde el asistente de nuevo proyecto de Visual Studio
Ahora podemos añadir la biblioteca IronOCR y probar el programa.
4. Instalar IronOCR
En Visual Studio, puedes integrar fácilmente IronOCR con tu proyecto C#.
IronOCR ofrece múltiples procesos para integrar con un proyecto C# .NET. Aquí, discutiremos uno de ellos: instalar IronOCR usando el Administrador de Paquetes NuGet.
En Visual Studio ve a Herramientas > Administrador de Paquetes NuGet > Consola del Administrador de Paquetes
La interfaz del Administrador de Paquetes NuGet
Después de hacer clic, aparecerá una nueva consola en la parte inferior de la ventana de Visual Studio. Escribe el siguiente comando en la consola y presiona enter.
IronOCR se instalará en solo unos segundos.
5. Uso de IronOCR para realizar OCR en una captura de pantalla
IronOCR es una poderosa biblioteca OCR que se puede utilizar para reconocer texto de capturas de pantalla. Con IronOCR, puedes tomar una captura de pantalla de texto, y luego usar las capacidades OCR de la biblioteca para convertir el texto de la captura de pantalla en un formato digital, editable. Aquí tienes un ejemplo de cómo podrías usar IronOCR para realizar OCR en una captura de pantalla en C#. Para realizar OCR en una captura de pantalla, solo captura una captura de pantalla y ejecuta el siguiente código para extraer el texto a cualquier formato de salida que desees.
using IronOcr;
using System;
class Program
{
static void Main()
{
// Create an instance of IronTesseract, the core OCR engine
var ocr = new IronTesseract();
// Perform OCR on the specified image file
var result = ocr.Read("ocr.png");
// Output the recognized text to the console
Console.WriteLine(result.Text);
}
}Imports IronOcr
Imports System
Friend Class Program
Shared Sub Main()
' Create an instance of IronTesseract, the core OCR engine
Dim ocr = New IronTesseract()
' Perform OCR on the specified image file
Dim result = ocr.Read("ocr.png")
' Output the recognized text to the console
Console.WriteLine(result.Text)
End Sub
End ClassArchivo de imagen de entrada
Captura de pantalla de ejemplo utilizada como entrada
Salida de texto
- IRONOCR for NET
- The C# OCR Library
- OCR for C# to scan and read images & PDFs
- NET OCR library with 125+ global language packs
- Output as text, structured data, or searchable PDFs
- Supports NET 6, 5, Core, Standard, Framework
6. Uso de IronOCR para realizar OCR en una zona específica
IronOCR te permite realizar OCR en zonas específicas dentro de una imagen. Esto puede ser útil cuando la imagen contiene múltiples regiones de texto, y solo quieres reconocer el texto dentro de una región específica. Un ejemplo de código para esto se muestra a continuación.
using IronOcr;
using IronSoftware.Drawing;
using System;
class Program
{
static void Main()
{
var ocrTesseract = new IronTesseract();
using (var ocrInput = new OcrInput())
{
// Define the rectangle to crop the image for OCR
var contentArea = new CropRectangle(x: 0, y: 0, width: 350, height: 150);
// Add the image with the specified cropping area
ocrInput.AddImage("ocr.png", contentArea);
// Perform the OCR operation on the defined area
var ocrResult = ocrTesseract.Read(ocrInput);
// Output the recognized text
Console.WriteLine(ocrResult.Text);
}
}
}Imports IronOcr
Imports IronSoftware.Drawing
Imports System
Friend Class Program
Shared Sub Main()
Dim ocrTesseract = New IronTesseract()
Using ocrInput As New OcrInput()
' Define the rectangle to crop the image for OCR
Dim contentArea = New CropRectangle(x:= 0, y:= 0, width:= 350, height:= 150)
' Add the image with the specified cropping area
ocrInput.AddImage("ocr.png", contentArea)
' Perform the OCR operation on the defined area
Dim ocrResult = ocrTesseract.Read(ocrInput)
' Output the recognized text
Console.WriteLine(ocrResult.Text)
End Using
End Sub
End ClassResultado
- IRONOCR for NET
- The C# OCR Library
- OCR for C# to scan and read images & PDFs
- NET OCR library with 125+ global language packs
7. Uso de IronOCR para realizar OCR en una imagen
Para realizar OCR en una imagen y guardar el texto reconocido en un archivo .txt, puedes usar el siguiente código.
using IronOcr;
using System;
class Program
{
static void Main()
{
var ocr = new IronTesseract();
using (var input = new OcrInput("ocr.png"))
{
// Perform OCR on the image
var result = ocr.Read(input);
// Save the recognized text to a .txt file
result.SaveAsTextFile("output.txt");
}
}
}Imports IronOcr
Imports System
Friend Class Program
Shared Sub Main()
Dim ocr = New IronTesseract()
Using input = New OcrInput("ocr.png")
' Perform OCR on the image
Dim result = ocr.Read(input)
' Save the recognized text to a .txt file
result.SaveAsTextFile("output.txt")
End Using
End Sub
End ClassEl contenido del archivo de salida se muestra a continuación:
Contenido del archivo output.txt generado
8. Más información
Lee el tutorial de Extracción de Texto de Imagen para obtener más información sobre cómo realizar OCR en imágenes.
IronOCR es parte de un conjunto de cinco bibliotecas .NET diseñadas para trabajar con diferentes tipos de documentos. Puedes comprar las cinco bibliotecas por el precio de solo dos licencias.

Artículos Relacionados

