Comparación entre IronOCR y AWS Textract OCR
¿Qué es OCR?
El procedimiento utilizado para transformar una imagen de texto en un formato de texto legible por máquina se conoce como Reconocimiento Óptico de Caracteres (OCR). Por ejemplo, si escanea un formulario, una factura o un recibo, su computadora guarda el escaneo como un archivo de imagen. Los datos en el archivo de imagen no pueden ser editados, buscados o contados utilizando un editor de texto. Sin embargo, puedes utilizar soluciones de OCR para convertir el archivo de imagen en un documento de texto con sus contenidos almacenados como datos de texto.
En esta era moderna, la mayoría de los flujos de trabajo empresariales implican recibir información de medios impresos. Diferentes documentos como formularios en papel, facturas, documentos legales escaneados, extracción de tablas y texto impreso o contratos son todos parte de los procesos empresariales. Además, digitalizar este contenido documental crea imágenes con el texto oculto dentro de ellas. El texto en las imágenes no puede ser procesado por herramientas de procesamiento de texto de la misma manera que los documentos de texto. La tecnología OCR resuelve el problema convirtiendo imágenes de texto en datos de texto que pueden ser analizados por otro software empresarial.
¿Cómo funciona OCR?
El motor OCR funciona mediante los siguientes pasos:
Adquisición de Imagen
En este proceso, un escáner lee documentos y los convierte a datos binarios. El software OCR identifica la imagen escaneada y clasifica las áreas claras como fondo y las áreas oscuras como texto.
Preprocesamiento
El software OCR primero limpia la imagen y elimina errores para preparar sus datos para la lectura.
Reconocimiento de texto
Los dos tipos principales de algoritmos OCR para el reconocimiento de texto son la coincidencia de patrones y la extracción de características.
Coincidencia de patrones
Una imagen de carácter, o glifo, se aísla durante todo el proceso de coincidencia de patrones y se compara con un glifo previamente registrado.
Extracción de características
A través del proceso de extracción de características, los glifos se dividen en características como líneas, bucles cerrados, dirección de líneas y uniones de líneas.
Postprocesamiento
La tecnología transforma los datos de texto recuperados en un archivo digital después del análisis. Algunos sistemas OCR pueden crear documentos PDF anotados que incluyen tanto las versiones antes como después del documento escaneado.
Este artículo discutirá la comparación entre dos de las aplicaciones y bibliotecas de documentos más prevalentes para OCR:
- IronOCR AWS OCR Textract
Biblioteca IronOCR
IronOCR es una biblioteca de C# .NET que ofrece servicios para escanear, buscar, leer imágenes y PDFs. Viene con más de 125 paquetes de idiomas globales. La salida se obtiene como texto, datos estructurados o PDFs buscables. Soporta versiones de .NET como 6, 5, Core, Standard, y Framework.
IronOCR es único en su capacidad para detectar y extraer automáticamente datos de imágenes y documentos escaneados de forma imperfecta. La clase 'IronTesseract' tiene la API más sencilla. Ofrece la versión más avanzada de Tesseract conocida en cualquier lugar, en cualquier plataforma, con mayor velocidad, precisión y una DLL y API nativas.
IronOCR también puede escanear códigos de barras y códigos QR desde todos los formatos de imagen, y lee texto y realiza escaneos de PDF utilizando el motor Tesseract 5 más reciente.
Características
- Está hecho exclusivamente para aplicaciones .NET.
- Puede soportar 125 idiomas diferentes. IronOCR admite árabe, chino, inglés, finlandés, francés, alemán, japonés y muchos otros idiomas. Puede corregir la posición de una imagen inclinada y eliminar el ruido de una imagen para obtener un resultado preciso. Rinde excepcionalmente bien en imágenes de baja resolución con baja DPI. Puede leer múltiples tipos de códigos QR y códigos de barras.
- También es compatible con los formatos Gif y Tiff. Permite muchos hilos a la vez. Es una característica destacada que no está presente en otras bibliotecas OCR. Hace que los procesos sean más fluidos. Puede realizar OCR fácilmente en archivos PDF y exportar documentos PDF buscables utilizando OCR.
Ahora, echemos un vistazo a AWS OCR.
OCR Textract de AWS
Amazon AWS Textract es un servicio de aprendizaje automático (ML) que extrae automáticamente texto y datos de documentos escaneados. Va más allá del simple reconocimiento óptico de caracteres (OCR) para identificar, comprender y extraer datos de formularios y tablas utilizando tecnología de aprendizaje profundo.
El OCR Textract de AWS utiliza el aprendizaje automático para leer y procesar cualquier tipo de documento, extrayendo texto, datos tabulares y otros datos con precisión sin esfuerzo manual. En lugar de tomar horas o días para extraer los datos, Textract puede hacerlo rápidamente. Además, puede agregar revisiones humanas con Amazon Augmented Artificial Intelligence (AI) para supervisar sus modelos y verificar los datos sensibles.
Características
- Detecte texto en una variedad de documentos, incluidos informes financieros, registros médicos, tablas y formularios de impuestos.
- Extrae texto, formularios y datos de tablas de documentos con datos estructurados, utilizando la API de Análisis de Documentos.
- Especifique y extraiga información de documentos utilizando la función de Consultas dentro de la API de Análisis de Documentos.
- Procese facturas y recibos con la API Analyze Expense.
- Procesa documentos de identificación como licencias de conducir y pasaportes emitidos por EE. UU. gobierno, utilizando la API Analyze ID. Análisis de documentos escalable que puede acelerar la toma de decisiones.
El resto del artículo continúa de la siguiente manera:
- Creación del proyecto en Visual Studio
- Instalación de IronOCR
- Installing AWS OCR Textract
- PDF a Texto
- Imagen a texto
- Código de barras y QR a texto
- Licencias
- Conclusión
1. Creación del Proyecto en Visual Studio
Este tutorial utilizará la versión de Visual Studio 2022, por lo que supongo que ya debe tenerlo instalado.
- Abre Visual Studio 2022.
- Genere un nuevo proyecto .NET Core y luego seleccione Aplicación de consola.
Aplicación de consola
- Asigna un nombre al proyecto. Por ejemplo, TextReader.
- La versión más reciente y estable del .NET Framework es 6.0. Vamos a utilizar esta.

- Haga clic en el botón Crear y el proyecto se creará.
A continuación, instalaremos las bibliotecas para nuestro uso una por una.
2. Instalación de IronOCR
La biblioteca IronOCR se puede descargar e instalar de cuatro maneras. Estos son los siguientes:
- Usando el Administrador de Paquetes NuGet de Visual Studio.
- Descarga directa a través del sitio web de NuGet.
- Descarga directa a través de la página web de IronOCR.
- Uso de la línea de comandos en Visual Studio.
2.1. Uso del Administrador de NuGet en Visual Studio
El Administrador de Paquetes NuGet de Visual Studio se puede utilizar para incorporar IronOCR en un proyecto de C#.
- Expanda Herramientas o haga clic derecho en el explorador de soluciones.
- Extiende el Administrador de Paquetes NuGet.
- Haga clic en Administrar paquetes NuGet para soluciones o haga clic en Administrar paquetes NuGet en el explorador de soluciones.
Administrar paquetes NuGet
Después de esto, aparecerá una nueva ventana en la barra de búsqueda: escriba IronOCR. Marque la casilla del proyecto en el lado derecho y haga clic en Instalar.
Explorar IronOCR
Al usar este método, los desarrolladores pueden instalar la biblioteca IronOCR y cualquier paquete de idioma de su elección.
2.2. Descarga directa a través del sitio web de NuGet
IronOCR se puede descargar directamente desde el sitio web de NuGet siguiendo estas instrucciones:
- Navega al enlace "https://www.nuget.org/packages/IronOcr/".
- Seleccione la opción de paquete de descarga en el menú en el lado derecho.
- Haz doble clic en el paquete de descarga. Se instalará automáticamente.
- A continuación, recargue la solución y comience a utilizarla en el proyecto.
2.3. Descarga directa a través de la página web de IronOCR
Los desarrolladores pueden descargar la biblioteca IronOCR directamente desde el sitio web usando este Enlace.
- Haz clic derecho en el proyecto desde la ventana de la solución.
- Luego, seleccione la opción Referencia y navegue hasta la ubicación de la referencia descargada.
- A continuación, haga clic en OK para añadir la referencia.
2.4. Uso de la línea de comandos en Visual Studio
- En Visual Studio, vaya a Herramientas -> Administrador de paquetes NuGet -> Consola del administrador de paquetes.
- Introduzca la siguiente línea en la pestaña de la consola del administrador de paquetes:
Install-Package IronOcr
El paquete ahora se descargará/instalará en el proyecto actual y está listo para usar.
Aplicación de consola
Aplicación de consola
Después de escribir el comando, presione enter y se instalará.
2.5. Añadir el espacio de nombres de IronOCR
Incluya esta línea de código en el programa para usar IronOCR:
using IronOcr;
using IronOcr;
Imports IronOcr
Ahora instalemos AWS Textract.
3. Installing AWS Textract OCR
Antes de usar Amazon Textract por primera vez, complete las siguientes tareas:
- Regístrate para los servicios de AWS.
- Crear un usuario IAM.
Una vez que te hayas registrado exitosamente para la cuenta y creado el usuario IAM, ahora puedes establecer las claves de acceso en la consola de AWS para acceder a la API programáticamente usando C#. Necesitarás:
AccessKeyId SecretAccessKey
- RegionEndPoint (Tu área de acceso) - En este caso ejemplo: AFSouth1
3.1. Using Administrador de paquetes NuGet
- Puede descargar e instalar AWS Textract SDK desde Administrador de paquetes NuGet.
Administrador de paquetes NuGet
- Haz clic en Browse y busca AWS Textract:
AWS Textract
3.2. Agregar espacios de nombres de AWS OCR
Incluya los siguientes namespaces para usar AWS Textract:
using Amazon.Textract;
using Amazon.Textract.Model;
using Amazon.Textract;
using Amazon.Textract.Model;
Imports Amazon.Textract
Imports Amazon.Textract.Model
4. Archivo PDF a Texto
Ambas bibliotecas pueden extraer texto de archivos PDF. Veamos el código uno por uno.
4.1. Usando IronOCR
IronOCR permite reconocer y leer texto de formatos de documentos PDF utilizando el avanzado Tesseract. El siguiente código simple se utiliza para extraer información:
var Ocr = new IronTesseract();
using (var input = new OcrInput())
{
input.AddPdf("example.pdf", "password");
// We can also select specific PDF page numbers to OCR
var Result = Ocr.Read(input);
Console.WriteLine(Result.Text);
Console.WriteLine($"{Result.Pages.Count()} Pages");
// Read every page of the PDF
}
var Ocr = new IronTesseract();
using (var input = new OcrInput())
{
input.AddPdf("example.pdf", "password");
// We can also select specific PDF page numbers to OCR
var Result = Ocr.Read(input);
Console.WriteLine(Result.Text);
Console.WriteLine($"{Result.Pages.Count()} Pages");
// Read every page of the PDF
}
Dim Ocr = New IronTesseract()
Using input = New OcrInput()
input.AddPdf("example.pdf", "password")
' We can also select specific PDF page numbers to OCR
Dim Result = Ocr.Read(input)
Console.WriteLine(Result.Text)
Console.WriteLine($"{Result.Pages.Count()} Pages")
' Read every page of the PDF
End Using
El código es simple, limpio y muy fácil de entender y usar.
Archivo PDF de entrada
Ejemplo de PDF
Salida
Output de IronOCR
4.2. AWS Textract
Amazon Textract facilita agregar detección y análisis de texto de documentos a sus aplicaciones. El siguiente código se utiliza para leer el PDF y se pasa el mismo PDF:
public static async void ReturnResult()
{
AmazonTextractClient client = new AmazonTextractClient("your_access_key_id", "your_secret_access_key", Amazon.RegionEndpoint.AFSouth1);
var request = new StartDocumentTextDetectionRequest();
request.DocumentLocation = new DocumentLocation
{
S3Object = new S3Object
{
Bucket = "your_bucket_name",
Name = "your_bucket_key"
}
};
var id = await client.StartDocumentTextDetectionAsync(request);
var jobId = id.JobId;
var response = client.GetDocumentTextDetectionAsync(new GetDocumentTextDetectionRequest{
JobId = jobId
});
response.Wait();
if (response.Result.JobStatus.Equals("SUCCEEDED"))
{
foreach (var block in response.Result.Blocks)
{
if (block.BlockType == "WORD" || block.BlockType == "PAGE" || block.BlockType == "LINE")
{
Console.WriteLine(block.Text);
}
}
}
}
static void Main(String[] args)
{
ReturnResult();
}
public static async void ReturnResult()
{
AmazonTextractClient client = new AmazonTextractClient("your_access_key_id", "your_secret_access_key", Amazon.RegionEndpoint.AFSouth1);
var request = new StartDocumentTextDetectionRequest();
request.DocumentLocation = new DocumentLocation
{
S3Object = new S3Object
{
Bucket = "your_bucket_name",
Name = "your_bucket_key"
}
};
var id = await client.StartDocumentTextDetectionAsync(request);
var jobId = id.JobId;
var response = client.GetDocumentTextDetectionAsync(new GetDocumentTextDetectionRequest{
JobId = jobId
});
response.Wait();
if (response.Result.JobStatus.Equals("SUCCEEDED"))
{
foreach (var block in response.Result.Blocks)
{
if (block.BlockType == "WORD" || block.BlockType == "PAGE" || block.BlockType == "LINE")
{
Console.WriteLine(block.Text);
}
}
}
}
static void Main(String[] args)
{
ReturnResult();
}
Public Shared Async Sub ReturnResult()
Dim client As New AmazonTextractClient("your_access_key_id", "your_secret_access_key", Amazon.RegionEndpoint.AFSouth1)
Dim request = New StartDocumentTextDetectionRequest()
request.DocumentLocation = New DocumentLocation With {
.S3Object = New S3Object With {
.Bucket = "your_bucket_name",
.Name = "your_bucket_key"
}
}
Dim id = Await client.StartDocumentTextDetectionAsync(request)
Dim jobId = id.JobId
Dim response = client.GetDocumentTextDetectionAsync(New GetDocumentTextDetectionRequest With {.JobId = jobId})
response.Wait()
If response.Result.JobStatus.Equals("SUCCEEDED") Then
For Each block In response.Result.Blocks
If block.BlockType = "WORD" OrElse block.BlockType = "PAGE" OrElse block.BlockType = "LINE" Then
Console.WriteLine(block.Text)
End If
Next block
End If
End Sub
Shared Sub Main(ByVal args() As String)
ReturnResult()
End Sub
El código es un poco complicado, extenso y requiere atención al pasar y recuperar objetos. Primero, tenemos que crear un objeto AmazonTextractClient con 3 parámetros: AccessKeyId, SecretAccessKey, y Region. Luego tenemos que iniciar una solicitud usando el método StartDocumentTextDetectionRequest(). El objeto de solicitud luego establece el DocumentLocation utilizando el nombre del bucket y la clave. Esta solicitud se pasa al método StartDocumentTextDetectionAsync(). Como es un método asincrónico, tenemos que usar la palabra clave await y hacer que la función ReturnResult sea asincrónica. Al tener éxito, el resultado se devuelve y jobId se guarda. El jobId se pasa al método GetDocumentTextDetectionAsync() y espera la respuesta SUCCEEDED. foreach loop se utiliza para recorrer cada bloque y verificar si es "WORD", "PAGE" o "LINE", luego imprimir el reconocimiento de texto. Por último, llama a este método en el método Main para el procesamiento de documentos.
Salida
La salida es bastante similar a IronOCR.
Salida de AWS Textract
5. Imágenes a Texto
Leer datos de imágenes es complicado, ya que la calidad de la imagen desempeña un papel vital al extraer información. Ambas bibliotecas proporcionan la facilidad para extraer texto. Aquí usaremos archivos png.
5.1. Uso de IronOCR
El código es casi similar al anterior. Aquí, el método AddPDF se reemplaza con el método AddImage.
var Ocr = new IronTesseract();
using (var Input = new OcrInput())
{
Input.AddImage("test-files/redacted-employmentapp.png");
//... you can add any number of images
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
var Ocr = new IronTesseract();
using (var Input = new OcrInput())
{
Input.AddImage("test-files/redacted-employmentapp.png");
//... you can add any number of images
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
Dim Ocr = New IronTesseract()
Using Input = New OcrInput()
Input.AddImage("test-files/redacted-employmentapp.png")
'... you can add any number of images
Dim Result = Ocr.Read(Input)
Console.WriteLine(Result.Text)
End Using
Imagen de entrada
Datos de empleados redactados
Salida
La salida es limpia y coincide con la imagen original con solo unas pocas líneas de código, sin tecnicismos y con un resultado perfecto.
Salida de imagen
5.2. Using AWS Textract
El siguiente código ayuda a detectar texto de imágenes:
public static async void ReturnResult()
{
AmazonTextractClient client = new AmazonTextractClient("your_access_key_id", "your_secret_access_key", Amazon.RegionEndpoint.AFSouth1);
var request = new DetectDocumentTextRequest();
request.Document = new Document
{
Bytes = new MemoryStream(File.ReadAllBytes(@"test-files/redacted-employmentapp.png"))
};
var result = await client.DetectDocumentTextAsync(request);
foreach (var block in result.Blocks)
{
if (block.BlockType == "WORD")
{
Console.WriteLine(block.Text);
}
}
}
static void Main(String[] args)
{
ReturnResult();
}
public static async void ReturnResult()
{
AmazonTextractClient client = new AmazonTextractClient("your_access_key_id", "your_secret_access_key", Amazon.RegionEndpoint.AFSouth1);
var request = new DetectDocumentTextRequest();
request.Document = new Document
{
Bytes = new MemoryStream(File.ReadAllBytes(@"test-files/redacted-employmentapp.png"))
};
var result = await client.DetectDocumentTextAsync(request);
foreach (var block in result.Blocks)
{
if (block.BlockType == "WORD")
{
Console.WriteLine(block.Text);
}
}
}
static void Main(String[] args)
{
ReturnResult();
}
Public Shared Async Sub ReturnResult()
Dim client As New AmazonTextractClient("your_access_key_id", "your_secret_access_key", Amazon.RegionEndpoint.AFSouth1)
Dim request = New DetectDocumentTextRequest()
request.Document = New Document With {.Bytes = New MemoryStream(File.ReadAllBytes("test-files/redacted-employmentapp.png"))}
Dim result = Await client.DetectDocumentTextAsync(request)
For Each block In result.Blocks
If block.BlockType = "WORD" Then
Console.WriteLine(block.Text)
End If
Next block
End Sub
Shared Sub Main(ByVal args() As String)
ReturnResult()
End Sub
Nuevamente, el código es casi similar al anterior. Aquí, tenemos que iniciar una solicitud usando el método DetectDocumentTextRequest(). El objeto de solicitud luego establece el documento leyendo todos los bytes. Esta solicitud se pasa al método DetectDocumentTextAsync(). Como es un método asincrónico, tenemos que usar la palabra clave await y hacer que la función ReturnResult sea asincrónica. En caso de éxito, el resultado se devuelve en bloques. foreach loop se utiliza para recorrer cada bloque y verificar si es "WORD", luego imprimir el reconocimiento de texto. Por último, llama a este método en el método Main para el procesamiento de documentos.
La salida es similar a IronOCR pero esto requiere que el archivo se suba a un bucket de AWS en primer lugar.
6. Código de barras y código QR a Texto
Una característica única de IronOCR es que puede leer códigos de barras y códigos QR de documentos mientras escanea texto. Las instancias de la clase OcrResult.OcrBarcode proporcionan al desarrollador información detallada sobre cada código de barras escaneado. AWS Textract no proporciona esta funcionalidad.
El código para IronOCR se muestra a continuación:
var Ocr = new IronTesseract();
Ocr.Configuration.ReadBarCodes = true;
using (var input = new OcrInput())
{
input.AddImage("test-files/Barcode.png");
var Result = Ocr.Read(input);
foreach (var Barcode in Result.Barcodes)
{
Console.WriteLine(Barcode.Value);
// type and location properties also exposed
}
}
var Ocr = new IronTesseract();
Ocr.Configuration.ReadBarCodes = true;
using (var input = new OcrInput())
{
input.AddImage("test-files/Barcode.png");
var Result = Ocr.Read(input);
foreach (var Barcode in Result.Barcodes)
{
Console.WriteLine(Barcode.Value);
// type and location properties also exposed
}
}
Dim Ocr = New IronTesseract()
Ocr.Configuration.ReadBarCodes = True
Using input = New OcrInput()
input.AddImage("test-files/Barcode.png")
Dim Result = Ocr.Read(input)
For Each Barcode In Result.Barcodes
Console.WriteLine(Barcode.Value)
' type and location properties also exposed
Next Barcode
End Using
El código es autoexplicativo y fácil de entender.
7. Licencias
IronOCR es una biblioteca que ofrece una licencia para desarrolladores de forma gratuita. Tiene también una estructura de precios distinta; el paquete Lite comienza en $999 sin tarifas ocultas. La redistribución de productos SaaS y OEM también es posible. Todas las licencias incluyen una garantía de devolución de dinero de 30 días, un año de soporte y actualizaciones de software, validez para desarrollo, pruebas y producción, y una licencia perpetua (compra única). Para ver toda la estructura de precios y detalles de licencia de IronOCR, vaya aquí.
Plan de precios de IronOCR
Puedes obtener el servicio de redistribución de productos SaaS y OEM libre de regalías por una sola compra $1,599.
Servicio SAAS
API de AWS Textract ofrece a los desarrolladores un servicio de nivel gratuito de AWS. Puede comenzar con Amazon Textract de forma gratuita. El nivel gratuito dura tres meses y los precios se muestran a continuación.

Lista de precios
Puedes consultar los detalles de precios desde este enlace. Además, también puede ajustar los precios según sus necesidades utilizando el calculador de precios.
8. Conclusión
IronOCR ofrece a los desarrolladores de C# la API de Tesseract más avanzada que conocemos, en cualquier plataforma. IronOCR puede ser implementado en Windows, Linux, Mac, Azure, AWS, Lambda y es compatible con proyectos .NET Framework así como .NET Standard y .NET Core. También podemos leer códigos de barras en escaneos OCR, e incluso exportar nuestro OCR como HTML y PDFs buscables.
Amazon Textract facilita agregar detección y análisis de texto de documentos a sus aplicaciones. Amazon Textract se basa en la tecnología de aprendizaje profundo, probada y altamente escalable, desarrollada por los científicos de visión por computadora de Amazon para analizar miles de millones de imágenes y videos diariamente. No necesitas experiencia en aprendizaje automático para utilizarlo. Amazon Textract incluye APIs simples y fáciles de usar que pueden analizar archivos de imagen y archivos PDF. Amazon Textract siempre está aprendiendo de nuevos datos, y Amazon está continuamente agregando nuevas características al servicio.
Las licencias de IronOCR están basadas en desarrolladores, lo que significa que siempre debes adquirir una licencia en función del número de desarrolladores que utilizarán el producto. Las licencias de AWS Textract se basan en el número de páginas del documento para extraer información y analizar los datos. Las licencias son mensuales y los precios se vuelven muy altos para un gran número de páginas en comparación con la licencia de IronOCR. Además, la licencia de IronOCR es una compra única y se puede usar de por vida, y admite distribución OME y SaaS.
En comparación general, tanto IronOCR como AWS OCR tienen capacidades de aprendizaje automático para detectar texto de un documento o imagen. IronOCR tiene una ligera ventaja sobre AWS OCR, ya que es rápido y ahorra tiempo. El código es simple y directo al detectar texto de documentos. La tarea se realiza en unos pocos métodos. Por otro lado, AWS Textract utiliza muchos métodos para lograr la misma tarea. Esto incrementa la respuesta del servidor y, a veces, consume mucho tiempo. Podemos ver que si ingresamos incluso un documento imperfecto a IronOCR, puede leer su contenido con una precisión estadística de aproximadamente el 99%, incluso si el documento estaba mal formateado, inclinado y presentaba ruido digital. IronOCR funciona de inmediato sin necesidad de ajustar el rendimiento o modificar intensamente las imágenes de entrada. La velocidad es increíble: IronOCR.2020+ es hasta 10 veces más rápido y comete más de un 250% menos errores que las versiones anteriores.
Además, Iron Software está ofreciendo actualmente un paquete de cinco herramientas al precio de solo dos. Las herramientas incluidas en el Iron Suite son:
- IronBarcode IronXL
- IronOCR IronPDF IronWebScraper
Por favor, visita este enlace para explorar el Iron Suite.
Preguntas Frecuentes
¿Qué es el Reconocimiento Óptico de Caracteres (OCR)?
El Reconocimiento Óptico de Caracteres (OCR) es una tecnología que convierte diferentes tipos de documentos, como documentos en papel escaneados, PDFs o imágenes capturadas por una cámara digital, en datos editables y buscables. IronOCR es una poderosa biblioteca C# .NET que mejora este proceso utilizando algoritmos avanzados.
¿Cómo puedo convertir imágenes de texto en texto legible por máquinas usando C#?
Puede usar IronOCR, una biblioteca C# .NET, para convertir imágenes de texto en texto legible por máquinas. Procesa imágenes mediante algoritmos avanzados de OCR y produce el texto reconocido en formatos que pueden ser fácilmente manipulados programáticamente.
¿Cómo maneja IronOCR las imágenes escaneadas imperfectamente?
IronOCR está diseñado para gestionar y procesar eficazmente imágenes escaneadas imperfectamente. Incluye capacidades de preprocesamiento que corrigen la inclinación, mejoran el contraste del texto y refinan la calidad de la imagen para mejorar la precisión del OCR.
¿Puedo utilizar IronOCR para procesamiento en múltiples hilos?
Sí, IronOCR admite varios hilos, lo que permite el procesamiento simultáneo de múltiples documentos, mejorando significativamente el rendimiento y el rendimiento en aplicaciones con muchos documentos.
¿Qué idiomas admite IronOCR para tareas de OCR?
IronOCR admite más de 125 idiomas, lo que lo convierte en una herramienta versátil para aplicaciones globales donde se necesita procesar y convertir documentos en varios idiomas a texto.
¿Cómo se instala IronOCR en un proyecto de Visual Studio?
IronOCR se puede instalar en un proyecto de Visual Studio a través del Administrador de Paquetes de NuGet. Puede buscar 'IronOCR' en la consola de NuGet e instalarlo, permitiéndole integrar funcionalidad OCR en sus aplicaciones .NET.
¿Cuál es el modelo de precios para IronOCR?
IronOCR ofrece un modelo de licencia de pago único. Esto incluye licencias perpetuas que vienen con una garantía de devolución de dinero de 30 días, ofreciendo flexibilidad y tranquilidad para los desarrolladores.
¿Cómo difiere AWS Textract de IronOCR en términos de tecnología?
AWS Textract utiliza tecnologías de aprendizaje automático y aprendizaje profundo para extraer texto y datos, proporcionando un análisis detallado del contenido del documento. En contraste, IronOCR se centra en la facilidad de uso y la integración en proyectos .NET, ofreciendo una solución OCR robusta con un soporte extensivo de idiomas.
¿Puede IronOCR leer y procesar códigos de barras y códigos QR?
Sí, IronOCR puede leer y procesar tanto códigos de barras como códigos QR. Extrae información detallada sobre cada código mientras escanea simultáneamente texto, lo que lo convierte en una herramienta integral para el procesamiento de documentos.
¿Qué plataformas y entornos son compatibles con IronOCR?
IronOCR es compatible con una amplia gama de entornos, incluyendo Windows, Linux, Mac, Azure, AWS y Lambda. Soporta proyectos .NET Framework, .NET Standard y .NET Core, asegurando flexibilidad en diferentes ecosistemas de desarrollo.

