<meta http-equiv="content-language" content="bg" />
<h1>Български OCR в C# и .NET</h1>
<h6> Други версии на този документ:</h6>
<ul>
<li> <a rel='alternate' hreflang='en' href="/csharp/ocr/languages/bulgarian/">Английски (This Page in English)</a></li>
<li> <a href="/csharp/ocr/languages/">Още Languages</a></li>
</ul>
<p> IronOCR е софтуерен компонент C#, позволяващ на .NET кодерите да четат текст от изображения и PDF документи на 126
езика, включително български.</p>
<p> Това е усъвършенствана вилка на Tesseract, създадена изключително за разработчиците .NET и редовно превъзхожда
останалите двигатели на Tesseract както по скорост, така и по точност.</p>
<h2> Съдържание на IronOcr.Languages.Bulgarian</h2>
<p> Този пакет съдържа три OCR езика за .NET:</p>
<ul>
<li> български</li>
<li> BulgarianBest</li>
<li> BulgarianFast</li>
</ul>
<h2> Изтегли</h2>
<p> Български езиков пакет <span style='white-space:default'>[български език]</span> <br/> * Download as <a
class='languages-dll' href='/csharp/ocr/packages/language-packs/Bulgarian.ocrdata.zip'>Цип <i
class='fas fa-download'></i><br/> * Install with </a><a target='_blank' class='languages-nuget'
href="https://www.nuget.org/packages/IronOcr.Languages.Bulgarian/">https://www.nuget.org/packages/IronOcr.Languages.Bulgarian/</a>'
NuGet<i class='nuget-icon'></i></p>
<h2> Инсталация</h2>
<p> Първото нещо, което трябва да направим, е да инсталираме нашия <strong>български</strong> OCR пакет във вашия .NET
проект.</p>
<p> <code>PM> Install-Package IronOcr.Languages.Bulgarian</code></p>
<h2> Пример за код</h2>
<p> Този пример за C# код чете български текст от Image или PDF документ.</p>
```csharp
// Install the Bulgarian OCR language package
// PM> Install-Package IronOcr.Languages.Bulgarian
using IronOcr;
var Ocr = new IronTesseract();
// Specify the language for OCR as Bulgarian
Ocr.Language = OcrLanguage.Bulgarian;
using (var Input = new OcrInput(@"images\Bulgarian.png"))
{
// Perform OCR on the input image
var Result = Ocr.Read(Input);
// Get the extracted text
var AllText = Result.Text;
// Output the text to console or another output function as needed
Console.WriteLine(AllText);
}
```
<h2>Защо да изберете IronOCR?</h2>
<p> IronOCR е лесна за инсталиране, пълна и добре документирана .NET софтуерна библиотека.</p>
<p> Изберете IronOCR, за да постигнете <strong>99,8% + OCR точност,</strong> без да използвате никакви външни уеб
услуги, текущи такси или изпращане на поверителни документи по интернет.</p>
<h4> Защо разработчиците на C# избират IronOCR пред Vanilla Tesseract:</h4>
<ul>
<li> Инсталирайте като единична DLL или NuGet</li>
<li> Включва Tesseract 5, 4 и 3 двигатели от кутията.</li>
<li> Точността <strong>99,8%</strong> значително превъзхожда обикновения Tesseract.</li>
<li> Скорост и MultiThreading</li>
<li> Съвместим с MVC, WebApp, Desktop, конзола и сървърно приложение</li>
<li> Няма нужда от Exes или C++ код</li>
<li> Пълна поддръжка на OCR за PDF</li>
<li> OCR за почти всеки файл с изображения или PDF</li>
<li> Пълна поддръжка на .NET Core, Standard и FrameWork</li>
<li> Внедряване на Windows, Mac, Linux, Azure, Docker, Lambda, AWS</li>
<li> Четене на баркодове и QR кодове</li>
<li> Експортиране на OCR във формат XHTML</li>
<li> Експортиране на OCR в PDF документи с възможност за търсене</li>
<li> Поддръжка на многопоточност</li>
<li> 126 международни езика, управлявани чрез NuGet или OcrData файлове</li>
<li> Извличане на изображения, координати, статистика и шрифтове. Не само текст.</li>
<li> Може да се използва за разпространение на Tesseract OCR в търговски и патентовани приложения.</li>
</ul>
<p> <em>OCR с IronOCR блести при работа с изображения от реалния свят и несъвършени документи като снимки или сканиране с
ниска разделителна способност, които могат да имат цифров шум или несъвършенства.</em></p>
<p> Други <a href="/csharp/ocr/use-case/free-ocr-csharp/">безплатни OCR</a> библиотеки за платформата .NET, като
например други API на .NET Tesseract и уеб услуги, не се представят толкова добре в тези случаи на използване в
реалния свят.</p>
<h2> OCR с Tesseract 5 - Стартирайте кодирането в C#</h2>
<p> Примерът по-долу показва колко лесно е да се чете текст от изображение с помощта на C# или VB .NET.</p>
<h3> OneLiner</h3>
```csharp
// Perform OCR on an image in a single line
string Text = new IronTesseract().Read(@"img\Screenshot.png").Text;
Console.WriteLine(Text);
```
<h3>Конфигурируем Hello World</h3>
```csharp
// PM> Install-Package IronOcr.Languages.Bulgarian
using IronOcr;
var Ocr = new IronTesseract();
// Set Bulgarian as the OCR language
Ocr.Language = OcrLanguage.Bulgarian;
using (var Input = new OcrInput())
{
// Add image to the OCR input
Input.AddImage("images/sample.jpeg");
// You can add any number of images
var Result = Ocr.Read(Input);
// Output the recognized text
Console.WriteLine(Result.Text);
}
```
<h3>C# PDF OCR</h3>
<p> Същият подход може да се използва по подобен начин за извличане на текст от всеки PDF документ.</p>
```csharp
using IronOcr;
var Ocr = new IronTesseract();
// Set the OCR language to Bulgarian
Ocr.Language = OcrLanguage.Bulgarian;
using (var input = new OcrInput())
{
// Add a PDF and provide a password if necessary
input.AddPdf("example.pdf", "password");
// You can also select specific PDF page numbers for OCR
var Result = Ocr.Read(input);
Console.WriteLine(Result.Text);
Console.WriteLine($"{Result.Pages.Count()} Pages");
// Outputs the page count of the PDF file
}
```
<h3>OCR за MultiPage TIFF</h3>
<p> OCR четене на TIFF файлов формат, включително многостранични документи. TIFF може също да се преобразува директно в
PDF файл с текст, който може да се търси.</p>
```csharp
using IronOcr;
var Ocr = new IronTesseract();
// Set the OCR language to Bulgarian
Ocr.Language = OcrLanguage.Bulgarian;
using (var Input = new OcrInput())
{
// Load a multi-frame TIFF file
Input.AddMultiFrameTiff("multi-frame.tiff");
// Perform OCR on the input TIFF
var Result = Ocr.Read(Input);
// Output the recognized text
Console.WriteLine(Result.Text);
}
```
<h3>Баркодове и QR</h3>
<p> Уникална характеристика на IronOCR е, че може да чете баркодове и QR кодове от документи, докато сканира за текст.
<code>OcrResult.OcrBarcode</code> класа <code>OcrResult.OcrBarcode</code> дава на разработчика подробна информация
за всеки сканиран баркод.</p>
```csharp
using IronOcr;
var Ocr = new IronTesseract();
// Enable barcode reading
Ocr.Configuration.ReadBarCodes = true;
using (var input = new OcrInput())
{
// Add image to OCR input
input.AddImage("img/Barcode.png");
// Perform OCR on input image
var Result = Ocr.Read(input);
// Iterate through scanned barcodes
foreach (var Barcode in Result.Barcodes)
{
Console.WriteLine(Barcode.Value);
// Additional barcode properties like type and location are also available
}
}
```
<h3>OCR за специфични области на изображения</h3>
<p> Всички методи за сканиране и четене на OCR на Iron осигуряват възможността точно да посочим от коя част на страница
или страници искаме да четем текст. Това е много полезно, когато разглеждаме стандартизирани формуляри и може да
спести ужасно много време и да подобри ефективността.</p>
<p> За да използваме области за изрязване, ще трябва да добавим системна препратка към <code>System.Drawing</code> за да
можем да използваме обекта <code>System.Drawing.Rectangle</code> .</p>
```csharp
using IronOcr;
using System.Drawing; // Reference for Rectangle class
var Ocr = new IronTesseract();
// Set the OCR language to Bulgarian
Ocr.Language = OcrLanguage.Bulgarian;
using (var Input = new OcrInput())
{
// Define specific content area to read
var ContentArea = new Rectangle { X = 215, Y = 1250, Height = 280, Width = 1335 };
// Dimensions are in pixels
// Add the document with a specified region to perform OCR
Input.Add("document.png", ContentArea);
// Perform OCR on the defined region
var Result = Ocr.Read(Input);
// Output the text of the defined region
Console.WriteLine(Result.Text);
}
```
<h3>OCR за нискокачествени сканирания</h3>
<p> Класът IronOCR <code>OcrInput</code> може да поправи сканирания, които нормалният Tesseract не може да прочете.</p>
```csharp
using IronOcr;
var Ocr = new IronTesseract();
// Set the OCR language to Bulgarian
Ocr.Language = OcrLanguage.Bulgarian;
using (var Input = new OcrInput(@"img\Potter.LowQuality.tiff"))
{
// Apply filters to fix the image
Input.DeNoise(); // Removes digital noise and corrects bad scans
Input.Deskew(); // Corrects rotation and perspective
// Perform OCR on the enhanced input
var Result = Ocr.Read(Input);
// Output the corrected text
Console.WriteLine(Result.Text);
}
```
<h3>Експортирайте резултатите от OCR като PDF с възможност за търсене</h3>
<p> Изображение в PDF с копируеми текстови низове. Може да се индексира от търсачките и базите данни.</p>
```csharp
using IronOcr;
var Ocr = new IronTesseract();
// Set the OCR language to Bulgarian
Ocr.Language = OcrLanguage.Bulgarian;
using (var Input = new OcrInput())
{
// Set the title for the PDF
Input.Title = "Quarterly Report";
// Add images to be included in the PDF
Input.AddImage("image1.jpeg");
Input.AddImage("image2.png");
Input.AddImage("image3.gif");
// Perform OCR on the input
var Result = Ocr.Read(Input);
// Save the OCR result as a searchable PDF
Result.SaveAsSearchablePdf("searchable.pdf");
}
```
<h3>TIFF към PDF конвертиране с възможност за търсене</h3>
<p> Конвертирайте TIFF документ (или произволна група файлове с изображения) директно в PDF с възможност за търсене,
който може да бъде индексиран от интранет, уебсайт и google търсачки.</p>
```csharp
using IronOcr;
var Ocr = new IronTesseract();
// Set the OCR language to Bulgarian
Ocr.Language = OcrLanguage.Bulgarian;
using (var Input = new OcrInput())
{
// Add a multi-page TIFF to be converted into a searchable PDF
Input.AddMultiFrameTiff("example.tiff");
// Perform OCR and save the result as a searchable PDF
var Result = Ocr.Read(Input);
Result.SaveAsSearchablePdf("searchable.pdf");
}
```
<h3>Експортирайте резултатите от OCR като HTML</h3>
<p> Преобразуване на OCR изображение в XHTML.</p>
```csharp
using IronOcr;
var Ocr = new IronTesseract();
// Set the OCR language to Bulgarian
Ocr.Language = OcrLanguage.Bulgarian;
using (var Input = new OcrInput())
{
// Provide a title for the output HTML
Input.Title = "Html Title";
// Add images to be scanned
Input.AddImage("image1.jpeg");
// Perform OCR on the input
var Result = Ocr.Read(Input);
// Save the result as an XHTML file
Result.SaveAsHocrFile("results.html");
}
```
<h2>OCR филтри за подобряване на изображението</h2>
<p> IronOCR предоставя уникални филтри за <code>OcrInput</code> обекти за подобряване на производителността на OCR.</p>
<h3> Пример за код за подобряване на изображението</h3>
<p> Прави изображенията с OCR по-високо качество, за да се получат по-добри и по-бързи резултати за OCR.</p>
```csharp
using IronOcr;
var Ocr = new IronTesseract();
// Set the OCR language to Bulgarian
Ocr.Language = OcrLanguage.Bulgarian;
using (var Input = new OcrInput(@"LowQuality.jpeg"))
{
// Apply filters to improve image quality for OCR
Input.DeNoise(); // Removes digital noise and corrects bad scans
Input.Deskew(); // Corrects rotation and perspective
// Perform OCR on the enhanced input
var Result = Ocr.Read(Input);
// Output the recognized text
Console.WriteLine(Result.Text);
}
```
<h3>Списък с OCR филтри за изображения</h3>
<p> Входните филтри за подобряване на производителността на OCR, които са вградени в IronOCR, включват:</p>
<ul>
<li> <strong>OcrInput.Rotate(double degrees)</strong> - Завърта изображенията с определен брой градуси по
часовниковата стрелка. За обратно на часовниковата стрелка използвайте отрицателни числа.</li>
<li> <strong>OcrInput.Binarize()</strong> - Превръща всеки пиксел в черно или бяло, без междинни стойности. Може
да подобри OCR при нисък контраст между текст и фон.</li>
<li> <strong>OcrInput.ToGrayScale()</strong> - Превръща всеки пиксел в нюанс на сивата скала. Ускорява OCR, но
може да не подобри точността.</li>
<li> <strong>OcrInput.Contrast()</strong> - Автоматично увеличава контраста и често подобрява скоростта и точността
на OCR при нисък контраст.</li>
<li> <strong>OcrInput.DeNoise()</strong> - Премахва цифровия шум, използвайте при шумни изображения.</li>
<li> <strong>OcrInput.Invert()</strong> - Инвертира цветовете, полезно при негативни изображения.</li>
<li> <strong>OcrInput.Dilate()</strong> - Добавя пиксели към границите на обекти, противоположно на
<em>Erode</em>.</li>
<li> <strong>OcrInput.Erode()</strong> - Премахва пикселите по границите на обекта, противоположно на
<em>Разширяване</em>.</li>
<li> <strong>OcrInput.Deskew()</strong> - Завърта и изправя изображения за по-добри OCR резултати до
5-градусова толерантност.</li>
<li> <strong>OcrInput.DeepCleanBackgroundNoise()</strong> - Премахва сериозен фонов шум. Използвайте само при
екстремни шумове, тъй като може да намали точността.</li>
<li> <strong>OcrInput.EnhanceResolution</strong> - Подобрява разширително решение за нискокачествени
изображения, автоматичното управление е налично чрез <em>MinimumDPI</em> и <em>TargetDPI</em>.</li>
</ul>
<p> <strong>CleanBackgroundNoise:</strong> Автоматично почиства дигиталния шум.</p>
<p> <strong>EnhanceContrast:</strong> Увеличава контраста на текста и фона за по-добра точност и производителност.</p>
<p> <strong>EnhanceResolution:</strong> Коригира ниска резолюция до 275 dpi за по-добра точност.</p>
<p> <strong>Language:</strong> Поддръжка на 22 международни езикови пакета за целенасочени OCR операции.</p>
<p> <strong>Strategy:</strong> Изберете между бърза и точно сложна OCR стратегия с AI модели.</p>
<p> <strong>ColorSpace:</strong> Избор между сивата скала или пълноцветен OCR за по-добри резултати.</p>
<p> <strong>DetectWhiteTextOnDarkBackgrounds:</strong> Позволява откриване на бял текст на черен фон.</p>
<p> <strong>InputImageType:</strong> Водещ OCR за пълен документ или фрагмент.</p>
<p> <strong>RotateAndStraighten:</strong> Обработка на завъртени и перспективни документи.</p>
<p> <strong>ReadBarcodes:</strong> Позволява разпознаване на баркодове и QR кодове.</p>
<p> <strong>ColorDepth:</strong> Определя цветната дълбочина за OCR библиотеката, по-високите консумпират повече
време.</p>
<h2> 126 Езикови пакети</h2>
<p> IronOCR поддържа <strong>126 международни езика</strong> чрез езикови пакети, които се разпространяват като DLL,
които могат да бъдат <a href="/csharp/ocr/languages/">изтеглени от този уебсайт</a> или също от <a
href="https://www.nuget.org/packages?q=IronOcr.Languages">NuGet Package Manager</a> .</p>
<p> Езиците включват немски, френски, английски, китайски, японски и много други. Съществуват специализирани езикови
пакети за паспорт MRZ, MICR чекове, финансови данни, регистрационни табели и много други. Можете също така да
използвате всеки файл ".traineddata" на Tesseract - включително тези, които създавате сами.</p>
<h3> Пример за език</h3>
<p> Използване на други OCR езици.</p>
```csharp
// using IronOcr;
// PM> Install IronOcr.Languages.Arabic
var Ocr = new IronTesseract();
// Set the OCR language to Arabic
Ocr.Language = OcrLanguage.Arabic;
using (var input = new OcrInput())
{
// Add Arabic image to input
input.AddImage("img/arabic.gif");
// Optional: Add image filters if necessary
// Despite the low quality of this input
// IronTesseract can read it where conventional Tesseract might fail
var Result = Ocr.Read(input);
// Windows console may have problems printing Arabic characters.
// Saving the result to disk instead.
Result.SaveAsTextFile("arabic.txt");
}
```
<h3>Пример за многоезичен език</h3>
<p> Възможно е също така OCR да се използва едновременно на няколко езика. Това наистина може да помогне за получаване
на метаданни и URL адреси на английски език в Unicode документи.</p>
```csharp
// using IronOcr;
// PM> Install IronOcr.Languages.ChineseSimplified
var Ocr = new IronTesseract();
// Set primary OCR language to Chinese Simplified
Ocr.Language = OcrLanguage.ChineseSimplified;
// Add Bulgarian as a secondary language for OCR
Ocr.AddSecondaryLanguage(OcrLanguage.Bulgarian);
// You can add any number of languages
using (var input = new OcrInput())
{
// Add multi-language PDF to input
input.Add("multi-language.pdf");
var Result = Ocr.Read(input);
// Save the OCR result to a text file
Result.SaveAsTextFile("results.txt");
}
```
<h2>Подробни обекти с резултати от OCR</h2>
<p> IronOCR връща обект с резултат на OCR за всяка операция на OCR. Като цяло разработчиците използват само свойството
text на този обект, за да получат сканирания текст от изображението. Въпреки това, резултатите от OCR DOM са много
по-напреднали от този.</p>
```csharp
using IronOcr;
using System.Drawing; // Add reference for assembly
var Ocr = new IronTesseract();
// Set the OCR language to Bulgarian
Ocr.Language = OcrLanguage.Bulgarian;
Ocr.Configuration.EngineMode = TesseractEngineMode.TesseractAndLstm;
// Enable barcode reading
Ocr.Configuration.ReadBarCodes = true;
using (var Input = new OcrInput(@"images\sample.tiff"))
{
// Perform OCR on input TIFF file
OcrResult Result = Ocr.Read(Input);
var Pages = Result.Pages;
var Words = Pages[0].Words;
var Barcodes = Result.Barcodes;
// Explore properties like:
// - Pages, Blocks, Paragraphs, Lines, Words, Characters
// - Export Images, Font Coordinates, Statistics
}
```
<h2>производителност</h2>
<p> IronOCR работи извън кутията, без да е необходимо да настройвате производителността или да модифицирате силно
входните изображения.</p>
<p> Скоростта е бърза: IronOCR.2020+ е до 10 пъти по-бърз и прави над 250% по-малко грешки от предишните компилации.</p>
<h2> Научете повече</h2>
<p> За да научите повече за OCR на C#, VB, F# или който и да е друг .NET език, моля, <a
href="/csharp/ocr/tutorials/how-to-read-text-from-an-image-in-csharp-net/">прочетете нашите уроци в
общността</a>, които дават реални примери за това как IronOCR може да се използва и могат да покажат нюансите
как да извлечете най-доброто от тази библиотека.</p>
<p> Налична е и пълна <a href="/csharp/ocr/object-reference/api/">справка за обекти за разработчици .NET</a>.</p>
IronOCR е софтуерен компонент C#, позволяващ на .NET кодерите да четат текст от изображения и PDF документи на 126
езика, включително български.
Това е усъвършенствана вилка на Tesseract, създадена изключително за разработчиците .NET и редовно превъзхожда
останалите двигатели на Tesseract както по скорост, така и по точност.
Първото нещо, което трябва да направим, е да инсталираме нашия български OCR пакет във вашия .NET
проект.
PM> Install-Package IronOcr.Languages.Bulgarian
Пример за код
Този пример за C# код чете български текст от Image или PDF документ.
// Install the Bulgarian OCR language package// PM> Install-Package IronOcr.Languages.Bulgarianusing IronOcr;varOcr = new IronTesseract();// Specify the language for OCR as BulgarianOcr.Language = OcrLanguage.Bulgarian; using (varInput = new OcrInput(@"images\Bulgarian.png")){ // Perform OCR on the input image varResult = Ocr.Read(Input); // Get the extracted text varAllText = Result.Text; // Output the text to console or another output function as neededConsole.WriteLine(AllText);}
// Install the Bulgarian OCR language package
// PM> Install-Package IronOcr.Languages.Bulgarian
using IronOcr;
var Ocr = new IronTesseract();
// Specify the language for OCR as Bulgarian
Ocr.Language = OcrLanguage.Bulgarian;
using (var Input = new OcrInput(@"images\Bulgarian.png"))
{
// Perform OCR on the input image
var Result = Ocr.Read(Input);
// Get the extracted text
var AllText = Result.Text;
// Output the text to console or another output function as needed
Console.WriteLine(AllText);
}
' Install the Bulgarian OCR language package' PM> Install-Package IronOcr.Languages.BulgarianImportsIronOcrPrivateOcr = New IronTesseract()' Specify the language for OCR as BulgarianOcr.Language = OcrLanguage.BulgarianUsingInput = New OcrInput("images\Bulgarian.png") ' Perform OCR on the input image DimResult = Ocr.Read(Input) ' Get the extracted text DimAllText = Result.Text ' Output the text to console or another output function as neededConsole.WriteLine(AllText)EndUsing
' Install the Bulgarian OCR language package
' PM> Install-Package IronOcr.Languages.Bulgarian
Imports IronOcr
Private Ocr = New IronTesseract()
' Specify the language for OCR as Bulgarian
Ocr.Language = OcrLanguage.Bulgarian
Using Input = New OcrInput("images\Bulgarian.png")
' Perform OCR on the input image
Dim Result = Ocr.Read(Input)
' Get the extracted text
Dim AllText = Result.Text
' Output the text to console or another output function as needed
Console.WriteLine(AllText)
End Using
Защо да изберете IronOCR?
IronOCR е лесна за инсталиране, пълна и добре документирана .NET софтуерна библиотека.
Изберете IronOCR, за да постигнете 99,8% + OCR точност, без да използвате никакви външни уеб
услуги, текущи такси или изпращане на поверителни документи по интернет.
Защо разработчиците на C# избират IronOCR пред Vanilla Tesseract:
Инсталирайте като единична DLL или NuGet
Включва Tesseract 5, 4 и 3 двигатели от кутията.
Точността 99,8% значително превъзхожда обикновения Tesseract.
Скорост и MultiThreading
Съвместим с MVC, WebApp, Desktop, конзола и сървърно приложение
Няма нужда от Exes или C++ код
Пълна поддръжка на OCR за PDF
OCR за почти всеки файл с изображения или PDF
Пълна поддръжка на .NET Core, Standard и FrameWork
Внедряване на Windows, Mac, Linux, Azure, Docker, Lambda, AWS
Четене на баркодове и QR кодове
Експортиране на OCR във формат XHTML
Експортиране на OCR в PDF документи с възможност за търсене
Поддръжка на многопоточност
126 международни езика, управлявани чрез NuGet или OcrData файлове
Извличане на изображения, координати, статистика и шрифтове. Не само текст.
Може да се използва за разпространение на Tesseract OCR в търговски и патентовани приложения.
OCR с IronOCR блести при работа с изображения от реалния свят и несъвършени документи като снимки или сканиране с
ниска разделителна способност, които могат да имат цифров шум или несъвършенства.
Други безплатни OCR библиотеки за платформата .NET, като
например други API на .NET Tesseract и уеб услуги, не се представят толкова добре в тези случаи на използване в
реалния свят.
OCR с Tesseract 5 - Стартирайте кодирането в C#
Примерът по-долу показва колко лесно е да се чете текст от изображение с помощта на C# или VB .NET.
OneLiner
// Perform OCR on an image in a single linestringText = new IronTesseract().Read(@"img\Screenshot.png").Text;Console.WriteLine(Text);
// Perform OCR on an image in a single line
string Text = new IronTesseract().Read(@"img\Screenshot.png").Text;
Console.WriteLine(Text);
' Perform OCR on an image in a single lineDimTextAsString = (New IronTesseract()).Read("img\Screenshot.png").TextConsole.WriteLine(Text)
' Perform OCR on an image in a single line
Dim Text As String = (New IronTesseract()).Read("img\Screenshot.png").Text
Console.WriteLine(Text)
Конфигурируем Hello World
// PM> Install-Package IronOcr.Languages.Bulgarianusing IronOcr;varOcr = new IronTesseract();// Set Bulgarian as the OCR languageOcr.Language = OcrLanguage.Bulgarian;using (varInput = new OcrInput()){ // Add image to the OCR inputInput.AddImage("images/sample.jpeg"); // You can add any number of images varResult = Ocr.Read(Input); // Output the recognized textConsole.WriteLine(Result.Text);}
// PM> Install-Package IronOcr.Languages.Bulgarian
using IronOcr;
var Ocr = new IronTesseract();
// Set Bulgarian as the OCR language
Ocr.Language = OcrLanguage.Bulgarian;
using (var Input = new OcrInput())
{
// Add image to the OCR input
Input.AddImage("images/sample.jpeg");
// You can add any number of images
var Result = Ocr.Read(Input);
// Output the recognized text
Console.WriteLine(Result.Text);
}
ImportsIronOcr' PM> Install-Package IronOcr.Languages.BulgarianDimOcrAs New IronTesseract()' Set Bulgarian as the OCR languageOcr.Language = OcrLanguage.BulgarianUsingInputAs New OcrInput() ' Add image to the OCR inputInput.AddImage("images/sample.jpeg") ' You can add any number of images DimResult = Ocr.Read(Input) ' Output the recognized textConsole.WriteLine(Result.Text)EndUsing
Imports IronOcr
' PM> Install-Package IronOcr.Languages.Bulgarian
Dim Ocr As New IronTesseract()
' Set Bulgarian as the OCR language
Ocr.Language = OcrLanguage.Bulgarian
Using Input As New OcrInput()
' Add image to the OCR input
Input.AddImage("images/sample.jpeg")
' You can add any number of images
Dim Result = Ocr.Read(Input)
' Output the recognized text
Console.WriteLine(Result.Text)
End Using
C# PDF OCR
Същият подход може да се използва по подобен начин за извличане на текст от всеки PDF документ.
using IronOcr;varOcr = new IronTesseract();// Set the OCR language to BulgarianOcr.Language = OcrLanguage.Bulgarian;using (var input = new OcrInput()){ // Add a PDF and provide a password if necessary input.AddPdf("example.pdf", "password"); // You can also select specific PDF page numbers for OCR varResult = Ocr.Read(input);Console.WriteLine(Result.Text);Console.WriteLine($"{Result.Pages.Count()} Pages"); // Outputs the page count of the PDF file}
using IronOcr;
var Ocr = new IronTesseract();
// Set the OCR language to Bulgarian
Ocr.Language = OcrLanguage.Bulgarian;
using (var input = new OcrInput())
{
// Add a PDF and provide a password if necessary
input.AddPdf("example.pdf", "password");
// You can also select specific PDF page numbers for OCR
var Result = Ocr.Read(input);
Console.WriteLine(Result.Text);
Console.WriteLine($"{Result.Pages.Count()} Pages");
// Outputs the page count of the PDF file
}
ImportsIronOcrPrivateOcr = New IronTesseract()' Set the OCR language to BulgarianOcr.Language = OcrLanguage.BulgarianUsing input = New OcrInput() ' Add a PDF and provide a password if necessary input.AddPdf("example.pdf", "password") ' You can also select specific PDF page numbers for OCR DimResult = Ocr.Read(input)Console.WriteLine(Result.Text)Console.WriteLine($"{Result.Pages.Count()} Pages") ' Outputs the page count of the PDF fileEndUsing
Imports IronOcr
Private Ocr = New IronTesseract()
' Set the OCR language to Bulgarian
Ocr.Language = OcrLanguage.Bulgarian
Using input = New OcrInput()
' Add a PDF and provide a password if necessary
input.AddPdf("example.pdf", "password")
' You can also select specific PDF page numbers for OCR
Dim Result = Ocr.Read(input)
Console.WriteLine(Result.Text)
Console.WriteLine($"{Result.Pages.Count()} Pages")
' Outputs the page count of the PDF file
End Using
OCR за MultiPage TIFF
OCR четене на TIFF файлов формат, включително многостранични документи. TIFF може също да се преобразува директно в
PDF файл с текст, който може да се търси.
using IronOcr;varOcr = new IronTesseract();// Set the OCR language to BulgarianOcr.Language = OcrLanguage.Bulgarian;using (varInput = new OcrInput()){ // Load a multi-frame TIFF fileInput.AddMultiFrameTiff("multi-frame.tiff"); // Perform OCR on the input TIFF varResult = Ocr.Read(Input); // Output the recognized textConsole.WriteLine(Result.Text);}
using IronOcr;
var Ocr = new IronTesseract();
// Set the OCR language to Bulgarian
Ocr.Language = OcrLanguage.Bulgarian;
using (var Input = new OcrInput())
{
// Load a multi-frame TIFF file
Input.AddMultiFrameTiff("multi-frame.tiff");
// Perform OCR on the input TIFF
var Result = Ocr.Read(Input);
// Output the recognized text
Console.WriteLine(Result.Text);
}
ImportsIronOcrDimOcr = New IronTesseract()' Set the OCR language to BulgarianOcr.Language = OcrLanguage.BulgarianUsingInput = New OcrInput() ' Load a multi-frame TIFF fileInput.AddMultiFrameTiff("multi-frame.tiff") ' Perform OCR on the input TIFF DimResult = Ocr.Read(Input) ' Output the recognized textConsole.WriteLine(Result.Text)EndUsing
Imports IronOcr
Dim Ocr = New IronTesseract()
' Set the OCR language to Bulgarian
Ocr.Language = OcrLanguage.Bulgarian
Using Input = New OcrInput()
' Load a multi-frame TIFF file
Input.AddMultiFrameTiff("multi-frame.tiff")
' Perform OCR on the input TIFF
Dim Result = Ocr.Read(Input)
' Output the recognized text
Console.WriteLine(Result.Text)
End Using
Баркодове и QR
Уникална характеристика на IronOCR е, че може да чете баркодове и QR кодове от документи, докато сканира за текст.
OcrResult.OcrBarcode класа OcrResult.OcrBarcode дава на разработчика подробна информация
за всеки сканиран баркод.
using IronOcr;varOcr = new IronTesseract();// Enable barcode readingOcr.Configuration.ReadBarCodes = true;using (var input = new OcrInput()){ // Add image to OCR input input.AddImage("img/Barcode.png"); // Perform OCR on input image varResult = Ocr.Read(input); // Iterate through scanned barcodes foreach (varBarcodeinResult.Barcodes) {Console.WriteLine(Barcode.Value); // Additional barcode properties like type and location are also available }}
using IronOcr;
var Ocr = new IronTesseract();
// Enable barcode reading
Ocr.Configuration.ReadBarCodes = true;
using (var input = new OcrInput())
{
// Add image to OCR input
input.AddImage("img/Barcode.png");
// Perform OCR on input image
var Result = Ocr.Read(input);
// Iterate through scanned barcodes
foreach (var Barcode in Result.Barcodes)
{
Console.WriteLine(Barcode.Value);
// Additional barcode properties like type and location are also available
}
}
ImportsIronOcrDimOcr = New IronTesseract()' Enable barcode readingOcr.Configuration.ReadBarCodes = TrueUsing input = New OcrInput() ' Add image to OCR input input.AddImage("img/Barcode.png") ' Perform OCR on input image DimResult = Ocr.Read(input) ' Iterate through scanned barcodes For EachBarcodeInResult.BarcodesConsole.WriteLine(Barcode.Value) ' Additional barcode properties like type and location are also available NextEndUsing
Imports IronOcr
Dim Ocr = New IronTesseract()
' Enable barcode reading
Ocr.Configuration.ReadBarCodes = True
Using input = New OcrInput()
' Add image to OCR input
input.AddImage("img/Barcode.png")
' Perform OCR on input image
Dim Result = Ocr.Read(input)
' Iterate through scanned barcodes
For Each Barcode In Result.Barcodes
Console.WriteLine(Barcode.Value)
' Additional barcode properties like type and location are also available
Next
End Using
OCR за специфични области на изображения
Всички методи за сканиране и четене на OCR на Iron осигуряват възможността точно да посочим от коя част на страница
или страници искаме да четем текст. Това е много полезно, когато разглеждаме стандартизирани формуляри и може да
спести ужасно много време и да подобри ефективността.
За да използваме области за изрязване, ще трябва да добавим системна препратка към System.Drawing за да
можем да използваме обекта System.Drawing.Rectangle .
using IronOcr;using System.Drawing; // Reference for Rectangle classvarOcr = new IronTesseract();// Set the OCR language to BulgarianOcr.Language = OcrLanguage.Bulgarian;using (varInput = new OcrInput()){ // Define specific content area to read varContentArea = new Rectangle { X = 215, Y = 1250, Height = 280, Width = 1335 }; // Dimensions are in pixels // Add the document with a specified region to perform OCRInput.Add("document.png", ContentArea); // Perform OCR on the defined region varResult = Ocr.Read(Input); // Output the text of the defined regionConsole.WriteLine(Result.Text);}
using IronOcr;
using System.Drawing; // Reference for Rectangle class
var Ocr = new IronTesseract();
// Set the OCR language to Bulgarian
Ocr.Language = OcrLanguage.Bulgarian;
using (var Input = new OcrInput())
{
// Define specific content area to read
var ContentArea = new Rectangle { X = 215, Y = 1250, Height = 280, Width = 1335 };
// Dimensions are in pixels
// Add the document with a specified region to perform OCR
Input.Add("document.png", ContentArea);
// Perform OCR on the defined region
var Result = Ocr.Read(Input);
// Output the text of the defined region
Console.WriteLine(Result.Text);
}
ImportsIronOcrImportsSystem.Drawing' Reference for Rectangle classDimOcr = New IronTesseract()' Set the OCR language to BulgarianOcr.Language = OcrLanguage.BulgarianUsingInput = New OcrInput() ' Define specific content area to read DimContentArea = New RectangleWith {.X = 215, .Y = 1250, .Height = 280, .Width = 1335} ' Dimensions are in pixels ' Add the document with a specified region to perform OCRInput.Add("document.png", ContentArea) ' Perform OCR on the defined region DimResult = Ocr.Read(Input) ' Output the text of the defined regionConsole.WriteLine(Result.Text)EndUsing
Imports IronOcr
Imports System.Drawing ' Reference for Rectangle class
Dim Ocr = New IronTesseract()
' Set the OCR language to Bulgarian
Ocr.Language = OcrLanguage.Bulgarian
Using Input = New OcrInput()
' Define specific content area to read
Dim ContentArea = New Rectangle With {.X = 215, .Y = 1250, .Height = 280, .Width = 1335}
' Dimensions are in pixels
' Add the document with a specified region to perform OCR
Input.Add("document.png", ContentArea)
' Perform OCR on the defined region
Dim Result = Ocr.Read(Input)
' Output the text of the defined region
Console.WriteLine(Result.Text)
End Using
OCR за нискокачествени сканирания
Класът IronOCR OcrInput може да поправи сканирания, които нормалният Tesseract не може да прочете.
using IronOcr;varOcr = new IronTesseract();// Set the OCR language to BulgarianOcr.Language = OcrLanguage.Bulgarian;using (varInput = new OcrInput(@"img\Potter.LowQuality.tiff")){ // Apply filters to fix the imageInput.DeNoise(); // Removes digital noise and corrects bad scansInput.Deskew(); // Corrects rotation and perspective // Perform OCR on the enhanced input varResult = Ocr.Read(Input); // Output the corrected textConsole.WriteLine(Result.Text);}
using IronOcr;
var Ocr = new IronTesseract();
// Set the OCR language to Bulgarian
Ocr.Language = OcrLanguage.Bulgarian;
using (var Input = new OcrInput(@"img\Potter.LowQuality.tiff"))
{
// Apply filters to fix the image
Input.DeNoise(); // Removes digital noise and corrects bad scans
Input.Deskew(); // Corrects rotation and perspective
// Perform OCR on the enhanced input
var Result = Ocr.Read(Input);
// Output the corrected text
Console.WriteLine(Result.Text);
}
ImportsIronOcrDimOcr = New IronTesseract()' Set the OCR language to BulgarianOcr.Language = OcrLanguage.BulgarianUsingInput = New OcrInput("img\Potter.LowQuality.tiff") ' Apply filters to fix the imageInput.DeNoise() ' Removes digital noise and corrects bad scansInput.Deskew() ' Corrects rotation and perspective ' Perform OCR on the enhanced input DimResult = Ocr.Read(Input) ' Output the corrected textConsole.WriteLine(Result.Text)EndUsing
Imports IronOcr
Dim Ocr = New IronTesseract()
' Set the OCR language to Bulgarian
Ocr.Language = OcrLanguage.Bulgarian
Using Input = New OcrInput("img\Potter.LowQuality.tiff")
' Apply filters to fix the image
Input.DeNoise() ' Removes digital noise and corrects bad scans
Input.Deskew() ' Corrects rotation and perspective
' Perform OCR on the enhanced input
Dim Result = Ocr.Read(Input)
' Output the corrected text
Console.WriteLine(Result.Text)
End Using
Експортирайте резултатите от OCR като PDF с възможност за търсене
Изображение в PDF с копируеми текстови низове. Може да се индексира от търсачките и базите данни.
using IronOcr;varOcr = new IronTesseract();// Set the OCR language to BulgarianOcr.Language = OcrLanguage.Bulgarian;using (varInput = new OcrInput()){ // Set the title for the PDFInput.Title = "Quarterly Report"; // Add images to be included in the PDFInput.AddImage("image1.jpeg");Input.AddImage("image2.png");Input.AddImage("image3.gif"); // Perform OCR on the input varResult = Ocr.Read(Input); // Save the OCR result as a searchable PDFResult.SaveAsSearchablePdf("searchable.pdf");}
using IronOcr;
var Ocr = new IronTesseract();
// Set the OCR language to Bulgarian
Ocr.Language = OcrLanguage.Bulgarian;
using (var Input = new OcrInput())
{
// Set the title for the PDF
Input.Title = "Quarterly Report";
// Add images to be included in the PDF
Input.AddImage("image1.jpeg");
Input.AddImage("image2.png");
Input.AddImage("image3.gif");
// Perform OCR on the input
var Result = Ocr.Read(Input);
// Save the OCR result as a searchable PDF
Result.SaveAsSearchablePdf("searchable.pdf");
}
ImportsIronOcrDimOcrAs New IronTesseract()' Set the OCR language to BulgarianOcr.Language = OcrLanguage.BulgarianUsingInputAs New OcrInput() ' Set the title for the PDFInput.Title = "Quarterly Report" ' Add images to be included in the PDFInput.AddImage("image1.jpeg")Input.AddImage("image2.png")Input.AddImage("image3.gif") ' Perform OCR on the input DimResult = Ocr.Read(Input) ' Save the OCR result as a searchable PDFResult.SaveAsSearchablePdf("searchable.pdf")EndUsing
Imports IronOcr
Dim Ocr As New IronTesseract()
' Set the OCR language to Bulgarian
Ocr.Language = OcrLanguage.Bulgarian
Using Input As New OcrInput()
' Set the title for the PDF
Input.Title = "Quarterly Report"
' Add images to be included in the PDF
Input.AddImage("image1.jpeg")
Input.AddImage("image2.png")
Input.AddImage("image3.gif")
' Perform OCR on the input
Dim Result = Ocr.Read(Input)
' Save the OCR result as a searchable PDF
Result.SaveAsSearchablePdf("searchable.pdf")
End Using
TIFF към PDF конвертиране с възможност за търсене
Конвертирайте TIFF документ (или произволна група файлове с изображения) директно в PDF с възможност за търсене,
който може да бъде индексиран от интранет, уебсайт и google търсачки.
using IronOcr;varOcr = new IronTesseract();// Set the OCR language to BulgarianOcr.Language = OcrLanguage.Bulgarian;using (varInput = new OcrInput()){ // Add a multi-page TIFF to be converted into a searchable PDFInput.AddMultiFrameTiff("example.tiff"); // Perform OCR and save the result as a searchable PDF varResult = Ocr.Read(Input);Result.SaveAsSearchablePdf("searchable.pdf");}
using IronOcr;
var Ocr = new IronTesseract();
// Set the OCR language to Bulgarian
Ocr.Language = OcrLanguage.Bulgarian;
using (var Input = new OcrInput())
{
// Add a multi-page TIFF to be converted into a searchable PDF
Input.AddMultiFrameTiff("example.tiff");
// Perform OCR and save the result as a searchable PDF
var Result = Ocr.Read(Input);
Result.SaveAsSearchablePdf("searchable.pdf");
}
ImportsIronOcrDimOcr = New IronTesseract()' Set the OCR language to BulgarianOcr.Language = OcrLanguage.BulgarianUsingInput = New OcrInput() ' Add a multi-page TIFF to be converted into a searchable PDFInput.AddMultiFrameTiff("example.tiff") ' Perform OCR and save the result as a searchable PDF DimResult = Ocr.Read(Input)Result.SaveAsSearchablePdf("searchable.pdf")EndUsing
Imports IronOcr
Dim Ocr = New IronTesseract()
' Set the OCR language to Bulgarian
Ocr.Language = OcrLanguage.Bulgarian
Using Input = New OcrInput()
' Add a multi-page TIFF to be converted into a searchable PDF
Input.AddMultiFrameTiff("example.tiff")
' Perform OCR and save the result as a searchable PDF
Dim Result = Ocr.Read(Input)
Result.SaveAsSearchablePdf("searchable.pdf")
End Using
Експортирайте резултатите от OCR като HTML
Преобразуване на OCR изображение в XHTML.
using IronOcr;varOcr = new IronTesseract();// Set the OCR language to BulgarianOcr.Language = OcrLanguage.Bulgarian;using (varInput = new OcrInput()){ // Provide a title for the output HTMLInput.Title = "Html Title"; // Add images to be scannedInput.AddImage("image1.jpeg"); // Perform OCR on the input varResult = Ocr.Read(Input); // Save the result as an XHTML fileResult.SaveAsHocrFile("results.html");}
using IronOcr;
var Ocr = new IronTesseract();
// Set the OCR language to Bulgarian
Ocr.Language = OcrLanguage.Bulgarian;
using (var Input = new OcrInput())
{
// Provide a title for the output HTML
Input.Title = "Html Title";
// Add images to be scanned
Input.AddImage("image1.jpeg");
// Perform OCR on the input
var Result = Ocr.Read(Input);
// Save the result as an XHTML file
Result.SaveAsHocrFile("results.html");
}
ImportsIronOcrDimOcr = New IronTesseract()' Set the OCR language to BulgarianOcr.Language = OcrLanguage.BulgarianUsingInputAs New OcrInput() ' Provide a title for the output HTMLInput.Title = "Html Title" ' Add images to be scannedInput.AddImage("image1.jpeg") ' Perform OCR on the input DimResult = Ocr.Read(Input) ' Save the result as an XHTML fileResult.SaveAsHocrFile("results.html")EndUsing
Imports IronOcr
Dim Ocr = New IronTesseract()
' Set the OCR language to Bulgarian
Ocr.Language = OcrLanguage.Bulgarian
Using Input As New OcrInput()
' Provide a title for the output HTML
Input.Title = "Html Title"
' Add images to be scanned
Input.AddImage("image1.jpeg")
' Perform OCR on the input
Dim Result = Ocr.Read(Input)
' Save the result as an XHTML file
Result.SaveAsHocrFile("results.html")
End Using
OCR филтри за подобряване на изображението
IronOCR предоставя уникални филтри за OcrInput обекти за подобряване на производителността на OCR.
Пример за код за подобряване на изображението
Прави изображенията с OCR по-високо качество, за да се получат по-добри и по-бързи резултати за OCR.
using IronOcr;varOcr = new IronTesseract();// Set the OCR language to BulgarianOcr.Language = OcrLanguage.Bulgarian;using (varInput = new OcrInput(@"LowQuality.jpeg")){ // Apply filters to improve image quality for OCRInput.DeNoise(); // Removes digital noise and corrects bad scansInput.Deskew(); // Corrects rotation and perspective // Perform OCR on the enhanced input varResult = Ocr.Read(Input); // Output the recognized textConsole.WriteLine(Result.Text);}
using IronOcr;
var Ocr = new IronTesseract();
// Set the OCR language to Bulgarian
Ocr.Language = OcrLanguage.Bulgarian;
using (var Input = new OcrInput(@"LowQuality.jpeg"))
{
// Apply filters to improve image quality for OCR
Input.DeNoise(); // Removes digital noise and corrects bad scans
Input.Deskew(); // Corrects rotation and perspective
// Perform OCR on the enhanced input
var Result = Ocr.Read(Input);
// Output the recognized text
Console.WriteLine(Result.Text);
}
ImportsIronOcrDimOcr = New IronTesseract()' Set the OCR language to BulgarianOcr.Language = OcrLanguage.BulgarianUsingInput = New OcrInput("LowQuality.jpeg") ' Apply filters to improve image quality for OCRInput.DeNoise() ' Removes digital noise and corrects bad scansInput.Deskew() ' Corrects rotation and perspective ' Perform OCR on the enhanced input DimResult = Ocr.Read(Input) ' Output the recognized textConsole.WriteLine(Result.Text)EndUsing
Imports IronOcr
Dim Ocr = New IronTesseract()
' Set the OCR language to Bulgarian
Ocr.Language = OcrLanguage.Bulgarian
Using Input = New OcrInput("LowQuality.jpeg")
' Apply filters to improve image quality for OCR
Input.DeNoise() ' Removes digital noise and corrects bad scans
Input.Deskew() ' Corrects rotation and perspective
' Perform OCR on the enhanced input
Dim Result = Ocr.Read(Input)
' Output the recognized text
Console.WriteLine(Result.Text)
End Using
Списък с OCR филтри за изображения
Входните филтри за подобряване на производителността на OCR, които са вградени в IronOCR, включват:
OcrInput.Rotate(double degrees) - Завърта изображенията с определен брой градуси по
часовниковата стрелка. За обратно на часовниковата стрелка използвайте отрицателни числа.
OcrInput.Binarize() - Превръща всеки пиксел в черно или бяло, без междинни стойности. Може
да подобри OCR при нисък контраст между текст и фон.
OcrInput.ToGrayScale() - Превръща всеки пиксел в нюанс на сивата скала. Ускорява OCR, но
може да не подобри точността.
OcrInput.Contrast() - Автоматично увеличава контраста и често подобрява скоростта и точността
на OCR при нисък контраст.
OcrInput.DeNoise() - Премахва цифровия шум, използвайте при шумни изображения.
OcrInput.Invert() - Инвертира цветовете, полезно при негативни изображения.
OcrInput.Dilate() - Добавя пиксели към границите на обекти, противоположно на
Erode.
OcrInput.Erode() - Премахва пикселите по границите на обекта, противоположно на
Разширяване.
OcrInput.Deskew() - Завърта и изправя изображения за по-добри OCR резултати до
5-градусова толерантност.
OcrInput.DeepCleanBackgroundNoise() - Премахва сериозен фонов шум. Използвайте само при
екстремни шумове, тъй като може да намали точността.
OcrInput.EnhanceResolution - Подобрява разширително решение за нискокачествени
изображения, автоматичното управление е налично чрез MinimumDPI и TargetDPI.
Езиците включват немски, френски, английски, китайски, японски и много други. Съществуват специализирани езикови
пакети за паспорт MRZ, MICR чекове, финансови данни, регистрационни табели и много други. Можете също така да
използвате всеки файл ".traineddata" на Tesseract - включително тези, които създавате сами.
Пример за език
Използване на други OCR езици.
// using IronOcr;// PM> Install IronOcr.Languages.ArabicvarOcr = new IronTesseract();// Set the OCR language to ArabicOcr.Language = OcrLanguage.Arabic;using (var input = new OcrInput()){ // Add Arabic image to input input.AddImage("img/arabic.gif"); // Optional: Add image filters if necessary // Despite the low quality of this input // IronTesseract can read it where conventional Tesseract might fail varResult = Ocr.Read(input); // Windows console may have problems printing Arabic characters. // Saving the result to disk instead.Result.SaveAsTextFile("arabic.txt");}
// using IronOcr;
// PM> Install IronOcr.Languages.Arabic
var Ocr = new IronTesseract();
// Set the OCR language to Arabic
Ocr.Language = OcrLanguage.Arabic;
using (var input = new OcrInput())
{
// Add Arabic image to input
input.AddImage("img/arabic.gif");
// Optional: Add image filters if necessary
// Despite the low quality of this input
// IronTesseract can read it where conventional Tesseract might fail
var Result = Ocr.Read(input);
// Windows console may have problems printing Arabic characters.
// Saving the result to disk instead.
Result.SaveAsTextFile("arabic.txt");
}
' using IronOcr;' PM> Install IronOcr.Languages.ArabicDimOcr = New IronTesseract()' Set the OCR language to ArabicOcr.Language = OcrLanguage.ArabicUsing input = New OcrInput() ' Add Arabic image to input input.AddImage("img/arabic.gif") ' Optional: Add image filters if necessary ' Despite the low quality of this input ' IronTesseract can read it where conventional Tesseract might fail DimResult = Ocr.Read(input) ' Windows console may have problems printing Arabic characters. ' Saving the result to disk instead.Result.SaveAsTextFile("arabic.txt")EndUsing
' using IronOcr;
' PM> Install IronOcr.Languages.Arabic
Dim Ocr = New IronTesseract()
' Set the OCR language to Arabic
Ocr.Language = OcrLanguage.Arabic
Using input = New OcrInput()
' Add Arabic image to input
input.AddImage("img/arabic.gif")
' Optional: Add image filters if necessary
' Despite the low quality of this input
' IronTesseract can read it where conventional Tesseract might fail
Dim Result = Ocr.Read(input)
' Windows console may have problems printing Arabic characters.
' Saving the result to disk instead.
Result.SaveAsTextFile("arabic.txt")
End Using
Пример за многоезичен език
Възможно е също така OCR да се използва едновременно на няколко езика. Това наистина може да помогне за получаване
на метаданни и URL адреси на английски език в Unicode документи.
// using IronOcr;// PM> Install IronOcr.Languages.ChineseSimplifiedvarOcr = new IronTesseract();// Set primary OCR language to Chinese SimplifiedOcr.Language = OcrLanguage.ChineseSimplified;// Add Bulgarian as a secondary language for OCROcr.AddSecondaryLanguage(OcrLanguage.Bulgarian);// You can add any number of languagesusing (var input = new OcrInput()){ // Add multi-language PDF to input input.Add("multi-language.pdf"); varResult = Ocr.Read(input); // Save the OCR result to a text fileResult.SaveAsTextFile("results.txt");}
// using IronOcr;
// PM> Install IronOcr.Languages.ChineseSimplified
var Ocr = new IronTesseract();
// Set primary OCR language to Chinese Simplified
Ocr.Language = OcrLanguage.ChineseSimplified;
// Add Bulgarian as a secondary language for OCR
Ocr.AddSecondaryLanguage(OcrLanguage.Bulgarian);
// You can add any number of languages
using (var input = new OcrInput())
{
// Add multi-language PDF to input
input.Add("multi-language.pdf");
var Result = Ocr.Read(input);
// Save the OCR result to a text file
Result.SaveAsTextFile("results.txt");
}
' Imports IronOcr' PM> Install IronOcr.Languages.ChineseSimplifiedDimOcr = New IronTesseract()' Set primary OCR language to Chinese SimplifiedOcr.Language = OcrLanguage.ChineseSimplified' Add Bulgarian as a secondary language for OCROcr.AddSecondaryLanguage(OcrLanguage.Bulgarian)' You can add any number of languagesUsing input As New OcrInput() ' Add multi-language PDF to input input.Add("multi-language.pdf") DimResult = Ocr.Read(input) ' Save the OCR result to a text fileResult.SaveAsTextFile("results.txt")EndUsing
' Imports IronOcr
' PM> Install IronOcr.Languages.ChineseSimplified
Dim Ocr = New IronTesseract()
' Set primary OCR language to Chinese Simplified
Ocr.Language = OcrLanguage.ChineseSimplified
' Add Bulgarian as a secondary language for OCR
Ocr.AddSecondaryLanguage(OcrLanguage.Bulgarian)
' You can add any number of languages
Using input As New OcrInput()
' Add multi-language PDF to input
input.Add("multi-language.pdf")
Dim Result = Ocr.Read(input)
' Save the OCR result to a text file
Result.SaveAsTextFile("results.txt")
End Using
Подробни обекти с резултати от OCR
IronOCR връща обект с резултат на OCR за всяка операция на OCR. Като цяло разработчиците използват само свойството
text на този обект, за да получат сканирания текст от изображението. Въпреки това, резултатите от OCR DOM са много
по-напреднали от този.
using IronOcr;using System.Drawing; // Add reference for assemblyvarOcr = new IronTesseract();// Set the OCR language to BulgarianOcr.Language = OcrLanguage.Bulgarian;Ocr.Configuration.EngineMode = TesseractEngineMode.TesseractAndLstm;// Enable barcode readingOcr.Configuration.ReadBarCodes = true;using (varInput = new OcrInput(@"images\sample.tiff")){ // Perform OCR on input TIFF file OcrResultResult = Ocr.Read(Input); varPages = Result.Pages; varWords = Pages[0].Words; varBarcodes = Result.Barcodes; // Explore properties like: // - Pages, Blocks, Paragraphs, Lines, Words, Characters // - Export Images, Font Coordinates, Statistics}
using IronOcr;
using System.Drawing; // Add reference for assembly
var Ocr = new IronTesseract();
// Set the OCR language to Bulgarian
Ocr.Language = OcrLanguage.Bulgarian;
Ocr.Configuration.EngineMode = TesseractEngineMode.TesseractAndLstm;
// Enable barcode reading
Ocr.Configuration.ReadBarCodes = true;
using (var Input = new OcrInput(@"images\sample.tiff"))
{
// Perform OCR on input TIFF file
OcrResult Result = Ocr.Read(Input);
var Pages = Result.Pages;
var Words = Pages[0].Words;
var Barcodes = Result.Barcodes;
// Explore properties like:
// - Pages, Blocks, Paragraphs, Lines, Words, Characters
// - Export Images, Font Coordinates, Statistics
}
ImportsIronOcrImportsSystem.Drawing' Add reference for assemblyDimOcr = New IronTesseract()' Set the OCR language to BulgarianOcr.Language = OcrLanguage.BulgarianOcr.Configuration.EngineMode = TesseractEngineMode.TesseractAndLstm' Enable barcode readingOcr.Configuration.ReadBarCodes = TrueUsingInputAs New OcrInput("images\sample.tiff") ' Perform OCR on input TIFF file DimResultAsOcrResult = Ocr.Read(Input) DimPages = Result.Pages DimWords = Pages(0).Words DimBarcodes = Result.Barcodes ' Explore properties like: ' - Pages, Blocks, Paragraphs, Lines, Words, Characters ' - Export Images, Font Coordinates, StatisticsEndUsing
Imports IronOcr
Imports System.Drawing ' Add reference for assembly
Dim Ocr = New IronTesseract()
' Set the OCR language to Bulgarian
Ocr.Language = OcrLanguage.Bulgarian
Ocr.Configuration.EngineMode = TesseractEngineMode.TesseractAndLstm
' Enable barcode reading
Ocr.Configuration.ReadBarCodes = True
Using Input As New OcrInput("images\sample.tiff")
' Perform OCR on input TIFF file
Dim Result As OcrResult = Ocr.Read(Input)
Dim Pages = Result.Pages
Dim Words = Pages(0).Words
Dim Barcodes = Result.Barcodes
' Explore properties like:
' - Pages, Blocks, Paragraphs, Lines, Words, Characters
' - Export Images, Font Coordinates, Statistics
End Using
производителност
IronOCR работи извън кутията, без да е необходимо да настройвате производителността или да модифицирате силно
входните изображения.
Скоростта е бърза: IronOCR.2020+ е до 10 пъти по-бърз и прави над 250% по-малко грешки от предишните компилации.
Научете повече
За да научите повече за OCR на C#, VB, F# или който и да е друг .NET език, моля, прочетете нашите уроци в
общността, които дават реални примери за това как IronOCR може да се използва и могат да покажат нюансите
как да извлечете най-доброто от тази библиотека.
Curtis Chau détient un baccalauréat en informatique (Université de Carleton) et se spécialise dans le développement front-end avec expertise en Node.js, TypeScript, JavaScript et React. Passionné par la création d'interfaces utilisateur intuitives et esthétiquement plaisantes, Curtis aime travailler avec des frameworks modernes et créer des manuels bien structurés et visuellement attrayants.