<meta http-equiv="content-language" content="hy" />
<h1>Հայերեն OCR C# և .NET- ում</h1>
<h6>Այս փաստաթղթի այլ տարբերակներ.</h6>
<ul>
<li><a rel='alternate' hreflang='en' href="/csharp/ocr/languages/armenian/">Անգլերեն (This Page in English)</a></li>
<li><a href="/csharp/ocr/languages/">Ավելի շատ Languages</a></li>
</ul>
<p>IronOCR- ը C# ծրագրաշարի բաղադրիչ է, որը թույլ է տալիս .NET կոդավորողներին կարդալ տեքստեր պատկերներից և PDF փաստաթղթերից 126 լեզվով, ներառյալ հայերեն:</p>
<p>Այն Tesseract- ի առաջադեմ պատառաքաղ է, որը կառուցված է բացառապես .NET մշակողների համար և պարբերաբար գերազանցում է Tesseract- ի մյուս շարժիչներին `թե արագության, թե ճշգրտության համար:</p>
<h2>IronOCR- ի լեզուների պարունակությունը: հայերեն</h2>
<p>Այս փաթեթը պարունակում է 120 OCR լեզուներ .NET- ի համար.</p>
<ul>
<li>ArmenianAlphabet</li>
<li>ArmenianAlphabetBest</li>
<li>ArmenianAlphabetFast</li>
<li>հայերեն</li>
<li>ArmenianBest</li>
<li>ArmenianFast</li>
</ul>
<h2>Ներբեռնում</h2>
<p>Հայոց լեզվի փաթեթ <span style='white-space:default'>[Հայերեն]</span> <br/> * Download as <a class='languages-dll' href='/csharp/ocr/packages/language-packs/Armenian.ocrdata.zip'>Zip <i class='fas fa-download'></i><br/> * Install with as </a><a target='_blank' class='languages-nuget' href="https://www.nuget.org/packages/IronOcr.Languages.Armenian/">https://www.nuget.org/packages/IronOcr.Languages.Armenian/</a>'> NuGet- ը<i class='nuget-icon'></i></p>
<h2>Տեղադրում</h2>
<p>Առաջին բանը, որ մենք պետք է անենք, տեղադրել մեր <strong>հայերեն</strong> OCR փաթեթը ձեր .NET նախագծում:</p>
<p><code>PM> Install-Package IronOcr.Languages.Armenian</code></p>
<h2>Կոդի օրինակ</h2>
<p>C# կոդի այս օրինակը կարդում է հայերեն տեքստ Image կամ PDF փաստաթղթից:</p>
```csharp
// PM> Install-Package IronOcr.Languages.Armenian
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Armenian;
using (var Input = new OcrInput(@"images\Armenian.png"))
{
var Result = Ocr.Read(Input);
string AllText = Result.Text;
}
```
<h2>Ինչու ընտրել IronOCR- ը:</h2>
<p>IronOCR- ը տեղադրվող, ամբողջական և լավ փաստաթղթավորված .NET ծրագրաշարերի գրադարան է:</p>
<p>Ընտրեք IronOCR- ը <strong>99.8% + OCR ճշգրտության</strong> հասնելու <strong>համար`</strong> առանց որևէ արտաքին վեբ ծառայությունների, ընթացիկ վճարների կամ ինտերնետով գաղտնի փաստաթղթեր ուղարկելու:</p>
<h4>Ինչու C# մշակողների համար ընտրում են IronOCR- ը որպես Vanilla Tesseract- ի փոխարեն.</h4>
<ul>
<li>Տեղադրեք որպես մեկ DLL կամ NuGet</li>
<li>Ներառում է տուփից դուրս Tesseract 5, 4 և 3 շարժիչները:</li>
<li>Acc <strong>շգրտությունը 99.8% -ը</strong> զգալիորեն գերազանցում է սովորական Tesseract- ին:</li>
<li>Բոցավառվող արագություն և բազմալեզու թեմա</li>
<li>Համատեղելի MVC, WebApp, Desktop, Console & Server Application</li>
<li>Exes կամ C++ կոդ չկա, որի հետ աշխատելու համար</li>
<li>Ամբողջական PDF OCR աջակցություն</li>
<li>OCR կատարելու համար գրեթե ցանկացած Image ֆայլ կամ PDF</li>
<li>Լրիվ .NET Core, Standard և FrameWork աջակցություն</li>
<li>Տեղադրեք Windows, Mac, Linux, Azure, Docker, Lambda, AWS համակարգերում</li>
<li>Կարդացեք շտրիխ ծածկագրերը և QR կոդերը</li>
<li>Արտահանեք OCR- ը XHTML- ին</li>
<li>Արտահանեք OCR որոնվող PDF փաստաթղթեր</li>
<li>Բազմալեզու աջակցություն</li>
<li>126 միջազգային լեզուներ, որոնք բոլորը կառավարվում են NuGet կամ OcrData ֆայլերի միջոցով</li>
<li>Պատկերներ, կոորդինատներ, վիճակագրություն և տառատեսակներ հանեք. Ոչ միայն տեքստ:</li>
<li>Կարող է օգտագործվել Tesseract OCR- ի վերաբաշխման համար առևտրային և գույքային ծրագրերի ներսում:</li>
</ul>
<p><em>IronOCR- ը փայլում է, երբ աշխատում է իրական աշխարհի պատկերների և անկատար փաստաթղթերի հետ, ինչպիսիք են լուսանկարները կամ ցածր թույլատրելիության սկանները, որոնք կարող են ունենալ թվային աղմուկ կամ թերություններ:</em></p>
<p>Այլ <a href="/csharp/ocr/use-case/free-ocr-csharp/">NCR</a> գրադարաններ .NET պլատֆորմի համար, ինչպիսիք են .NET Tesseract API- ները և վեբ ծառայությունները, այնքան էլ լավ չեն գործում իրական օգտագործման դեպքերի համար:</p>
<h2>OCR- ը Tesseract 5-ով - սկսեք կոդավորումը C#- ով</h2>
<p>Ստորև բերված ծածկագրի նմուշը ցույց է տալիս, թե որքան հեշտ է կարդալ տեքստը պատկերից ՝ օգտագործելով C# կամ VB. NET:</p>
<h3>OneLiner- ը</h3>
```csharp
string Text = new IronTesseract().Read(@"img\Screenshot.png").Text;
```
<h3>Կարգավորելի Բարև աշխարհ</h3>
```csharp
// PM> Install-Package IronOcr.Languages.Armenian
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Armenian;
using (var Input = new OcrInput())
{
Input.AddImage("images/sample.jpeg");
//... Դուք կարող եք ավելացնել ցանկացած թվով պատկերներ
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
```
<h3>C# PDF OCR</h3>
<p>Նույն մոտեցումը նույն կերպ կարող է օգտագործվել ցանկացած PDF փաստաթղթից տեքստ քաղելու համար:</p>
```csharp
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Armenian;
using (var input = new OcrInput())
{
input.AddPdf("example.pdf", "password");
// Կարող ենք նաև ընտրել OCR- ի հատուկ PDF էջերի համարներ
var Result = Ocr.Read(input);
Console.WriteLine(Result.Text);
Console.WriteLine($"{Result.Pages.Count()} Pages");
// 1 էջ PDF- ի յուրաքանչյուր էջի համար
}
```
<h3>OCR MultiPage TIFF- ների համար</h3>
<p>OCR ընթերցող TIFF ֆայլի ձևաչափը, ներառյալ բազմաթիվ էջային փաստաթղթեր: TIFF- ը կարող է նաև ուղղակիորեն վերափոխվել PDF ֆայլի ՝ որոնելի տեքստով:</p>
```csharp
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Armenian;
using (var Input = new OcrInput())
{
Input.AddMultiFrameTiff("multi-frame.tiff");
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
```
<h3>Շտրիխ կոդեր և QR</h3>
<p>IronOCR- ի եզակի առանձնահատկությունն այն է, որ այն կարող է կարդալ շտրիխ ծածկագրեր և QR կոդեր փաստաթղթերից, երբ այն ստուգում է տեքստը: <code>OcrResult.OcrBarcode</code> դասի <code>OcrResult.OcrBarcode</code> տալիս են մանրամասն տեղեկություններ յուրաքանչյուր սկանավորված շտրիխ կոդի մասին:</p>
```csharp
// using IronOcr;
var Ocr = new IronTesseract();
Ocr.Configuration.ReadBarCodes = true;
using (var input = new OcrInput())
{
input.AddImage("img/Barcode.png");
var Result = Ocr.Read(input);
foreach (var Barcode in Result.Barcodes)
{
Console.WriteLine(Barcode.Value);
// տիպի և գտնվելու վայրի հատկությունները նույնպես ենթարկվում են ազդեցության
}
}
```
<h3>Պատկերների հատուկ տարածքների վերաբերյալ OCR</h3>
<p>IronOCR- ի սկանավորման և ընթերցման բոլոր եղանակները հնարավորություն են տալիս ճշգրտորեն հստակացնել, թե էջի կամ էջերի որ մասից ենք ցանկանում կարդալ տեքստ: Սա շատ օգտակար է, երբ մենք նայում ենք ստանդարտացված ձևերին և կարող է շատ ժամանակ խնայել և բարելավել արդյունավետությունը:</p>
<p>Բուսաբուծության շրջաններ օգտագործելու համար հարկավոր է համակարգի հղում ավելացնել <code>System.Drawing</code> որպեսզի կարողանանք օգտագործել <code>System.Drawing.Rectangle</code> օբյեկտը:</p>
```csharp
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Armenian;
using (var Input = new OcrInput())
{
var ContentArea = new System.Drawing.Rectangle() { X = 215, Y = 1250, Height = 280, Width = 1335 };
// Չափերը px- ով են
Input.Add("document.png", ContentArea);
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
```
<h3>OCR ցածր որակի սկանավորման համար</h3>
<p>IronOCR <code>OcrInput</code> դասը կարող է ամրագրել <code>OcrInput</code> որոնք նորմալ Tesseract- ը չի կարող կարդալ:</p>
```csharp
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Armenian;
using (var Input = new OcrInput(@"img\Potter.LowQuality.tiff"))
{
Input.DeNoise(); // ամրագրում է թվային աղմուկը և վատ սկանավորումը
Input.Deskew(); // ամրագրում է ռոտացիան և հեռանկարը
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
```
<h3>Արտահանեք OCR արդյունքները ՝ որպես որոնելի PDF</h3>
<p>Պատկեր PDF- ին ՝ պատճենվող տեքստային տողերով: Կարող է ինդեքսավորվել որոնիչների և տվյալների բազաների կողմից:</p>
```csharp
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Armenian;
using (var Input = new OcrInput())
{
Input.Title = "Quarterly Report";
Input.AddImage("image1.jpeg");
Input.AddImage("image2.png");
Input.AddImage("image3.gif");
var Result = Ocr.Read(Input);
Result.SaveAsSearchablePdf("searchable.pdf");
}
```
<h3>TIFF ՝ որոնելի PDF փոխարկում</h3>
<p>Փոխակերպեք TIFF փաստաթուղթը (կամ պատկերային ֆայլերի որևէ խումբ) ուղղակիորեն որոնվող PDF- ի, որը կարող է ինդեքսավորվել ներբանկային, կայքի և google որոնիչների կողմից:</p>
```csharp
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Armenian;
using (var Input = new OcrInput())
{
Input.AddMultiFrameTiff("example.tiff");
var Result = Ocr.Read(Input).SaveAsSearchablePdf("searchable.pdf");
}
```
<h3>Արտահանեք OCR արդյունքները որպես HTML</h3>
<p>OCR պատկեր XHTML փոխակերպում:</p>
```csharp
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Armenian;
using (var Input = new OcrInput())
{
Input.Title = "Html Title";
Input.AddImage("image1.jpeg");
var Result = Ocr.Read(Input);
Result.SaveAsHocrFile("results.html");
}
```
<h2>OCR պատկերի բարելավման ֆիլտրեր</h2>
<p>IronOCR- ն ապահովում է եզակի զտիչներ <code>OcrInput</code> օբյեկտների համար <code>OcrInput</code> աշխատանքը բարելավելու համար:</p>
<h3>Պատկերի բարելավման կոդի օրինակ</h3>
<p>OCR- ի մուտքային պատկերները դարձնում է ավելի բարձր որակ ՝ OCR- ի ավելի լավ և արագ արդյունքներ ստանալու համար:</p>
```csharp
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Armenian;
using (var Input = new OcrInput(@"LowQuality.jpeg"))
{
Input.DeNoise(); // ամրագրում է թվային աղմուկը և վատ սկանավորումը
Input.Deskew(); // ամրագրում է ռոտացիան և հեռանկարը
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
```
<h3>OCR պատկերի զտիչների ցուցակ</h3>
<p>IronCR- ի մեջ ներկառուցված OCR- ի արդյունավետությունը բարձրացնելու համար ներածման ֆիլտրերը ներառում են.</p>
<ul>
<li><strong>OcrInput.Rotate (կրկնակի աստիճան)</strong> - Պտտեցնում է պատկերները ժամացույցի սլաքի ուղղությամբ մի շարք աստիճաններով։ -Ամացույցի սլաքի հակառակ ուղղությամբ օգտագործեք բացասական թվեր:</li>
<li><strong>OcrInput.Binarize ()</strong> - Այս պատկերի ֆիլտրը յուրաքանչյուր պիքսելը դարձնում է սև կամ սպիտակ առանց միջին հիմքի։ Կարող է բարելավել OCR- ի կատարման դեպքերը, երբ տեքստի հետին պլանի շատ ցածր հակադրություն կա:</li>
<li><strong>OcrInput.ToGrayScale ()</strong> - Այս պատկերի ֆիլտրը յուրաքանչյուր պիքսելը վերածում է <strong>մոխրագույնի</strong> ստվերի։ Հազիվ թե բարելավվի OCR- ի ճշգրտությունը, բայց կարող է բարելավել արագությունը</li>
<li><strong>OcrInput.Contrast ()</strong> - ինքնաբերաբար մեծացնում է հակադրությունը։ Այս զտիչը հաճախ բարելավում է OCR- ի արագությունն ու ճշգրտությունը ցածր հակապատկերային զննումներում:</li>
<li><strong>OcrInput.DeNoise ()</strong> - Հեռացնում է թվային աղմուկը։ Այս զտիչը պետք է օգտագործվի միայն այնտեղ, որտեղ աղմուկ է սպասվում:</li>
<li><strong>OcrInput.Invert ()</strong> - շրջում է յուրաքանչյուր գույնը։ Օրինակ ՝ Սպիտակը դառնում է սև. Սևը դառնում է սպիտակ:</li>
<li><strong>OcrInput. Ընդարձակ ()</strong> - Ընդլայնված ձևաբանություն: <em>Ընդլայնումը</em> պատկերի օբյեկտների սահմաններին պիքսել է ավելացնում։ Էրոդի դիմաց</li>
<li><strong>OcrInput.Erode ()</strong> - Ընդլայնված ձևաբանություն. <em>Էրոզիան</em> հեռացնում է պիքսելները օբյեկտի սահմանների վրա Dilate- ի դիմաց</li>
<li><strong>OcrInput.Deskew ()</strong> - <strong>պտտեցնում</strong> է պատկերը, այնպես որ դա ճիշտ ուղին է և ուղղանկյուն: Սա շատ օգտակար է OCR- ի համար, քանի որ շեղված սկանավորման համար Tesseract- ի հանդուրժողականությունը կարող է լինել 5 աստիճանի ցածր:</li>
<li><strong>OcrInput.DeepCleanBackgroundNoise ()</strong> - background <strong>անր</strong> ֆոնային աղմուկի հեռացում։ Օգտագործեք այս զտիչը միայն այն դեպքում, երբ ծայրահեղ փաստաթղթի ֆոնային աղմուկը հայտնի է, քանի որ այս ֆիլտրը նաև ռիսկի կդարձնի մաքուր փաստաթղթերի OCR ճշգրտությունը նվազեցնելը և պրոցեսորը շատ թանկ է:</li>
<li><strong>OcrInput.EnhanceResolution</strong> - <strong>Բարձրացնում</strong> է ցածրորակ նկարների լուծաչափը։ Այս զտիչը հաճախ անհրաժեշտ չէ, քանի որ <em>OcrInput.MinimumDPI</em> և <em>OcrInput.TargetDPI</em> ավտոմատ կերպով կբռնեն և կլուծեն ցածր բանաձևի ներածումները:</li>
</ul>
<p><strong>CleanBackgroundNoise.</strong> Սա մի պարամետր է, որը որոշ չափով ժամանակատար է. Այնուամենայնիվ, այն թույլ է տալիս գրադարանին ավտոմատ կերպով մաքրել թվային աղմուկը, թղթի փշրանքները և այլ անկատարություններ թվային պատկերի ներսում, ինչը այլ կերպ կդարձնի այն այլևս անկարող կարդալու այլ OCR գրադարանների կողմից:</p>
<p><strong>EnhanceContrast-</strong> ը մի պարամետր է, որի արդյունքում IronOCR- ն ավտոմատ կերպով մեծացնում է տեքստի հակադրությունը պատկերի ֆոնի վրա `բարձրացնելով OCR- ի ճշգրտությունը և, ընդհանուր առմամբ, մեծացնելով OCR- ի կատարումը և արագությունը:</p>
<p><strong>EnhanceResolution-</strong> ը կարգավորում է, որն ավտոմատ կերպով կբացահայտի ցածր բանաձևի պատկերներ (որոնք կազմում են 275 dpi) և ավտոմատ կերպով կբարձրացնի պատկերը, այնուհետև սրում է ամբողջ տեքստը, որպեսզի այն հնարավոր լինի կատարելապես կարդալ OCR գրադարանի կողմից։ Չնայած այս գործողությունն ինքնին ժամանակատար է, այն, ընդհանուր առմամբ, նվազեցնում է պատկերի OCR գործողության ընդհանուր ժամանակը:</p>
<p><strong>Լեզուն</strong> IronOCR- ն աջակցում է 22 միջազգային լեզվական փաթեթների, և լեզվի կարգավորումը կարող է օգտագործվել մեկ կամ մի քանի լեզուներ ընտրելու համար, որոնք կիրառվելու են OCR գործողության համար:</p>
<p><strong>Ռազմավարություն</strong> IronOCR- ն աջակցում է երկու ռազմավարության: Մենք կարող ենք ընտրել կամ դիմել փաստաթղթի արագ և պակաս ճշգրիտ սկանավորմանը, կամ օգտագործել առաջադեմ ռազմավարություն, որն օգտագործում է արհեստական բանականության որոշ մոդելներ ՝ OCR տեքստի ճշգրտությունն ավտոմատ կերպով բարելավելու համար ՝ դիտելով բառերի միմյանց հետ վիճակագրական կապը նախադասության մեջ ,</p>
<p><strong>ColorSpace-</strong> ը այն պարամետրն է, որով մենք կարող ենք ընտրել OCR- ն `մոխրագույն կամ գունավոր: Ընդհանրապես, մոխրագույն սանդղակը լավագույն տարբերակն է: Այնուամենայնիվ, երբեմն, երբ կան նման երանգի կամ շատ տարբեր գույնի տեքստեր, գունավոր գունավոր տարածքը ավելի լավ արդյունքներ կտա:</p>
<p><strong>DetectWhiteTextOnDarkBackgrounds- ը:</strong> Ընդհանրապես, OCR- ի բոլոր գրադարանները ակնկալում են տեսնել սպիտակ ֆոնի վրա սև տեքստ: Այս պարամետրը IronOCR- ին թույլ է տալիս ավտոմատ կերպով հայտնաբերել բացասական կողմեր կամ սպիտակ տեքստով մութ էջեր և կարդալ դրանք:</p>
<p><strong>InputImageType:</strong> Այս պարամետրը մշակողին թույլ է տալիս ուղղորդել OCR գրադարանը `արդյոք այն նայում է ամբողջական փաստաթուղթ կամ հատված, օրինակ` սքրինշոթ:</p>
<p><strong>RotateAndStraighten-</strong> ը առաջադեմ պարամետր է, որը IronOCR- ին թույլ է տալիս կարդալու եզակի ունակություն ոչ միայն պտտվող, այլ գուցե հեռանկար պարունակող փաստաթղթեր կարդալու, օրինակ `տեքստային փաստաթղթերի լուսանկարներ:</p>
<p><strong>ReadBarcodes-</strong> ը օգտակար հատկություն է, որը IronOCR- ին թույլ է տալիս ավտոմատ կերպով կարդալ շտրիխ կոդերը և QR կոդերը էջերում, քանի որ այն նաև կարդում է տեքստ, առանց ավելացնելու մեծ լրացուցիչ ժամանակային բեռ:</p>
<p><strong>Գույնի խորությունը</strong> Այս պարամետրը որոշում է, թե քանի բիթ / պիքսել է օգտագործելու OCR գրադարանը գույնի խորությունը որոշելու համար: Գույնի ավելի բարձր խորությունը կարող է բարձրացնել OCR որակը, բայց նաև կբարձրացնի OCR գործողության ավարտման համար պահանջվող ժամանակը:</p>
<h2>126 լեզուների տուփ</h2>
<p>IronOCR- ն օժանդակում է <strong>126 միջազգային լեզուների</strong> ՝ լեզվական փաթեթների միջոցով, որոնք տարածվում են որպես DLL, որոնք կարող են <a href="/csharp/ocr/languages/">ներբեռնվել այս կայքից</a> , կամ նաև <a href="https://www.nuget.org/packages?q=IronOcr.Languages">NuGet փաթեթի մենեջերից</a>:</p>
<p>Լեզուները ներառում են գերմաներեն, ֆրանսերեն, անգլերեն, չինարեն, ճապոներեն և շատ ավելին: Մասնագիտական լեզվական փաթեթներ գոյություն ունեն անձնագրերի MRZ, MICR ստուգումների, ֆինանսական տվյալների, պետհամարանիշների և շատ այլնի համար: Կարող եք նաև օգտագործել ցանկացած Tesseract «.traineddata» ֆայլ ՝ ներառյալ այնպիսիք, որոնք ինքներդ եք ստեղծում:</p>
<h3>Լեզվի օրինակ</h3>
<p>Օգտագործելով այլ OCR լեզուներ:</p>
```csharp
// using IronOcr;
// PM> Install IronOcr.Languages.Arabic
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Arabic;
using (var input = new OcrInput())
{
input.AddImage("img/arabic.gif");
// Անհրաժեշտության դեպքում ավելացնել պատկերի ֆիլտրեր
// Այս դեպքում նույնիսկ մտքի ներդրումը շատ ցածր որակ է
// IronTesseract- ը կարող է կարդալ այն, ինչը չի կարող սովորական Tesseract- ը:
var Result = Ocr.Read(input);
// Վահանակը չի կարող արաբերեն տպել Windows- ի վրա հեշտությամբ:
// Փոխարենը եկեք պահենք սկավառակի վրա:
Result.SaveAsTextFile("arabic.txt");
}
```
<h3>Բազմակի լեզվի օրինակ</h3>
<p>Հնարավոր է նաև OCR- ի միաժամանակ մի քանի լեզուներ օգտագործելը: Սա իսկապես կարող է օգնել Unicode փաստաթղթերում գտնել անգլերենի մետատվյալներ և urls:</p>
```csharp
// using IronOcr;
// PM> Install IronOcr.Languages.ChineseSimplified
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.ChineseSimplified;
Ocr.AddSecondaryLanguage(OcrLanguage.Armenian);
// Մենք կարող ենք ավելացնել ցանկացած քանակի լեզուներ
using (var input = new OcrInput())
{
input.Add("multi-language.pdf");
var Result = Ocr.Read(input);
Result.SaveAsTextFile("results.txt");
}
```
<h2>Մանրամասն OCR արդյունքների օբյեկտներ</h2>
<p>IronOCR- ն վերադարձնում է OCR արդյունքի օբյեկտ OCR- ի յուրաքանչյուր գործողության համար: Ընդհանրապես, մշակողները օգտագործում են միայն այս օբյեկտի տեքստի հատկությունը ՝ նկարից սկանավորվող տեքստ ստանալու համար: Այնուամենայնիվ, OCR- ի արդյունքները DOM- ը շատ ավելի առաջադեմ են, քան սա:</p>
```csharp
using IronOcr;
using System.Drawing; // Ավելացնել ժողովի տեղեկանք
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Armenian;
Ocr.Configuration.EngineMode = TesseractEngineMode.TesseractAndLstm;
Ocr.Configuration.ReadBarCodes = true; // Կարևոր է
using (var Input = new OcrInput(@"images\sample.tiff"))
{
OcrResult Result = Ocr.Read(Input);
var Pages = Result.Pages;
var Words = Pages[0].Words;
var Barcodes = Result.Barcodes;
// Ուսումնասիրեք այստեղ ՝ գտնելու զանգվածային, մանրամասն API:
// - Էջեր, բլոկներ, պարաֆարներ, տողեր, բառեր, բնութագրեր
// - Պատկերի արտահանում, տառատեսակների կոորդինատներ, վիճակագրական տվյալներ
}
```
<h2>Ներկայացում</h2>
<p>IronOCR- ն աշխատում է տուփից դուրս ՝ առանց մուտքային պատկերների կատարելագործման կամ մեծապես փոփոխելու կարիք:</p>
<p>Արագությունը վառվում է. IronOCR.2020 + - ը մինչև 10 անգամ ավելի արագ է և ավելի քան 250% -ով պակաս սխալներ է թույլ տալիս, քան նախորդ կառուցվածքները:</p>
<h2>Իմացեք ավելին</h2>
<p>C#, VB, F# կամ որևէ այլ .NET լեզվով OCR- ի մասին ավելին իմանալու համար խնդրում ենք <a href="/csharp/ocr/tutorials/how-to-read-text-from-an-image-in-csharp-net/">կարդալ մեր համայնքի ձեռնարկները</a>, որոնք տալիս են իրական աշխարհի օրինակներ, թե ինչպես կարելի է օգտագործել IronOCR- ը և կարող են ցույց տալ նրբությունները, թե ինչպես կարելի է լավագույնը քաղել: այս գրադարանը:</p>
<p>Առկա է նաև <a href="/csharp/ocr/object-reference/api/">օբյեկտի ամբողջական </a><a href="/csharp/ocr/object-reference/api/">հղում .NET մշակողների</a> համար:</p>
IronOCR- ը C# ծրագրաշարի բաղադրիչ է, որը թույլ է տալիս .NET կոդավորողներին կարդալ տեքստեր պատկերներից և PDF փաստաթղթերից 126 լեզվով, ներառյալ հայերեն:
Այն Tesseract- ի առաջադեմ պատառաքաղ է, որը կառուցված է բացառապես .NET մշակողների համար և պարբերաբար գերազանցում է Tesseract- ի մյուս շարժիչներին `թե արագության, թե ճշգրտության համար:
IronOCR- ի լեզուների պարունակությունը: հայերեն
Այս փաթեթը պարունակում է 120 OCR լեզուներ .NET- ի համար.
Առաջին բանը, որ մենք պետք է անենք, տեղադրել մեր հայերեն OCR փաթեթը ձեր .NET նախագծում:
PM> Install-Package IronOcr.Languages.Armenian
Կոդի օրինակ
C# կոդի այս օրինակը կարդում է հայերեն տեքստ Image կամ PDF փաստաթղթից:
// PM> Install-Package IronOcr.Languages.Armenianusing IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Armenian;using (varInput = new OcrInput(@"images\Armenian.png")){ varResult = Ocr.Read(Input); stringAllText = Result.Text;}
// PM> Install-Package IronOcr.Languages.Armenian
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Armenian;
using (var Input = new OcrInput(@"images\Armenian.png"))
{
var Result = Ocr.Read(Input);
string AllText = Result.Text;
}
' PM> Install-Package IronOcr.Languages.ArmenianImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.ArmenianUsingInput = New OcrInput("images\Armenian.png") DimResult = Ocr.Read(Input) DimAllTextAsString = Result.TextEndUsing
' PM> Install-Package IronOcr.Languages.Armenian
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Armenian
Using Input = New OcrInput("images\Armenian.png")
Dim Result = Ocr.Read(Input)
Dim AllText As String = Result.Text
End Using
Ինչու ընտրել IronOCR- ը:
IronOCR- ը տեղադրվող, ամբողջական և լավ փաստաթղթավորված .NET ծրագրաշարերի գրադարան է:
Ընտրեք IronOCR- ը 99.8% + OCR ճշգրտության հասնելու համար` առանց որևէ արտաքին վեբ ծառայությունների, ընթացիկ վճարների կամ ինտերնետով գաղտնի փաստաթղթեր ուղարկելու:
Ինչու C# մշակողների համար ընտրում են IronOCR- ը որպես Vanilla Tesseract- ի փոխարեն.
Տեղադրեք որպես մեկ DLL կամ NuGet
Ներառում է տուփից դուրս Tesseract 5, 4 և 3 շարժիչները:
Acc շգրտությունը 99.8% -ը զգալիորեն գերազանցում է սովորական Tesseract- ին:
Բոցավառվող արագություն և բազմալեզու թեմա
Համատեղելի MVC, WebApp, Desktop, Console & Server Application
Exes կամ C++ կոդ չկա, որի հետ աշխատելու համար
Ամբողջական PDF OCR աջակցություն
OCR կատարելու համար գրեթե ցանկացած Image ֆայլ կամ PDF
126 միջազգային լեզուներ, որոնք բոլորը կառավարվում են NuGet կամ OcrData ֆայլերի միջոցով
Պատկերներ, կոորդինատներ, վիճակագրություն և տառատեսակներ հանեք. Ոչ միայն տեքստ:
Կարող է օգտագործվել Tesseract OCR- ի վերաբաշխման համար առևտրային և գույքային ծրագրերի ներսում:
IronOCR- ը փայլում է, երբ աշխատում է իրական աշխարհի պատկերների և անկատար փաստաթղթերի հետ, ինչպիսիք են լուսանկարները կամ ցածր թույլատրելիության սկանները, որոնք կարող են ունենալ թվային աղմուկ կամ թերություններ:
Այլ NCR գրադարաններ .NET պլատֆորմի համար, ինչպիսիք են .NET Tesseract API- ները և վեբ ծառայությունները, այնքան էլ լավ չեն գործում իրական օգտագործման դեպքերի համար:
OCR- ը Tesseract 5-ով - սկսեք կոդավորումը C#- ով
Ստորև բերված ծածկագրի նմուշը ցույց է տալիս, թե որքան հեշտ է կարդալ տեքստը պատկերից ՝ օգտագործելով C# կամ VB. NET:
OneLiner- ը
stringText = new IronTesseract().Read(@"img\Screenshot.png").Text;
string Text = new IronTesseract().Read(@"img\Screenshot.png").Text;
DimTextAsString = (New IronTesseract()).Read("img\Screenshot.png").Text
Dim Text As String = (New IronTesseract()).Read("img\Screenshot.png").Text
Կարգավորելի Բարև աշխարհ
// PM> Install-Package IronOcr.Languages.Armenianusing IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Armenian;using (varInput = new OcrInput()){Input.AddImage("images/sample.jpeg"); //... Դուք կարող եք ավելացնել ցանկացած թվով պատկերներ varResult = Ocr.Read(Input);Console.WriteLine(Result.Text);}
// PM> Install-Package IronOcr.Languages.Armenian
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Armenian;
using (var Input = new OcrInput())
{
Input.AddImage("images/sample.jpeg");
//... Դուք կարող եք ավելացնել ցանկացած թվով պատկերներ
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
ImportsIronOcrDimOcrAs New IronTesseract()Ocr.Language = OcrLanguage.ArmenianUsingInputAs New OcrInput()Input.AddImage("images/sample.jpeg") '... Դուք կարող եք ավելացնել ցանկացած թվով պատկերներ DimResult = Ocr.Read(Input)Console.WriteLine(Result.Text)EndUsing
Imports IronOcr
Dim Ocr As New IronTesseract()
Ocr.Language = OcrLanguage.Armenian
Using Input As New OcrInput()
Input.AddImage("images/sample.jpeg")
'... Դուք կարող եք ավելացնել ցանկացած թվով պատկերներ
Dim Result = Ocr.Read(Input)
Console.WriteLine(Result.Text)
End Using
C# PDF OCR
Նույն մոտեցումը նույն կերպ կարող է օգտագործվել ցանկացած PDF փաստաթղթից տեքստ քաղելու համար:
varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Armenian;using (var input = new OcrInput()){ input.AddPdf("example.pdf", "password"); // Կարող ենք նաև ընտրել OCR- ի հատուկ PDF էջերի համարներ varResult = Ocr.Read(input);Console.WriteLine(Result.Text);Console.WriteLine($"{Result.Pages.Count()} Pages"); // 1 էջ PDF- ի յուրաքանչյուր էջի համար}
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Armenian;
using (var input = new OcrInput())
{
input.AddPdf("example.pdf", "password");
// Կարող ենք նաև ընտրել OCR- ի հատուկ PDF էջերի համարներ
var Result = Ocr.Read(input);
Console.WriteLine(Result.Text);
Console.WriteLine($"{Result.Pages.Count()} Pages");
// 1 էջ PDF- ի յուրաքանչյուր էջի համար
}
DimOcr = New IronTesseract()Ocr.Language = OcrLanguage.ArmenianUsing input = New OcrInput() input.AddPdf("example.pdf", "password") ' Կարող ենք նաև ընտրել OCR- ի հատուկ PDF էջերի համարներ DimResult = Ocr.Read(input)Console.WriteLine(Result.Text)Console.WriteLine($"{Result.Pages.Count()} Pages") ' 1 էջ PDF- ի յուրաքանչյուր էջի համարEndUsing
Dim Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Armenian
Using input = New OcrInput()
input.AddPdf("example.pdf", "password")
' Կարող ենք նաև ընտրել OCR- ի հատուկ PDF էջերի համարներ
Dim Result = Ocr.Read(input)
Console.WriteLine(Result.Text)
Console.WriteLine($"{Result.Pages.Count()} Pages")
' 1 էջ PDF- ի յուրաքանչյուր էջի համար
End Using
OCR MultiPage TIFF- ների համար
OCR ընթերցող TIFF ֆայլի ձևաչափը, ներառյալ բազմաթիվ էջային փաստաթղթեր: TIFF- ը կարող է նաև ուղղակիորեն վերափոխվել PDF ֆայլի ՝ որոնելի տեքստով:
using IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Armenian;using (varInput = new OcrInput()){Input.AddMultiFrameTiff("multi-frame.tiff"); varResult = Ocr.Read(Input);Console.WriteLine(Result.Text);}
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Armenian;
using (var Input = new OcrInput())
{
Input.AddMultiFrameTiff("multi-frame.tiff");
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
ImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.ArmenianUsingInput = New OcrInput()Input.AddMultiFrameTiff("multi-frame.tiff") DimResult = Ocr.Read(Input)Console.WriteLine(Result.Text)EndUsing
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Armenian
Using Input = New OcrInput()
Input.AddMultiFrameTiff("multi-frame.tiff")
Dim Result = Ocr.Read(Input)
Console.WriteLine(Result.Text)
End Using
Շտրիխ կոդեր և QR
IronOCR- ի եզակի առանձնահատկությունն այն է, որ այն կարող է կարդալ շտրիխ ծածկագրեր և QR կոդեր փաստաթղթերից, երբ այն ստուգում է տեքստը: OcrResult.OcrBarcode դասի OcrResult.OcrBarcode տալիս են մանրամասն տեղեկություններ յուրաքանչյուր սկանավորված շտրիխ կոդի մասին:
// using IronOcr;varOcr = new IronTesseract();Ocr.Configuration.ReadBarCodes = true;using (var input = new OcrInput()){ input.AddImage("img/Barcode.png"); varResult = Ocr.Read(input); foreach (varBarcodeinResult.Barcodes) {Console.WriteLine(Barcode.Value); // տիպի և գտնվելու վայրի հատկությունները նույնպես ենթարկվում են ազդեցության }}
// using IronOcr;
var Ocr = new IronTesseract();
Ocr.Configuration.ReadBarCodes = true;
using (var input = new OcrInput())
{
input.AddImage("img/Barcode.png");
var Result = Ocr.Read(input);
foreach (var Barcode in Result.Barcodes)
{
Console.WriteLine(Barcode.Value);
// տիպի և գտնվելու վայրի հատկությունները նույնպես ենթարկվում են ազդեցության
}
}
' using IronOcr;DimOcr = New IronTesseract()Ocr.Configuration.ReadBarCodes = TrueUsing input = New OcrInput() input.AddImage("img/Barcode.png") DimResult = Ocr.Read(input) For EachBarcodeInResult.BarcodesConsole.WriteLine(Barcode.Value) ' տիպի և գտնվելու վայրի հատկությունները նույնպես ենթարկվում են ազդեցության NextBarcodeEndUsing
' using IronOcr;
Dim Ocr = New IronTesseract()
Ocr.Configuration.ReadBarCodes = True
Using input = New OcrInput()
input.AddImage("img/Barcode.png")
Dim Result = Ocr.Read(input)
For Each Barcode In Result.Barcodes
Console.WriteLine(Barcode.Value)
' տիպի և գտնվելու վայրի հատկությունները նույնպես ենթարկվում են ազդեցության
Next Barcode
End Using
Պատկերների հատուկ տարածքների վերաբերյալ OCR
IronOCR- ի սկանավորման և ընթերցման բոլոր եղանակները հնարավորություն են տալիս ճշգրտորեն հստակացնել, թե էջի կամ էջերի որ մասից ենք ցանկանում կարդալ տեքստ: Սա շատ օգտակար է, երբ մենք նայում ենք ստանդարտացված ձևերին և կարող է շատ ժամանակ խնայել և բարելավել արդյունավետությունը:
Բուսաբուծության շրջաններ օգտագործելու համար հարկավոր է համակարգի հղում ավելացնել System.Drawing որպեսզի կարողանանք օգտագործել System.Drawing.Rectangle օբյեկտը:
using IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Armenian;using (varInput = new OcrInput()){ varContentArea = new System.Drawing.Rectangle() { X = 215, Y = 1250, Height = 280, Width = 1335 }; // Չափերը px- ով ենInput.Add("document.png", ContentArea); varResult = Ocr.Read(Input);Console.WriteLine(Result.Text);}
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Armenian;
using (var Input = new OcrInput())
{
var ContentArea = new System.Drawing.Rectangle() { X = 215, Y = 1250, Height = 280, Width = 1335 };
// Չափերը px- ով են
Input.Add("document.png", ContentArea);
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
ImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.ArmenianUsingInput = New OcrInput() DimContentArea = New System.Drawing.Rectangle() With { .X = 215, .Y = 1250, .Height = 280, .Width = 1335 } ' Չափերը px- ով ենInput.Add("document.png", ContentArea) DimResult = Ocr.Read(Input)Console.WriteLine(Result.Text)EndUsing
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Armenian
Using Input = New OcrInput()
Dim ContentArea = New System.Drawing.Rectangle() With {
.X = 215,
.Y = 1250,
.Height = 280,
.Width = 1335
}
' Չափերը px- ով են
Input.Add("document.png", ContentArea)
Dim Result = Ocr.Read(Input)
Console.WriteLine(Result.Text)
End Using
OCR ցածր որակի սկանավորման համար
IronOCR OcrInput դասը կարող է ամրագրել OcrInput որոնք նորմալ Tesseract- ը չի կարող կարդալ:
using IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Armenian;using (varInput = new OcrInput(@"img\Potter.LowQuality.tiff")){Input.DeNoise(); // ամրագրում է թվային աղմուկը և վատ սկանավորումըInput.Deskew(); // ամրագրում է ռոտացիան և հեռանկարը varResult = Ocr.Read(Input);Console.WriteLine(Result.Text);}
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Armenian;
using (var Input = new OcrInput(@"img\Potter.LowQuality.tiff"))
{
Input.DeNoise(); // ամրագրում է թվային աղմուկը և վատ սկանավորումը
Input.Deskew(); // ամրագրում է ռոտացիան և հեռանկարը
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
ImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.ArmenianUsingInput = New OcrInput("img\Potter.LowQuality.tiff")Input.DeNoise() ' ամրագրում է թվային աղմուկը և վատ սկանավորումըInput.Deskew() ' ամրագրում է ռոտացիան և հեռանկարը DimResult = Ocr.Read(Input)Console.WriteLine(Result.Text)EndUsing
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Armenian
Using Input = New OcrInput("img\Potter.LowQuality.tiff")
Input.DeNoise() ' ամրագրում է թվային աղմուկը և վատ սկանավորումը
Input.Deskew() ' ամրագրում է ռոտացիան և հեռանկարը
Dim Result = Ocr.Read(Input)
Console.WriteLine(Result.Text)
End Using
Արտահանեք OCR արդյունքները ՝ որպես որոնելի PDF
Պատկեր PDF- ին ՝ պատճենվող տեքստային տողերով: Կարող է ինդեքսավորվել որոնիչների և տվյալների բազաների կողմից:
using IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Armenian;using (varInput = new OcrInput()){Input.Title = "Quarterly Report";Input.AddImage("image1.jpeg");Input.AddImage("image2.png");Input.AddImage("image3.gif"); varResult = Ocr.Read(Input);Result.SaveAsSearchablePdf("searchable.pdf");}
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Armenian;
using (var Input = new OcrInput())
{
Input.Title = "Quarterly Report";
Input.AddImage("image1.jpeg");
Input.AddImage("image2.png");
Input.AddImage("image3.gif");
var Result = Ocr.Read(Input);
Result.SaveAsSearchablePdf("searchable.pdf");
}
ImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.ArmenianUsingInput = New OcrInput()Input.Title = "Quarterly Report"Input.AddImage("image1.jpeg")Input.AddImage("image2.png")Input.AddImage("image3.gif") DimResult = Ocr.Read(Input)Result.SaveAsSearchablePdf("searchable.pdf")EndUsing
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Armenian
Using Input = New OcrInput()
Input.Title = "Quarterly Report"
Input.AddImage("image1.jpeg")
Input.AddImage("image2.png")
Input.AddImage("image3.gif")
Dim Result = Ocr.Read(Input)
Result.SaveAsSearchablePdf("searchable.pdf")
End Using
TIFF ՝ որոնելի PDF փոխարկում
Փոխակերպեք TIFF փաստաթուղթը (կամ պատկերային ֆայլերի որևէ խումբ) ուղղակիորեն որոնվող PDF- ի, որը կարող է ինդեքսավորվել ներբանկային, կայքի և google որոնիչների կողմից:
using IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Armenian;using (varInput = new OcrInput()){Input.AddMultiFrameTiff("example.tiff"); varResult = Ocr.Read(Input).SaveAsSearchablePdf("searchable.pdf");}
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Armenian;
using (var Input = new OcrInput())
{
Input.AddMultiFrameTiff("example.tiff");
var Result = Ocr.Read(Input).SaveAsSearchablePdf("searchable.pdf");
}
ImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.ArmenianUsingInput = New OcrInput()Input.AddMultiFrameTiff("example.tiff") DimResult = Ocr.Read(Input).SaveAsSearchablePdf("searchable.pdf")EndUsing
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Armenian
Using Input = New OcrInput()
Input.AddMultiFrameTiff("example.tiff")
Dim Result = Ocr.Read(Input).SaveAsSearchablePdf("searchable.pdf")
End Using
Արտահանեք OCR արդյունքները որպես HTML
OCR պատկեր XHTML փոխակերպում:
using IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Armenian;using (varInput = new OcrInput()){Input.Title = "Html Title";Input.AddImage("image1.jpeg"); varResult = Ocr.Read(Input);Result.SaveAsHocrFile("results.html");}
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Armenian;
using (var Input = new OcrInput())
{
Input.Title = "Html Title";
Input.AddImage("image1.jpeg");
var Result = Ocr.Read(Input);
Result.SaveAsHocrFile("results.html");
}
ImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.ArmenianUsingInput = New OcrInput()Input.Title = "Html Title"Input.AddImage("image1.jpeg") DimResult = Ocr.Read(Input)Result.SaveAsHocrFile("results.html")EndUsing
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Armenian
Using Input = New OcrInput()
Input.Title = "Html Title"
Input.AddImage("image1.jpeg")
Dim Result = Ocr.Read(Input)
Result.SaveAsHocrFile("results.html")
End Using
OCR պատկերի բարելավման ֆիլտրեր
IronOCR- ն ապահովում է եզակի զտիչներ OcrInput օբյեկտների համար OcrInput աշխատանքը բարելավելու համար:
Պատկերի բարելավման կոդի օրինակ
OCR- ի մուտքային պատկերները դարձնում է ավելի բարձր որակ ՝ OCR- ի ավելի լավ և արագ արդյունքներ ստանալու համար:
using IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Armenian;using (varInput = new OcrInput(@"LowQuality.jpeg")){Input.DeNoise(); // ամրագրում է թվային աղմուկը և վատ սկանավորումըInput.Deskew(); // ամրագրում է ռոտացիան և հեռանկարը varResult = Ocr.Read(Input);Console.WriteLine(Result.Text);}
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Armenian;
using (var Input = new OcrInput(@"LowQuality.jpeg"))
{
Input.DeNoise(); // ամրագրում է թվային աղմուկը և վատ սկանավորումը
Input.Deskew(); // ամրագրում է ռոտացիան և հեռանկարը
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
ImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.ArmenianUsingInput = New OcrInput("LowQuality.jpeg")Input.DeNoise() ' ամրագրում է թվային աղմուկը և վատ սկանավորումըInput.Deskew() ' ամրագրում է ռոտացիան և հեռանկարը DimResult = Ocr.Read(Input)Console.WriteLine(Result.Text)EndUsing
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Armenian
Using Input = New OcrInput("LowQuality.jpeg")
Input.DeNoise() ' ամրագրում է թվային աղմուկը և վատ սկանավորումը
Input.Deskew() ' ամրագրում է ռոտացիան և հեռանկարը
Dim Result = Ocr.Read(Input)
Console.WriteLine(Result.Text)
End Using
OCR պատկերի զտիչների ցուցակ
IronCR- ի մեջ ներկառուցված OCR- ի արդյունավետությունը բարձրացնելու համար ներածման ֆիլտրերը ներառում են.
OcrInput.Rotate (կրկնակի աստիճան) - Պտտեցնում է պատկերները ժամացույցի սլաքի ուղղությամբ մի շարք աստիճաններով։ -Ամացույցի սլաքի հակառակ ուղղությամբ օգտագործեք բացասական թվեր:
OcrInput.Binarize () - Այս պատկերի ֆիլտրը յուրաքանչյուր պիքսելը դարձնում է սև կամ սպիտակ առանց միջին հիմքի։ Կարող է բարելավել OCR- ի կատարման դեպքերը, երբ տեքստի հետին պլանի շատ ցածր հակադրություն կա:
OcrInput.ToGrayScale () - Այս պատկերի ֆիլտրը յուրաքանչյուր պիքսելը վերածում է մոխրագույնի ստվերի։ Հազիվ թե բարելավվի OCR- ի ճշգրտությունը, բայց կարող է բարելավել արագությունը
OcrInput.Contrast () - ինքնաբերաբար մեծացնում է հակադրությունը։ Այս զտիչը հաճախ բարելավում է OCR- ի արագությունն ու ճշգրտությունը ցածր հակապատկերային զննումներում:
OcrInput.DeNoise () - Հեռացնում է թվային աղմուկը։ Այս զտիչը պետք է օգտագործվի միայն այնտեղ, որտեղ աղմուկ է սպասվում:
OcrInput.Invert () - շրջում է յուրաքանչյուր գույնը։ Օրինակ ՝ Սպիտակը դառնում է սև. Սևը դառնում է սպիտակ:
OcrInput. Ընդարձակ () - Ընդլայնված ձևաբանություն: Ընդլայնումը պատկերի օբյեկտների սահմաններին պիքսել է ավելացնում։ Էրոդի դիմաց
OcrInput.Erode () - Ընդլայնված ձևաբանություն. Էրոզիան հեռացնում է պիքսելները օբյեկտի սահմանների վրա Dilate- ի դիմաց
OcrInput.Deskew () - պտտեցնում է պատկերը, այնպես որ դա ճիշտ ուղին է և ուղղանկյուն: Սա շատ օգտակար է OCR- ի համար, քանի որ շեղված սկանավորման համար Tesseract- ի հանդուրժողականությունը կարող է լինել 5 աստիճանի ցածր:
OcrInput.DeepCleanBackgroundNoise () - background անր ֆոնային աղմուկի հեռացում։ Օգտագործեք այս զտիչը միայն այն դեպքում, երբ ծայրահեղ փաստաթղթի ֆոնային աղմուկը հայտնի է, քանի որ այս ֆիլտրը նաև ռիսկի կդարձնի մաքուր փաստաթղթերի OCR ճշգրտությունը նվազեցնելը և պրոցեսորը շատ թանկ է:
OcrInput.EnhanceResolution - Բարձրացնում է ցածրորակ նկարների լուծաչափը։ Այս զտիչը հաճախ անհրաժեշտ չէ, քանի որ OcrInput.MinimumDPI և OcrInput.TargetDPI ավտոմատ կերպով կբռնեն և կլուծեն ցածր բանաձևի ներածումները:
CleanBackgroundNoise. Սա մի պարամետր է, որը որոշ չափով ժամանակատար է. Այնուամենայնիվ, այն թույլ է տալիս գրադարանին ավտոմատ կերպով մաքրել թվային աղմուկը, թղթի փշրանքները և այլ անկատարություններ թվային պատկերի ներսում, ինչը այլ կերպ կդարձնի այն այլևս անկարող կարդալու այլ OCR գրադարանների կողմից:
EnhanceContrast- ը մի պարամետր է, որի արդյունքում IronOCR- ն ավտոմատ կերպով մեծացնում է տեքստի հակադրությունը պատկերի ֆոնի վրա բարձրացնելով OCR- ի ճշգրտությունը և, ընդհանուր առմամբ, մեծացնելով OCR- ի կատարումը և արագությունը:</p> <p><strong>EnhanceResolution-</strong> ը կարգավորում է, որն ավտոմատ կերպով կբացահայտի ցածր բանաձևի պատկերներ (որոնք կազմում են 275 dpi) և ավտոմատ կերպով կբարձրացնի պատկերը, այնուհետև սրում է ամբողջ տեքստը, որպեսզի այն հնարավոր լինի կատարելապես կարդալ OCR գրադարանի կողմից։ Չնայած այս գործողությունն ինքնին ժամանակատար է, այն, ընդհանուր առմամբ, նվազեցնում է պատկերի OCR գործողության ընդհանուր ժամանակը:</p> <p><strong>Լեզուն</strong> IronOCR- ն աջակցում է 22 միջազգային լեզվական փաթեթների, և լեզվի կարգավորումը կարող է օգտագործվել մեկ կամ մի քանի լեզուներ ընտրելու համար, որոնք կիրառվելու են OCR գործողության համար:</p> <p><strong>Ռազմավարություն</strong> IronOCR- ն աջակցում է երկու ռազմավարության: Մենք կարող ենք ընտրել կամ դիմել փաստաթղթի արագ և պակաս ճշգրիտ սկանավորմանը, կամ օգտագործել առաջադեմ ռազմավարություն, որն օգտագործում է արհեստական բանականության որոշ մոդելներ ՝ OCR տեքստի ճշգրտությունն ավտոմատ կերպով բարելավելու համար ՝ դիտելով բառերի միմյանց հետ վիճակագրական կապը նախադասության մեջ ,</p> <p><strong>ColorSpace-</strong> ը այն պարամետրն է, որով մենք կարող ենք ընտրել OCR- ն մոխրագույն կամ գունավոր: Ընդհանրապես, մոխրագույն սանդղակը լավագույն տարբերակն է: Այնուամենայնիվ, երբեմն, երբ կան նման երանգի կամ շատ տարբեր գույնի տեքստեր, գունավոր գունավոր տարածքը ավելի լավ արդյունքներ կտա:
DetectWhiteTextOnDarkBackgrounds- ը: Ընդհանրապես, OCR- ի բոլոր գրադարանները ակնկալում են տեսնել սպիտակ ֆոնի վրա սև տեքստ: Այս պարամետրը IronOCR- ին թույլ է տալիս ավտոմատ կերպով հայտնաբերել բացասական կողմեր կամ սպիտակ տեքստով մութ էջեր և կարդալ դրանք:
InputImageType: Այս պարամետրը մշակողին թույլ է տալիս ուղղորդել OCR գրադարանը արդյոք այն նայում է ամբողջական փաստաթուղթ կամ հատված, օրինակ սքրինշոթ:
RotateAndStraighten- ը առաջադեմ պարամետր է, որը IronOCR- ին թույլ է տալիս կարդալու եզակի ունակություն ոչ միայն պտտվող, այլ գուցե հեռանկար պարունակող փաստաթղթեր կարդալու, օրինակ `տեքստային փաստաթղթերի լուսանկարներ:
ReadBarcodes- ը օգտակար հատկություն է, որը IronOCR- ին թույլ է տալիս ավտոմատ կերպով կարդալ շտրիխ կոդերը և QR կոդերը էջերում, քանի որ այն նաև կարդում է տեքստ, առանց ավելացնելու մեծ լրացուցիչ ժամանակային բեռ:
Գույնի խորությունը Այս պարամետրը որոշում է, թե քանի բիթ / պիքսել է օգտագործելու OCR գրադարանը գույնի խորությունը որոշելու համար: Գույնի ավելի բարձր խորությունը կարող է բարձրացնել OCR որակը, բայց նաև կբարձրացնի OCR գործողության ավարտման համար պահանջվող ժամանակը:
126 լեզուների տուփ
IronOCR- ն օժանդակում է 126 միջազգային լեզուների ՝ լեզվական փաթեթների միջոցով, որոնք տարածվում են որպես DLL, որոնք կարող են ներբեռնվել այս կայքից , կամ նաև NuGet փաթեթի մենեջերից:
Լեզուները ներառում են գերմաներեն, ֆրանսերեն, անգլերեն, չինարեն, ճապոներեն և շատ ավելին: Մասնագիտական լեզվական փաթեթներ գոյություն ունեն անձնագրերի MRZ, MICR ստուգումների, ֆինանսական տվյալների, պետհամարանիշների և շատ այլնի համար: Կարող եք նաև օգտագործել ցանկացած Tesseract «.traineddata» ֆայլ ՝ ներառյալ այնպիսիք, որոնք ինքներդ եք ստեղծում:
Լեզվի օրինակ
Օգտագործելով այլ OCR լեզուներ:
// using IronOcr;// PM> Install IronOcr.Languages.ArabicvarOcr = new IronTesseract();Ocr.Language = OcrLanguage.Arabic;using (var input = new OcrInput()){ input.AddImage("img/arabic.gif"); // Անհրաժեշտության դեպքում ավելացնել պատկերի ֆիլտրեր // Այս դեպքում նույնիսկ մտքի ներդրումը շատ ցածր որակ է // IronTesseract- ը կարող է կարդալ այն, ինչը չի կարող սովորական Tesseract- ը: varResult = Ocr.Read(input); // Վահանակը չի կարող արաբերեն տպել Windows- ի վրա հեշտությամբ: // Փոխարենը եկեք պահենք սկավառակի վրա:Result.SaveAsTextFile("arabic.txt");}
// using IronOcr;
// PM> Install IronOcr.Languages.Arabic
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Arabic;
using (var input = new OcrInput())
{
input.AddImage("img/arabic.gif");
// Անհրաժեշտության դեպքում ավելացնել պատկերի ֆիլտրեր
// Այս դեպքում նույնիսկ մտքի ներդրումը շատ ցածր որակ է
// IronTesseract- ը կարող է կարդալ այն, ինչը չի կարող սովորական Tesseract- ը:
var Result = Ocr.Read(input);
// Վահանակը չի կարող արաբերեն տպել Windows- ի վրա հեշտությամբ:
// Փոխարենը եկեք պահենք սկավառակի վրա:
Result.SaveAsTextFile("arabic.txt");
}
' using IronOcr;' PM> Install IronOcr.Languages.ArabicDimOcr = New IronTesseract()Ocr.Language = OcrLanguage.ArabicUsing input = New OcrInput() input.AddImage("img/arabic.gif") ' Անհրաժեշտության դեպքում ավելացնել պատկերի ֆիլտրեր ' Այս դեպքում նույնիսկ մտքի ներդրումը շատ ցածր որակ է ' IronTesseract- ը կարող է կարդալ այն, ինչը չի կարող սովորական Tesseract- ը: DimResult = Ocr.Read(input) ' Վահանակը չի կարող արաբերեն տպել Windows- ի վրա հեշտությամբ: ' Փոխարենը եկեք պահենք սկավառակի վրա:Result.SaveAsTextFile("arabic.txt")EndUsing
' using IronOcr;
' PM> Install IronOcr.Languages.Arabic
Dim Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Arabic
Using input = New OcrInput()
input.AddImage("img/arabic.gif")
' Անհրաժեշտության դեպքում ավելացնել պատկերի ֆիլտրեր
' Այս դեպքում նույնիսկ մտքի ներդրումը շատ ցածր որակ է
' IronTesseract- ը կարող է կարդալ այն, ինչը չի կարող սովորական Tesseract- ը:
Dim Result = Ocr.Read(input)
' Վահանակը չի կարող արաբերեն տպել Windows- ի վրա հեշտությամբ:
' Փոխարենը եկեք պահենք սկավառակի վրա:
Result.SaveAsTextFile("arabic.txt")
End Using
Բազմակի լեզվի օրինակ
Հնարավոր է նաև OCR- ի միաժամանակ մի քանի լեզուներ օգտագործելը: Սա իսկապես կարող է օգնել Unicode փաստաթղթերում գտնել անգլերենի մետատվյալներ և urls:
// using IronOcr;// PM> Install IronOcr.Languages.ChineseSimplifiedvarOcr = new IronTesseract();Ocr.Language = OcrLanguage.ChineseSimplified;Ocr.AddSecondaryLanguage(OcrLanguage.Armenian);// Մենք կարող ենք ավելացնել ցանկացած քանակի լեզուներusing (var input = new OcrInput()){ input.Add("multi-language.pdf"); varResult = Ocr.Read(input);Result.SaveAsTextFile("results.txt");}
// using IronOcr;
// PM> Install IronOcr.Languages.ChineseSimplified
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.ChineseSimplified;
Ocr.AddSecondaryLanguage(OcrLanguage.Armenian);
// Մենք կարող ենք ավելացնել ցանկացած քանակի լեզուներ
using (var input = new OcrInput())
{
input.Add("multi-language.pdf");
var Result = Ocr.Read(input);
Result.SaveAsTextFile("results.txt");
}
' using IronOcr;' PM> Install IronOcr.Languages.ChineseSimplifiedDimOcr = New IronTesseract()Ocr.Language = OcrLanguage.ChineseSimplifiedOcr.AddSecondaryLanguage(OcrLanguage.Armenian)' Մենք կարող ենք ավելացնել ցանկացած քանակի լեզուներUsing input = New OcrInput() input.Add("multi-language.pdf") DimResult = Ocr.Read(input)Result.SaveAsTextFile("results.txt")EndUsing
' using IronOcr;
' PM> Install IronOcr.Languages.ChineseSimplified
Dim Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.ChineseSimplified
Ocr.AddSecondaryLanguage(OcrLanguage.Armenian)
' Մենք կարող ենք ավելացնել ցանկացած քանակի լեզուներ
Using input = New OcrInput()
input.Add("multi-language.pdf")
Dim Result = Ocr.Read(input)
Result.SaveAsTextFile("results.txt")
End Using
Մանրամասն OCR արդյունքների օբյեկտներ
IronOCR- ն վերադարձնում է OCR արդյունքի օբյեկտ OCR- ի յուրաքանչյուր գործողության համար: Ընդհանրապես, մշակողները օգտագործում են միայն այս օբյեկտի տեքստի հատկությունը ՝ նկարից սկանավորվող տեքստ ստանալու համար: Այնուամենայնիվ, OCR- ի արդյունքները DOM- ը շատ ավելի առաջադեմ են, քան սա:
using IronOcr;using System.Drawing; // Ավելացնել ժողովի տեղեկանքvarOcr = new IronTesseract();Ocr.Language = OcrLanguage.Armenian;Ocr.Configuration.EngineMode = TesseractEngineMode.TesseractAndLstm;Ocr.Configuration.ReadBarCodes = true; // Կարևոր էusing (varInput = new OcrInput(@"images\sample.tiff")){ OcrResultResult = Ocr.Read(Input); varPages = Result.Pages; varWords = Pages[0].Words; varBarcodes = Result.Barcodes; // Ուսումնասիրեք այստեղ ՝ գտնելու զանգվածային, մանրամասն API: // - Էջեր, բլոկներ, պարաֆարներ, տողեր, բառեր, բնութագրեր // - Պատկերի արտահանում, տառատեսակների կոորդինատներ, վիճակագրական տվյալներ}
using IronOcr;
using System.Drawing; // Ավելացնել ժողովի տեղեկանք
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Armenian;
Ocr.Configuration.EngineMode = TesseractEngineMode.TesseractAndLstm;
Ocr.Configuration.ReadBarCodes = true; // Կարևոր է
using (var Input = new OcrInput(@"images\sample.tiff"))
{
OcrResult Result = Ocr.Read(Input);
var Pages = Result.Pages;
var Words = Pages[0].Words;
var Barcodes = Result.Barcodes;
// Ուսումնասիրեք այստեղ ՝ գտնելու զանգվածային, մանրամասն API:
// - Էջեր, բլոկներ, պարաֆարներ, տողեր, բառեր, բնութագրեր
// - Պատկերի արտահանում, տառատեսակների կոորդինատներ, վիճակագրական տվյալներ
}
ImportsIronOcrImportsSystem.Drawing' Ավելացնել ժողովի տեղեկանքPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.ArmenianOcr.Configuration.EngineMode = TesseractEngineMode.TesseractAndLstmOcr.Configuration.ReadBarCodes = True ' Կարևոր էUsingInput = New OcrInput("images\sample.tiff") DimResultAsOcrResult = Ocr.Read(Input) DimPages = Result.Pages DimWords = Pages(0).Words DimBarcodes = Result.Barcodes ' Ուսումնասիրեք այստեղ ՝ գտնելու զանգվածային, մանրամասն API: ' - Էջեր, բլոկներ, պարաֆարներ, տողեր, բառեր, բնութագրեր ' - Պատկերի արտահանում, տառատեսակների կոորդինատներ, վիճակագրական տվյալներEndUsing
Imports IronOcr
Imports System.Drawing ' Ավելացնել ժողովի տեղեկանք
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Armenian
Ocr.Configuration.EngineMode = TesseractEngineMode.TesseractAndLstm
Ocr.Configuration.ReadBarCodes = True ' Կարևոր է
Using Input = New OcrInput("images\sample.tiff")
Dim Result As OcrResult = Ocr.Read(Input)
Dim Pages = Result.Pages
Dim Words = Pages(0).Words
Dim Barcodes = Result.Barcodes
' Ուսումնասիրեք այստեղ ՝ գտնելու զանգվածային, մանրամասն API:
' - Էջեր, բլոկներ, պարաֆարներ, տողեր, բառեր, բնութագրեր
' - Պատկերի արտահանում, տառատեսակների կոորդինատներ, վիճակագրական տվյալներ
End Using
Ներկայացում
IronOCR- ն աշխատում է տուփից դուրս ՝ առանց մուտքային պատկերների կատարելագործման կամ մեծապես փոփոխելու կարիք:
Արագությունը վառվում է. IronOCR.2020 + - ը մինչև 10 անգամ ավելի արագ է և ավելի քան 250% -ով պակաս սխալներ է թույլ տալիս, քան նախորդ կառուցվածքները:
Իմացեք ավելին
C#, VB, F# կամ որևէ այլ .NET լեզվով OCR- ի մասին ավելին իմանալու համար խնդրում ենք կարդալ մեր համայնքի ձեռնարկները, որոնք տալիս են իրական աշխարհի օրինակներ, թե ինչպես կարելի է օգտագործել IronOCR- ը և կարող են ցույց տալ նրբությունները, թե ինչպես կարելի է լավագույնը քաղել: այս գրադարանը:
Curtis Chau, Bilgisayar Bilimleri alanında Lisans Derecesine (Carleton Üniversitesi) sahip ve Node.js, TypeScript, JavaScript ve React konularında uzmanlaşmış ön uç geliştirmeyle ilgileniyor. Sezgisel ve estetik açıdan hoş kullanıcı arayüzleri oluşturma tutkunu, Curtis modern çerçevelerle çalışmayı ve iyi yapılandırılmış, görsel olarak çekici kılavuzlar oluşturmayı seviyor.