<meta http-equiv="content-language" content="is" />
<h1>Íslenskur OCR í C# og .NET</h1>
<h6> Aðrar útgáfur af þessu skjali:</h6>
<ul>
<li> <a rel='alternate' hreflang='en' href="/csharp/ocr/languages/icelandic/">Enska (This Page in English)</a></li>
<li> <a href="/csharp/ocr/languages/">Fleiri Languages</a></li>
</ul>
<p> IronOCR er C# hugbúnaðarþáttur sem gerir .NET kóðara kleift að lesa texta úr myndum og PDF skjölum á 126 tungumálum, þar á meðal íslensku.</p>
<p> Það er háþróaður gaffall af Tesseract, smíðaður eingöngu fyrir .NET forritara og stendur sig betur en aðrar Tesseract vélar bæði hvað varðar hraða og nákvæmni.</p>
<h2> Innihald IronOcr.Languages.Icelandic</h2>
<p> Þessi pakki inniheldur 52 OCR tungumál fyrir .NET:</p>
<ul>
<li> Íslenska</li>
<li> IcelandicBest</li>
<li> IcelandicFast</li>
</ul>
<h2> Niðurhal</h2>
<p> Íslenskur málpakki <span style='white-space:default'>[Íslenska]</span> <br/> * Download as <a class='languages-dll' href='/csharp/ocr/packages/language-packs/Icelandic.ocrdata.zip'>Rennilás <i class='fas fa-download'></i><br/> * Install with </a><a target='_blank' class='languages-nuget' href="https://www.nuget.org/packages/IronOcr.Languages.Icelandic/">https://www.nuget.org/packages/IronOcr.Languages.Icelandic/</a>'> NuGet<i class='nuget-icon'></i></p>
<h2> Uppsetning</h2>
<p> Fyrsti viðfangsliðurinn er að setja upp <strong>Icelandic</strong> OCR pakka í .NET verkefni.</p>
<p> <code>PM> Install-Package IronOcr.Languages.Icelandic</code></p>
<h2> Kóðadæmi</h2>
<p> Þetta C# kóðadæmi les íslenskan texta úr mynd eða PDF skjali.</p>
```csharp
// Þú þarft að setja IronOcr.Languages.Icelandic upp í verkefnið með NuGet
using IronOcr;
var Ocr = new IronTesseract();
// Setur tungumálið sem á að nota til að vera Íslenska
Ocr.Language = OcrLanguage.Icelandic;
using (var Input = new OcrInput(@"images\Icelandic.png"))
{
// Les myndina og skilar niðurstöðu.
var Result = Ocr.Read(Input);
// Prentar allann textann sem fannst í PDF eða mynd
var AllText = Result.Text;
Console.WriteLine(AllText);
}
```
<h2>Af hverju að velja IronOCR?</h2>
<p> IronOCR er auðvelt í uppsetningu, heill og vel skjalfestur .NET hugbúnaðarsafn.</p>
<p> Veldu IronOCR til að ná <strong>99,8% + OCR nákvæmni</strong> án þess að nota utanaðkomandi vefþjónustu, áframhaldandi gjöld eða senda trúnaðargögn um internetið.</p>
<h4> Af hverju velja C# verktakar IronOCR fram yfir hefðbundinn Tesseract:</h4>
<ul>
<li> Settu upp sem eina DLL eða NuGet</li>
<li> Innifalið fyrir Tesseract 5, 4 og 3 vélar úr kassanum.</li>
<li> Nákvæmni <strong>99,8% er</strong> verulega betri en venjulegur Tesseract.</li>
<li> Logandi hraði og fjölþráður</li>
<li> MVC, WebApp, Desktop, Console & Server Application samhæft</li>
<li> Engir Exes eða C++ kóði til að vinna með</li>
<li> Fullur PDF OCR stuðningur</li>
<li> Til að framkvæma OCR næstum hvaða myndskrá eða PDF</li>
<li> Fullur .NET Core, Standard og FrameWork stuðningur</li>
<li> Dreifðu á Windows, Mac, Linux, Azure, Docker, Lambda, AWS</li>
<li> Lestu strikamerki og QR kóða</li>
<li> Flytðu út OCR niðurstöður í XHTML</li>
<li> Flytðu út OCR í PDF skjöl sem hægt er að leita í</li>
<li> Multithreading stuðningur</li>
<li> 126 alþjóðamál eru öll stjórnað með NuGet eða OcrData skrám</li>
<li> Dragðu úr myndum, hnitum, tölfræði og leturgerðum. Ekki bara texta.</li>
<li> Hægt að nota til að dreifa Tesseract OCR innan forrita og einkafyrirtækja.</li>
</ul>
<p> <em>IronOCR skín þegar unnið er með raunverulegar heimsmyndir og ófullkomnar skjöl eins og ljósmyndir eða skannanir með litla upplausn sem geta haft stafrænan hávaða eða ófullkomleika.</em></p>
<p> Önnur <a href="/csharp/ocr/use-case/free-ocr-csharp/">ókeypis OCR-</a> bókasöfn fyrir .NET vettvanginn svo sem önnur .NET Tesseract forritaskil og vefþjónusta skila ekki svo góðum árangri í þessum raunverulegu notkunartilvikum.</p>
<h2> OCR með Tesseract 5 - Byrjaðu kóðun í C#</h2>
<p> Kóðasýnið hér að neðan sýnir hversu auðvelt það er að lesa texta úr mynd með C# eða VB .NET.</p>
<h3> OneLiner</h3>
```csharp
// Les textann úr myndinni og skilar honum sem streng
string Text = new IronTesseract().Read(@"img\Screenshot.png").Text;
Console.WriteLine(Text);
```
<h3>Stillanlegur Hello World</h3>
```csharp
// Þú þarft að setja IronOcr.Languages.Icelandic upp í verkefnið með NuGet
using IronOcr;
// Býr til nýtt OCR fyrirbæri
var Ocr = new IronTesseract();
// Setur tungumálið sem á að nota
Ocr.Language = OcrLanguage.Icelandic;
using (var Input = new OcrInput())
{
// Bætir mynd við OCR inntak
Input.AddImage("images/sample.jpeg");
// Þú getur bætt við hvaða fjölda mynda sem er
var Result = Ocr.Read(Input);
// Prenta textann fundin á myndinni
Console.WriteLine(Result.Text);
}
```
<h3>C# PDF OCR</h3>
<p> Sama nálgun er á sama hátt hægt að nota til að draga texta úr hvaða PDF skjali sem er.</p>
```csharp
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Icelandic;
using (var input = new OcrInput())
{
// Bætir PDF skjali við OCR inntak. "password" er lykilorðið ef skjalið er varið
input.AddPdf("example.pdf", "password");
// Við getum líka valið sérstök PDF blaðsíðunúmer fyrir OCR
var Result = Ocr.Read(input);
Console.WriteLine(Result.Text);
Console.WriteLine($"{Result.Pages.Count()} Pages");
// 1 blaðsíða fyrir hverja síðu í PDF
}
```
<h3>OCR fyrir MultiPage TIFF</h3>
<p> OCR lestur TIFF skráarsnið þar á meðal skjöl á mörgum síðum. Einnig er hægt að breyta TIFF beint í PDF skjal með texta sem hægt er að leita í.</p>
```csharp
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Icelandic;
using (var Input = new OcrInput())
{
// Bætir við fjölramma TIFF skrá
Input.AddMultiFrameTiff("multi-frame.tiff");
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
```
<h3>Strikamerki og QR</h3>
<p> Sérstakur eiginleiki IronOCR er að það getur lesið strikamerki og QR kóða úr skjölum meðan það er að leita að texta. Dæmi um <code>OcrResult.OcrBarcode</code> gefur verktaki ítarlegar upplýsingar um hvert skannað strikamerki.</p>
```csharp
using IronOcr;
var Ocr = new IronTesseract();
// Leyfir lestur á strikamerkjum
Ocr.Configuration.ReadBarCodes = true;
using (var input = new OcrInput())
{
input.AddImage("img/Barcode.png");
var Result = Ocr.Read(input);
foreach (var Barcode in Result.Barcodes)
{
// Prentar gildi strikamerkisins
Console.WriteLine(Barcode.Value);
// Gerð og staðsetningareiginleikar einnig útsettir
}
}
```
<h3>OCR um sérstök svæði mynda</h3>
<p> Allar skannunar- og lestraraðferðir IronOCR veita möguleika á að tilgreina nákvæmlega úr hvaða hluta af blaðsíðu eða síðum við viljum lesa texta. Þetta er mjög gagnlegt þegar við erum að skoða stöðluð eyðublöð og getur sparað óskaplega mikinn tíma og bætt skilvirkni.</p>
<p> Til að nota uppskerusvæði verðum við að bæta við <code>System.Drawing</code> í <code>System.Drawing</code> svo að við getum notað <code>System.Drawing.Rectangle</code> hlutinn.</p>
```csharp
using IronOcr;
using System.Drawing; // Bætir við kerfisritunar samkomu sem það er notað í kóðanum
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Icelandic;
using (var Input = new OcrInput())
{
// Býr til ferhyrning sem táknar það efni sem við viljum lesa úr myndinni
var ContentArea = new Rectangle() { X = 215, Y = 1250, Height = 280, Width = 1335 };
// Bætir við mynd og tilgreitir svæði fyrir OCR vinnslu
Input.Add("document.png", ContentArea);
var Result = Ocr.Read(Input);
// Prentar úrkominn texta
Console.WriteLine(Result.Text);
}
```
<h3>OCR fyrir lágar gæðaskannanir</h3>
<p> IronOCR <code>OcrInput</code> bekkurinn getur lagað skannanir sem venjulegur Tesseract getur ekki lesið.</p>
```csharp
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Icelandic;
using (var Input = new OcrInput(@"img\Potter.LowQuality.tiff"))
{
// Lagfærir stafrænan hávaða og lélega skönnun
Input.DeNoise();
// Lagfærir snúning og sjónarhorn
Input.Deskew();
var Result = Ocr.Read(Input);
// Prentar úrkominn texta
Console.WriteLine(Result.Text);
}
```
<h3>Flytja út OCR niðurstöður sem PDF sem hægt er að leita í</h3>
<p> Mynd í PDF með afritanlegum textastrengjum. Hægt að verðtryggja með leitarvélum og gagnagrunnum.</p>
```csharp
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Icelandic;
using (var Input = new OcrInput())
{
// Tilgreinir titil PDFs
Input.Title = "Quarterly Report";
// Bætir við myndum í innslátt
Input.AddImage("image1.jpeg");
Input.AddImage("image2.png");
Input.AddImage("image3.gif");
var Result = Ocr.Read(Input);
// Geymir niðurstöðuna sem PDF skjalhægt að leita í
Result.SaveAsSearchablePdf("searchable.pdf");
}
```
<h3>TIFF til að leita í PDF viðskiptum</h3>
<p> Skiptu TIFF skjali (eða hvaða hópi myndaskrár sem er) beint í PDF sem hægt er að leita í sem hægt er að verðtryggja með innra neti, vefsíðu og Google leitarvélum.</p>
```csharp
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Icelandic;
using (var Input = new OcrInput())
{
// Bætir við fjölramma TIFF skrá
Input.AddMultiFrameTiff("example.tiff");
// Les inntakið og geymir sem PDF skjalhægt að leita í
var Result = Ocr.Read(Input);
Result.SaveAsSearchablePdf("searchable.pdf");
}
```
<h3>Flytja út OCR niðurstöður sem HTML</h3>
<p> OCR mynd í XHTML viðskipti.</p>
```csharp
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Icelandic;
using (var Input = new OcrInput())
{
// Setur HTML titil
Input.Title = "Html Title";
// Bætir við mynd við inntak
Input.AddImage("image1.jpeg");
var Result = Ocr.Read(Input);
// Geymir niðurstöður sem hocr skjal
Result.SaveAsHocrFile("results.html");
}
```
<h2>OCR myndaukandi síur</h2>
<p> IronOCR veitir einstaka síur fyrir <code>OcrInput</code> hluti til að bæta árangur OCR.</p>
<h3> Dæmi um myndaukningarkóða</h3>
<p> Gerir OCR innsláttarmyndir meiri gæði til að framleiða betri og hraðari OCR niðurstöður.</p>
```csharp
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Icelandic;
using (var Input = new OcrInput(@"LowQuality.jpeg"))
{
// Lagfærir hljóð og léleika í inntakshopnum
Input.DeNoise();
Input.Deskew();
var Result = Ocr.Read(Input);
// Prentar úrkominn texta
Console.WriteLine(Result.Text);
}
```
<h3>Listi yfir OCR myndasíur</h3>
<p> Inntakssíur til að auka árangur OCR sem eru innbyggðar í IronOCR eru:</p>
<ul>
<li> <strong>OcrInput.Rotate (tvöfaldar gráður)</strong> - Snýst myndum um fjölda gráða réttsælis. Notaðu neikvæðar tölur fyrir rangsælis.</li>
<li> <strong>OcrInput.Binarize ()</strong> - Þessi <strong>myndasía</strong> gerir hverja <strong>pixlu</strong> svartan eða hvítan án <strong>millivegar</strong>. Getur bætt OCR árangur í tilfelli af mjög litlum andstæða texta við bakgrunn.</li>
<li> <strong>OcrInput.ToGrayScale ()</strong> - Þessi <strong>myndsía</strong> breytir hverjum punkta í skugga gráskalans. Ólíklegt til að bæta OCR nákvæmni en gæti bætt hraðann.</li>
<li> <strong>OcrInput.Contrast ()</strong> - Eykur sjálfvirkt andstæða. Þessi sía bætir oft OCR hraða og nákvæmni í litlum skuggaefnum.</li>
<li> <strong>OcrInput.DeNoise ()</strong> - Fjarlægir stafrænan hávaða. Þessi sía ætti aðeins að nota þar sem búist er við hávaða.</li>
<li> <strong>OcrInput.Invert ()</strong> - Breytir hverjum lit. Td hvítur verður svartur: svartur verður hvítur.</li>
<li> <strong>OcrInput.Dilate ()</strong> - Ítarlegri formgerð. <em>Útvíkkun</em> bætir punktum við mörk hlutanna í mynd. Andstætt Erode.</li>
<li> <strong>OcrInput.Erode ()</strong> - Ítarlegri formgerð. <em>Rof</em> fjarlægir punkta á hlutamörkum á móti Dilate.</li>
<li> <strong>OcrInput.Deskew ()</strong> - Snýr mynd þannig að hún er rétta leiðin upp og réttlógruð. Þetta er mjög gagnlegt fyrir OCR vegna þess að umburðarlyndi Tesseract fyrir skekktar skannanir getur verið allt að 5 gráður.</li>
<li> <strong>OcrInput.DeepCleanBackgroundNoise ()</strong> - Þungur bakgrunnur hávaði fjarlægður. Notaðu þessa síu ef vitað er um mikinn bakgrunnshljóð skjala, af því að þessi sía dregur einnig úr OCR nákvæmni hreinna skjala og er vaxtöflurit.</li>
<li> <strong>OcrInput.EnhanceResolution</strong> - <strong>Bætir</strong> upplausn mynda með litlum gæðum. Ekki er oft þörf á þessari síu vegna þess að <em>OcrInput.MinimumDPI</em> og <em>OcrInput.TargetDPI</em> grípur sjálfkrafa og leysir inntak með lága upplausn.</li>
</ul>
<p> <strong>CleanBackgroundNoise.</strong> Þetta er stilling sem er nokkuð tímafrek; þó gerir það bókasafninu kleift að hreinsa sjálfkrafa stafrænan hávaða, pappírskreppur og aðra ófullkomleika innan stafrænnar myndar sem annars myndu gera það ófært um að vera lesið af öðrum OCR bókasöfnum.</p>
<p> <strong>EnhanceContrast</strong> er stilling sem veldur því að IronOCR eykur sjálfkrafa andstæða texta á bakgrunni myndar, eykur nákvæmni OCR og almennt eykur afköst og hraða OCR.</p>
<p> <strong>EnhanceResolution</strong> er stilling sem uppgötvar sjálfkrafa myndir í lágri upplausn (sem eru undir 275 pátum) og hækkar sjálfkrafa myndina og skerpir síðan allan textann svo hægt sé að lesa hann fullkomlega af OCR bókasafni. Þó að þessi aðgerð sé í sjálfu sér tímafrek, dregur hún almennt úr heildartíma fyrir OCR aðgerð á mynd.</p>
<p> <strong>Tungumál</strong> IronOCR styður 22 alþjóðlega tungumálapakka og hægt er að nota tungumálastillinguna til að velja eitt eða fleiri mörg tungumál sem nota á fyrir OCR aðgerð.</p>
<p> <strong>Strategy</strong> IronOCR styður tvær aðferðir. Við getum valið að fara annaðhvort í skjóta og minna nákvæma skönnun á skjali eða nota háþróaða aðferð sem notar nokkur gervigreindarlíkön til að bæta sjálfkrafa nákvæmni OCR-texta með því að skoða tölfræðilegt samband orðanna við hvert annað í setningu.</p>
<p> <strong>ColorSpace</strong> er stilling þar sem við getum valið að OCR í gráskala eða lit. Almennt er gráskala besti kosturinn. Hins vegar stundum þegar það eru textar eða bakgrunnur af svipuðum lit en mjög mismunandi litur, mun litrými í fullum lit skila betri árangri.</p>
<p> <strong>UppgötvaWhiteTextOnDarkBackgrounds.</strong> Yfirleitt búast öll OCR bókasöfn við að sjá svartan texta á hvítum bakgrunni. Þessi stilling gerir IronOCR kleift að greina sjálfkrafa neikvæða eða dökkar síður með hvítum texta og lesa þær.</p>
<p> <strong>InputImageType.</strong> Þessi stilling gerir verktaki kleift að leiðbeina OCR bókasafninu um hvort hann sé að skoða skjal eða bút, svo sem skjáskot.</p>
<p> <strong>RotateAndStraighten</strong> er háþróaður stilling sem gerir IronOCR kleift að fá einstaka hæfileika til að lesa skjöl sem eru ekki aðeins snúin heldur innihalda kannski sjónarhorn, svo sem ljósmyndir af textaskjölum.</p>
<p> <strong>ReadBarcodes</strong> er gagnlegur eiginleiki sem gerir IronOCR kleift að lesa sjálfkrafa strikamerki og QR kóða á síðum þar sem það les einnig texta án þess að bæta við meiri tímabyrði.</p>
<p> <strong>Litadýpt.</strong> Þessi stilling ákvarðar hversu marga bita á punkta OCR bókasafnið notar til að ákvarða dýpt litar. Meiri litadýpt getur aukið gæði OCR en mun einnig auka þann tíma sem OCR aðgerðinni lýkur.</p>
<h2> 126 tungumálapakkar</h2>
<p> IronOCR styður <strong>126 alþjóðleg tungumál</strong> með tungumálapökkum sem er dreift sem DLLs sem hægt er að <a href="/csharp/ocr/languages/">hlaða niður af þessari vefsíðu</a> eða einnig frá <a href="https://www.nuget.org/packages?q=IronOcr.Languages">NuGet Package Manager</a> .</p>
<p> Tungumál eru þýska, franska, enska, kínverska, japanska og margt fleira. Tungumálapakkar sérfræðinga eru til fyrir vegabréf MRZ, MICR eftirlit, fjárhagsleg gögn, númeraplötur og margt fleira. Þú getur líka notað hvaða ".traineddata" skjal sem er - - þar á meðal þær sem þú býrð til sjálfur.</p>
<h3> Dæmi um tungumál</h3>
<p> Notkun annarra OCR tungumála.</p>
```csharp
using IronOcr;
// Þú þarft að setja IronOcr.Languages.Arabic upp í verkefnið með NuGet
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Arabic;
using (var input = new OcrInput())
{
// Bætir við arabísku myndinni í inntak
input.AddImage("img/arabic.gif");
// Bættu við myndasíum ef þörf er á
// Jafnvel þótt inntak sé lítil gæði þá getur IronTesseract lesið það
var Result = Ocr.Read(input);
// Stjórnborðið getur ekki prentað arabísku á Windows auðveldlega.
// Vista í skrá í staðinn.
Result.SaveAsTextFile("arabic.txt");
}
```
<h3>Dæmi um mörg tungumál</h3>
<p> Það er einnig mögulegt að nota OCR á mörgum tungumálum samtímis. Þetta getur virkilega hjálpað til við að fá lýsigögn og slóðir á ensku í Unicode skjölum.</p>
```csharp
using IronOcr;
// Þú þarft að setja IronOcr.Languages.ChineseSimplified upp í verkefnið með NuGet
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.ChineseSimplified;
Ocr.AddSecondaryLanguage(OcrLanguage.Icelandic);
// Við getum bætt við hvaða tungumáli sem er
using (var input = new OcrInput())
{
input.Add("multi-language.pdf");
var Result = Ocr.Read(input);
// Geymir niðurstöðurnar sem textaskrá
Result.SaveAsTextFile("results.txt");
}
```
<h2>Ítarlegir hlutir OCR niðurstaðna</h2>
<p> IronOCR skilar OCR niðurstöðu hlut fyrir hverja OCR aðgerð. Almennt nota forritarar aðeins textaeiginleika þessa hlutar til að fá textann skannaðan frá myndinni. OCR niðurstöður DOM eru þó miklu lengra komnar en þetta.</p>
```csharp
using IronOcr;
using System.Drawing; // Bætir við kerfisritunar samkomutilvísun
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Icelandic;
// Velur vélarstillingu fyrir Tesseract
Ocr.Configuration.EngineMode = TesseractEngineMode.TesseractAndLstm;
Ocr.Configuration.ReadBarCodes = true; // Mikilvægt að lesa strikamerki
using (var Input = new OcrInput(@"images\sample.tiff"))
{
OcrResult Result = Ocr.Read(Input);
var Pages = Result.Pages;
var Words = Pages[0].Words;
var Barcodes = Result.Barcodes;
// Kannaðu hér til að finna gríðarlegt, ítarlegt forritaskil:
// - Síður, kubbar, paraphaphs, línur, orð, stafir
// - Útflutningur mynda, leturhnit, tölfræðileg gögn
}
```
<h2>Frammistaða</h2>
<p> IronOCR vinnur út úr kassanum án þess að þurfa að stilla flutning eða breyta verulega inntaksmyndum.</p>
<p> Hraði er að loga: IronOCR.2020+ er allt að 10 sinnum hraðari og gerir yfir 250% færri villur en fyrri smíði.</p>
<h2>Læra meira</h2>
<p> Til að læra meira um OCR í C#, VB, F# eða einhverju öðru .NET tungumáli, vinsamlegast <a href="/csharp/ocr/tutorials/how-to-read-text-from-an-image-in-csharp-net/">lestu námskeið okkar í samfélaginu</a>, sem gefa raunveruleg dæmi um heiminn um hvernig hægt er að nota IronOCR og geta sýnt blæbrigði hvernig á að fá sem best út úr þetta bókasafn.</p>
<p> Full <a href="/csharp/ocr/object-reference/api/">tilvísun fyrir hluti fyrir .NET forritara</a> er einnig fáanleg.</p>
IronOCR er C# hugbúnaðarþáttur sem gerir .NET kóðara kleift að lesa texta úr myndum og PDF skjölum á 126 tungumálum, þar á meðal íslensku.
Það er háþróaður gaffall af Tesseract, smíðaður eingöngu fyrir .NET forritara og stendur sig betur en aðrar Tesseract vélar bæði hvað varðar hraða og nákvæmni.
Innihald IronOcr.Languages.Icelandic
Þessi pakki inniheldur 52 OCR tungumál fyrir .NET:
Fyrsti viðfangsliðurinn er að setja upp Icelandic OCR pakka í .NET verkefni.
PM> Install-Package IronOcr.Languages.Icelandic
Kóðadæmi
Þetta C# kóðadæmi les íslenskan texta úr mynd eða PDF skjali.
// Þú þarft að setja IronOcr.Languages.Icelandic upp í verkefnið með NuGetusing IronOcr;varOcr = new IronTesseract();// Setur tungumálið sem á að nota til að vera ÍslenskaOcr.Language = OcrLanguage.Icelandic;using (varInput = new OcrInput(@"images\Icelandic.png")){ // Les myndina og skilar niðurstöðu. varResult = Ocr.Read(Input); // Prentar allann textann sem fannst í PDF eða mynd varAllText = Result.Text;Console.WriteLine(AllText);}
// Þú þarft að setja IronOcr.Languages.Icelandic upp í verkefnið með NuGet
using IronOcr;
var Ocr = new IronTesseract();
// Setur tungumálið sem á að nota til að vera Íslenska
Ocr.Language = OcrLanguage.Icelandic;
using (var Input = new OcrInput(@"images\Icelandic.png"))
{
// Les myndina og skilar niðurstöðu.
var Result = Ocr.Read(Input);
// Prentar allann textann sem fannst í PDF eða mynd
var AllText = Result.Text;
Console.WriteLine(AllText);
}
' Þú þarft að setja IronOcr.Languages.Icelandic upp í verkefnið með NuGetImportsIronOcrPrivateOcr = New IronTesseract()' Setur tungumálið sem á að nota til að vera ÍslenskaOcr.Language = OcrLanguage.IcelandicUsingInput = New OcrInput("images\Icelandic.png") ' Les myndina og skilar niðurstöðu. DimResult = Ocr.Read(Input) ' Prentar allann textann sem fannst í PDF eða mynd DimAllText = Result.TextConsole.WriteLine(AllText)EndUsing
' Þú þarft að setja IronOcr.Languages.Icelandic upp í verkefnið með NuGet
Imports IronOcr
Private Ocr = New IronTesseract()
' Setur tungumálið sem á að nota til að vera Íslenska
Ocr.Language = OcrLanguage.Icelandic
Using Input = New OcrInput("images\Icelandic.png")
' Les myndina og skilar niðurstöðu.
Dim Result = Ocr.Read(Input)
' Prentar allann textann sem fannst í PDF eða mynd
Dim AllText = Result.Text
Console.WriteLine(AllText)
End Using
Af hverju að velja IronOCR?
IronOCR er auðvelt í uppsetningu, heill og vel skjalfestur .NET hugbúnaðarsafn.
Veldu IronOCR til að ná 99,8% + OCR nákvæmni án þess að nota utanaðkomandi vefþjónustu, áframhaldandi gjöld eða senda trúnaðargögn um internetið.
Af hverju velja C# verktakar IronOCR fram yfir hefðbundinn Tesseract:
Settu upp sem eina DLL eða NuGet
Innifalið fyrir Tesseract 5, 4 og 3 vélar úr kassanum.
Nákvæmni 99,8% er verulega betri en venjulegur Tesseract.
Logandi hraði og fjölþráður
MVC, WebApp, Desktop, Console & Server Application samhæft
Engir Exes eða C++ kóði til að vinna með
Fullur PDF OCR stuðningur
Til að framkvæma OCR næstum hvaða myndskrá eða PDF
Fullur .NET Core, Standard og FrameWork stuðningur
Dreifðu á Windows, Mac, Linux, Azure, Docker, Lambda, AWS
Lestu strikamerki og QR kóða
Flytðu út OCR niðurstöður í XHTML
Flytðu út OCR í PDF skjöl sem hægt er að leita í
Multithreading stuðningur
126 alþjóðamál eru öll stjórnað með NuGet eða OcrData skrám
Dragðu úr myndum, hnitum, tölfræði og leturgerðum. Ekki bara texta.
Hægt að nota til að dreifa Tesseract OCR innan forrita og einkafyrirtækja.
IronOCR skín þegar unnið er með raunverulegar heimsmyndir og ófullkomnar skjöl eins og ljósmyndir eða skannanir með litla upplausn sem geta haft stafrænan hávaða eða ófullkomleika.
Önnur ókeypis OCR- bókasöfn fyrir .NET vettvanginn svo sem önnur .NET Tesseract forritaskil og vefþjónusta skila ekki svo góðum árangri í þessum raunverulegu notkunartilvikum.
OCR með Tesseract 5 - Byrjaðu kóðun í C#
Kóðasýnið hér að neðan sýnir hversu auðvelt það er að lesa texta úr mynd með C# eða VB .NET.
OneLiner
// Les textann úr myndinni og skilar honum sem strengstringText = new IronTesseract().Read(@"img\Screenshot.png").Text;Console.WriteLine(Text);
// Les textann úr myndinni og skilar honum sem streng
string Text = new IronTesseract().Read(@"img\Screenshot.png").Text;
Console.WriteLine(Text);
' Les textann úr myndinni og skilar honum sem strengDimTextAsString = (New IronTesseract()).Read("img\Screenshot.png").TextConsole.WriteLine(Text)
' Les textann úr myndinni og skilar honum sem streng
Dim Text As String = (New IronTesseract()).Read("img\Screenshot.png").Text
Console.WriteLine(Text)
Stillanlegur Hello World
// Þú þarft að setja IronOcr.Languages.Icelandic upp í verkefnið með NuGetusing IronOcr;// Býr til nýtt OCR fyrirbærivarOcr = new IronTesseract();// Setur tungumálið sem á að notaOcr.Language = OcrLanguage.Icelandic;using (varInput = new OcrInput()){ // Bætir mynd við OCR inntakInput.AddImage("images/sample.jpeg"); // Þú getur bætt við hvaða fjölda mynda sem er varResult = Ocr.Read(Input); // Prenta textann fundin á myndinniConsole.WriteLine(Result.Text);}
// Þú þarft að setja IronOcr.Languages.Icelandic upp í verkefnið með NuGet
using IronOcr;
// Býr til nýtt OCR fyrirbæri
var Ocr = new IronTesseract();
// Setur tungumálið sem á að nota
Ocr.Language = OcrLanguage.Icelandic;
using (var Input = new OcrInput())
{
// Bætir mynd við OCR inntak
Input.AddImage("images/sample.jpeg");
// Þú getur bætt við hvaða fjölda mynda sem er
var Result = Ocr.Read(Input);
// Prenta textann fundin á myndinni
Console.WriteLine(Result.Text);
}
' Þú þarft að setja IronOcr.Languages.Icelandic upp í verkefnið með NuGetImportsIronOcr' Býr til nýtt OCR fyrirbæriPrivateOcr = New IronTesseract()' Setur tungumálið sem á að notaOcr.Language = OcrLanguage.IcelandicUsingInput = New OcrInput() ' Bætir mynd við OCR inntakInput.AddImage("images/sample.jpeg") ' Þú getur bætt við hvaða fjölda mynda sem er DimResult = Ocr.Read(Input) ' Prenta textann fundin á myndinniConsole.WriteLine(Result.Text)EndUsing
' Þú þarft að setja IronOcr.Languages.Icelandic upp í verkefnið með NuGet
Imports IronOcr
' Býr til nýtt OCR fyrirbæri
Private Ocr = New IronTesseract()
' Setur tungumálið sem á að nota
Ocr.Language = OcrLanguage.Icelandic
Using Input = New OcrInput()
' Bætir mynd við OCR inntak
Input.AddImage("images/sample.jpeg")
' Þú getur bætt við hvaða fjölda mynda sem er
Dim Result = Ocr.Read(Input)
' Prenta textann fundin á myndinni
Console.WriteLine(Result.Text)
End Using
C# PDF OCR
Sama nálgun er á sama hátt hægt að nota til að draga texta úr hvaða PDF skjali sem er.
using IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Icelandic;using (var input = new OcrInput()){ // Bætir PDF skjali við OCR inntak. "password" er lykilorðið ef skjalið er varið input.AddPdf("example.pdf", "password"); // Við getum líka valið sérstök PDF blaðsíðunúmer fyrir OCR varResult = Ocr.Read(input);Console.WriteLine(Result.Text);Console.WriteLine($"{Result.Pages.Count()} Pages"); // 1 blaðsíða fyrir hverja síðu í PDF}
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Icelandic;
using (var input = new OcrInput())
{
// Bætir PDF skjali við OCR inntak. "password" er lykilorðið ef skjalið er varið
input.AddPdf("example.pdf", "password");
// Við getum líka valið sérstök PDF blaðsíðunúmer fyrir OCR
var Result = Ocr.Read(input);
Console.WriteLine(Result.Text);
Console.WriteLine($"{Result.Pages.Count()} Pages");
// 1 blaðsíða fyrir hverja síðu í PDF
}
ImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.IcelandicUsing input = New OcrInput() ' Bætir PDF skjali við OCR inntak. "password" er lykilorðið ef skjalið er varið input.AddPdf("example.pdf", "password") ' Við getum líka valið sérstök PDF blaðsíðunúmer fyrir OCR DimResult = Ocr.Read(input)Console.WriteLine(Result.Text)Console.WriteLine($"{Result.Pages.Count()} Pages") ' 1 blaðsíða fyrir hverja síðu í PDFEndUsing
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Icelandic
Using input = New OcrInput()
' Bætir PDF skjali við OCR inntak. "password" er lykilorðið ef skjalið er varið
input.AddPdf("example.pdf", "password")
' Við getum líka valið sérstök PDF blaðsíðunúmer fyrir OCR
Dim Result = Ocr.Read(input)
Console.WriteLine(Result.Text)
Console.WriteLine($"{Result.Pages.Count()} Pages")
' 1 blaðsíða fyrir hverja síðu í PDF
End Using
OCR fyrir MultiPage TIFF
OCR lestur TIFF skráarsnið þar á meðal skjöl á mörgum síðum. Einnig er hægt að breyta TIFF beint í PDF skjal með texta sem hægt er að leita í.
using IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Icelandic;using (varInput = new OcrInput()){ // Bætir við fjölramma TIFF skráInput.AddMultiFrameTiff("multi-frame.tiff"); varResult = Ocr.Read(Input);Console.WriteLine(Result.Text);}
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Icelandic;
using (var Input = new OcrInput())
{
// Bætir við fjölramma TIFF skrá
Input.AddMultiFrameTiff("multi-frame.tiff");
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
ImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.IcelandicUsingInput = New OcrInput() ' Bætir við fjölramma TIFF skráInput.AddMultiFrameTiff("multi-frame.tiff") DimResult = Ocr.Read(Input)Console.WriteLine(Result.Text)EndUsing
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Icelandic
Using Input = New OcrInput()
' Bætir við fjölramma TIFF skrá
Input.AddMultiFrameTiff("multi-frame.tiff")
Dim Result = Ocr.Read(Input)
Console.WriteLine(Result.Text)
End Using
Strikamerki og QR
Sérstakur eiginleiki IronOCR er að það getur lesið strikamerki og QR kóða úr skjölum meðan það er að leita að texta. Dæmi um OcrResult.OcrBarcode gefur verktaki ítarlegar upplýsingar um hvert skannað strikamerki.
using IronOcr;varOcr = new IronTesseract();// Leyfir lestur á strikamerkjumOcr.Configuration.ReadBarCodes = true;using (var input = new OcrInput()){ input.AddImage("img/Barcode.png"); varResult = Ocr.Read(input); foreach (varBarcodeinResult.Barcodes) { // Prentar gildi strikamerkisinsConsole.WriteLine(Barcode.Value); // Gerð og staðsetningareiginleikar einnig útsettir }}
using IronOcr;
var Ocr = new IronTesseract();
// Leyfir lestur á strikamerkjum
Ocr.Configuration.ReadBarCodes = true;
using (var input = new OcrInput())
{
input.AddImage("img/Barcode.png");
var Result = Ocr.Read(input);
foreach (var Barcode in Result.Barcodes)
{
// Prentar gildi strikamerkisins
Console.WriteLine(Barcode.Value);
// Gerð og staðsetningareiginleikar einnig útsettir
}
}
ImportsIronOcrPrivateOcr = New IronTesseract()' Leyfir lestur á strikamerkjumOcr.Configuration.ReadBarCodes = TrueUsing input = New OcrInput() input.AddImage("img/Barcode.png") DimResult = Ocr.Read(input) For EachBarcodeInResult.Barcodes ' Prentar gildi strikamerkisinsConsole.WriteLine(Barcode.Value) ' Gerð og staðsetningareiginleikar einnig útsettir NextBarcodeEndUsing
Imports IronOcr
Private Ocr = New IronTesseract()
' Leyfir lestur á strikamerkjum
Ocr.Configuration.ReadBarCodes = True
Using input = New OcrInput()
input.AddImage("img/Barcode.png")
Dim Result = Ocr.Read(input)
For Each Barcode In Result.Barcodes
' Prentar gildi strikamerkisins
Console.WriteLine(Barcode.Value)
' Gerð og staðsetningareiginleikar einnig útsettir
Next Barcode
End Using
OCR um sérstök svæði mynda
Allar skannunar- og lestraraðferðir IronOCR veita möguleika á að tilgreina nákvæmlega úr hvaða hluta af blaðsíðu eða síðum við viljum lesa texta. Þetta er mjög gagnlegt þegar við erum að skoða stöðluð eyðublöð og getur sparað óskaplega mikinn tíma og bætt skilvirkni.
Til að nota uppskerusvæði verðum við að bæta við System.Drawing í System.Drawing svo að við getum notað System.Drawing.Rectangle hlutinn.
using IronOcr;using System.Drawing; // Bætir við kerfisritunar samkomu sem það er notað í kóðanumvarOcr = new IronTesseract();Ocr.Language = OcrLanguage.Icelandic;using (varInput = new OcrInput()){ // Býr til ferhyrning sem táknar það efni sem við viljum lesa úr myndinni varContentArea = new Rectangle() { X = 215, Y = 1250, Height = 280, Width = 1335 }; // Bætir við mynd og tilgreitir svæði fyrir OCR vinnsluInput.Add("document.png", ContentArea); varResult = Ocr.Read(Input); // Prentar úrkominn textaConsole.WriteLine(Result.Text);}
using IronOcr;
using System.Drawing; // Bætir við kerfisritunar samkomu sem það er notað í kóðanum
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Icelandic;
using (var Input = new OcrInput())
{
// Býr til ferhyrning sem táknar það efni sem við viljum lesa úr myndinni
var ContentArea = new Rectangle() { X = 215, Y = 1250, Height = 280, Width = 1335 };
// Bætir við mynd og tilgreitir svæði fyrir OCR vinnslu
Input.Add("document.png", ContentArea);
var Result = Ocr.Read(Input);
// Prentar úrkominn texta
Console.WriteLine(Result.Text);
}
ImportsIronOcrImportsSystem.Drawing' Bætir við kerfisritunar samkomu sem það er notað í kóðanumPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.IcelandicUsingInput = New OcrInput() ' Býr til ferhyrning sem táknar það efni sem við viljum lesa úr myndinni DimContentArea = New Rectangle() With { .X = 215, .Y = 1250, .Height = 280, .Width = 1335 } ' Bætir við mynd og tilgreitir svæði fyrir OCR vinnsluInput.Add("document.png", ContentArea) DimResult = Ocr.Read(Input) ' Prentar úrkominn textaConsole.WriteLine(Result.Text)EndUsing
Imports IronOcr
Imports System.Drawing ' Bætir við kerfisritunar samkomu sem það er notað í kóðanum
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Icelandic
Using Input = New OcrInput()
' Býr til ferhyrning sem táknar það efni sem við viljum lesa úr myndinni
Dim ContentArea = New Rectangle() With {
.X = 215,
.Y = 1250,
.Height = 280,
.Width = 1335
}
' Bætir við mynd og tilgreitir svæði fyrir OCR vinnslu
Input.Add("document.png", ContentArea)
Dim Result = Ocr.Read(Input)
' Prentar úrkominn texta
Console.WriteLine(Result.Text)
End Using
OCR fyrir lágar gæðaskannanir
IronOCR OcrInput bekkurinn getur lagað skannanir sem venjulegur Tesseract getur ekki lesið.
using IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Icelandic;using (varInput = new OcrInput(@"img\Potter.LowQuality.tiff")){ // Lagfærir stafrænan hávaða og lélega skönnunInput.DeNoise(); // Lagfærir snúning og sjónarhornInput.Deskew(); varResult = Ocr.Read(Input); // Prentar úrkominn textaConsole.WriteLine(Result.Text);}
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Icelandic;
using (var Input = new OcrInput(@"img\Potter.LowQuality.tiff"))
{
// Lagfærir stafrænan hávaða og lélega skönnun
Input.DeNoise();
// Lagfærir snúning og sjónarhorn
Input.Deskew();
var Result = Ocr.Read(Input);
// Prentar úrkominn texta
Console.WriteLine(Result.Text);
}
ImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.IcelandicUsingInput = New OcrInput("img\Potter.LowQuality.tiff") ' Lagfærir stafrænan hávaða og lélega skönnunInput.DeNoise() ' Lagfærir snúning og sjónarhornInput.Deskew() DimResult = Ocr.Read(Input) ' Prentar úrkominn textaConsole.WriteLine(Result.Text)EndUsing
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Icelandic
Using Input = New OcrInput("img\Potter.LowQuality.tiff")
' Lagfærir stafrænan hávaða og lélega skönnun
Input.DeNoise()
' Lagfærir snúning og sjónarhorn
Input.Deskew()
Dim Result = Ocr.Read(Input)
' Prentar úrkominn texta
Console.WriteLine(Result.Text)
End Using
Flytja út OCR niðurstöður sem PDF sem hægt er að leita í
Mynd í PDF með afritanlegum textastrengjum. Hægt að verðtryggja með leitarvélum og gagnagrunnum.
using IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Icelandic;using (varInput = new OcrInput()){ // Tilgreinir titil PDFsInput.Title = "Quarterly Report"; // Bætir við myndum í innsláttInput.AddImage("image1.jpeg");Input.AddImage("image2.png");Input.AddImage("image3.gif"); varResult = Ocr.Read(Input); // Geymir niðurstöðuna sem PDF skjalhægt að leita íResult.SaveAsSearchablePdf("searchable.pdf");}
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Icelandic;
using (var Input = new OcrInput())
{
// Tilgreinir titil PDFs
Input.Title = "Quarterly Report";
// Bætir við myndum í innslátt
Input.AddImage("image1.jpeg");
Input.AddImage("image2.png");
Input.AddImage("image3.gif");
var Result = Ocr.Read(Input);
// Geymir niðurstöðuna sem PDF skjalhægt að leita í
Result.SaveAsSearchablePdf("searchable.pdf");
}
ImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.IcelandicUsingInput = New OcrInput() ' Tilgreinir titil PDFsInput.Title = "Quarterly Report" ' Bætir við myndum í innsláttInput.AddImage("image1.jpeg")Input.AddImage("image2.png")Input.AddImage("image3.gif") DimResult = Ocr.Read(Input) ' Geymir niðurstöðuna sem PDF skjalhægt að leita íResult.SaveAsSearchablePdf("searchable.pdf")EndUsing
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Icelandic
Using Input = New OcrInput()
' Tilgreinir titil PDFs
Input.Title = "Quarterly Report"
' Bætir við myndum í innslátt
Input.AddImage("image1.jpeg")
Input.AddImage("image2.png")
Input.AddImage("image3.gif")
Dim Result = Ocr.Read(Input)
' Geymir niðurstöðuna sem PDF skjalhægt að leita í
Result.SaveAsSearchablePdf("searchable.pdf")
End Using
TIFF til að leita í PDF viðskiptum
Skiptu TIFF skjali (eða hvaða hópi myndaskrár sem er) beint í PDF sem hægt er að leita í sem hægt er að verðtryggja með innra neti, vefsíðu og Google leitarvélum.
using IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Icelandic;using (varInput = new OcrInput()){ // Bætir við fjölramma TIFF skráInput.AddMultiFrameTiff("example.tiff"); // Les inntakið og geymir sem PDF skjalhægt að leita í varResult = Ocr.Read(Input);Result.SaveAsSearchablePdf("searchable.pdf");}
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Icelandic;
using (var Input = new OcrInput())
{
// Bætir við fjölramma TIFF skrá
Input.AddMultiFrameTiff("example.tiff");
// Les inntakið og geymir sem PDF skjalhægt að leita í
var Result = Ocr.Read(Input);
Result.SaveAsSearchablePdf("searchable.pdf");
}
ImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.IcelandicUsingInput = New OcrInput() ' Bætir við fjölramma TIFF skráInput.AddMultiFrameTiff("example.tiff") ' Les inntakið og geymir sem PDF skjalhægt að leita í DimResult = Ocr.Read(Input)Result.SaveAsSearchablePdf("searchable.pdf")EndUsing
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Icelandic
Using Input = New OcrInput()
' Bætir við fjölramma TIFF skrá
Input.AddMultiFrameTiff("example.tiff")
' Les inntakið og geymir sem PDF skjalhægt að leita í
Dim Result = Ocr.Read(Input)
Result.SaveAsSearchablePdf("searchable.pdf")
End Using
Flytja út OCR niðurstöður sem HTML
OCR mynd í XHTML viðskipti.
using IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Icelandic;using (varInput = new OcrInput()){ // Setur HTML titilInput.Title = "Html Title"; // Bætir við mynd við inntakInput.AddImage("image1.jpeg"); varResult = Ocr.Read(Input); // Geymir niðurstöður sem hocr skjalResult.SaveAsHocrFile("results.html");}
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Icelandic;
using (var Input = new OcrInput())
{
// Setur HTML titil
Input.Title = "Html Title";
// Bætir við mynd við inntak
Input.AddImage("image1.jpeg");
var Result = Ocr.Read(Input);
// Geymir niðurstöður sem hocr skjal
Result.SaveAsHocrFile("results.html");
}
ImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.IcelandicUsingInput = New OcrInput() ' Setur HTML titilInput.Title = "Html Title" ' Bætir við mynd við inntakInput.AddImage("image1.jpeg") DimResult = Ocr.Read(Input) ' Geymir niðurstöður sem hocr skjalResult.SaveAsHocrFile("results.html")EndUsing
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Icelandic
Using Input = New OcrInput()
' Setur HTML titil
Input.Title = "Html Title"
' Bætir við mynd við inntak
Input.AddImage("image1.jpeg")
Dim Result = Ocr.Read(Input)
' Geymir niðurstöður sem hocr skjal
Result.SaveAsHocrFile("results.html")
End Using
OCR myndaukandi síur
IronOCR veitir einstaka síur fyrir OcrInput hluti til að bæta árangur OCR.
Dæmi um myndaukningarkóða
Gerir OCR innsláttarmyndir meiri gæði til að framleiða betri og hraðari OCR niðurstöður.
using IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Icelandic;using (varInput = new OcrInput(@"LowQuality.jpeg")){ // Lagfærir hljóð og léleika í inntakshopnumInput.DeNoise();Input.Deskew(); varResult = Ocr.Read(Input); // Prentar úrkominn textaConsole.WriteLine(Result.Text);}
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Icelandic;
using (var Input = new OcrInput(@"LowQuality.jpeg"))
{
// Lagfærir hljóð og léleika í inntakshopnum
Input.DeNoise();
Input.Deskew();
var Result = Ocr.Read(Input);
// Prentar úrkominn texta
Console.WriteLine(Result.Text);
}
ImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.IcelandicUsingInput = New OcrInput("LowQuality.jpeg") ' Lagfærir hljóð og léleika í inntakshopnumInput.DeNoise()Input.Deskew() DimResult = Ocr.Read(Input) ' Prentar úrkominn textaConsole.WriteLine(Result.Text)EndUsing
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Icelandic
Using Input = New OcrInput("LowQuality.jpeg")
' Lagfærir hljóð og léleika í inntakshopnum
Input.DeNoise()
Input.Deskew()
Dim Result = Ocr.Read(Input)
' Prentar úrkominn texta
Console.WriteLine(Result.Text)
End Using
Listi yfir OCR myndasíur
Inntakssíur til að auka árangur OCR sem eru innbyggðar í IronOCR eru:
OcrInput.Rotate (tvöfaldar gráður) - Snýst myndum um fjölda gráða réttsælis. Notaðu neikvæðar tölur fyrir rangsælis.
OcrInput.Binarize () - Þessi myndasía gerir hverja pixlu svartan eða hvítan án millivegar. Getur bætt OCR árangur í tilfelli af mjög litlum andstæða texta við bakgrunn.
OcrInput.ToGrayScale () - Þessi myndsía breytir hverjum punkta í skugga gráskalans. Ólíklegt til að bæta OCR nákvæmni en gæti bætt hraðann.
OcrInput.Contrast () - Eykur sjálfvirkt andstæða. Þessi sía bætir oft OCR hraða og nákvæmni í litlum skuggaefnum.
OcrInput.DeNoise () - Fjarlægir stafrænan hávaða. Þessi sía ætti aðeins að nota þar sem búist er við hávaða.
OcrInput.Invert () - Breytir hverjum lit. Td hvítur verður svartur: svartur verður hvítur.
OcrInput.Dilate () - Ítarlegri formgerð. Útvíkkun bætir punktum við mörk hlutanna í mynd. Andstætt Erode.
OcrInput.Erode () - Ítarlegri formgerð. Rof fjarlægir punkta á hlutamörkum á móti Dilate.
OcrInput.Deskew () - Snýr mynd þannig að hún er rétta leiðin upp og réttlógruð. Þetta er mjög gagnlegt fyrir OCR vegna þess að umburðarlyndi Tesseract fyrir skekktar skannanir getur verið allt að 5 gráður.
OcrInput.DeepCleanBackgroundNoise () - Þungur bakgrunnur hávaði fjarlægður. Notaðu þessa síu ef vitað er um mikinn bakgrunnshljóð skjala, af því að þessi sía dregur einnig úr OCR nákvæmni hreinna skjala og er vaxtöflurit.
OcrInput.EnhanceResolution - Bætir upplausn mynda með litlum gæðum. Ekki er oft þörf á þessari síu vegna þess að OcrInput.MinimumDPI og OcrInput.TargetDPI grípur sjálfkrafa og leysir inntak með lága upplausn.
CleanBackgroundNoise. Þetta er stilling sem er nokkuð tímafrek; þó gerir það bókasafninu kleift að hreinsa sjálfkrafa stafrænan hávaða, pappírskreppur og aðra ófullkomleika innan stafrænnar myndar sem annars myndu gera það ófært um að vera lesið af öðrum OCR bókasöfnum.
EnhanceContrast er stilling sem veldur því að IronOCR eykur sjálfkrafa andstæða texta á bakgrunni myndar, eykur nákvæmni OCR og almennt eykur afköst og hraða OCR.
EnhanceResolution er stilling sem uppgötvar sjálfkrafa myndir í lágri upplausn (sem eru undir 275 pátum) og hækkar sjálfkrafa myndina og skerpir síðan allan textann svo hægt sé að lesa hann fullkomlega af OCR bókasafni. Þó að þessi aðgerð sé í sjálfu sér tímafrek, dregur hún almennt úr heildartíma fyrir OCR aðgerð á mynd.
Tungumál IronOCR styður 22 alþjóðlega tungumálapakka og hægt er að nota tungumálastillinguna til að velja eitt eða fleiri mörg tungumál sem nota á fyrir OCR aðgerð.
Strategy IronOCR styður tvær aðferðir. Við getum valið að fara annaðhvort í skjóta og minna nákvæma skönnun á skjali eða nota háþróaða aðferð sem notar nokkur gervigreindarlíkön til að bæta sjálfkrafa nákvæmni OCR-texta með því að skoða tölfræðilegt samband orðanna við hvert annað í setningu.
ColorSpace er stilling þar sem við getum valið að OCR í gráskala eða lit. Almennt er gráskala besti kosturinn. Hins vegar stundum þegar það eru textar eða bakgrunnur af svipuðum lit en mjög mismunandi litur, mun litrými í fullum lit skila betri árangri.
UppgötvaWhiteTextOnDarkBackgrounds. Yfirleitt búast öll OCR bókasöfn við að sjá svartan texta á hvítum bakgrunni. Þessi stilling gerir IronOCR kleift að greina sjálfkrafa neikvæða eða dökkar síður með hvítum texta og lesa þær.
InputImageType. Þessi stilling gerir verktaki kleift að leiðbeina OCR bókasafninu um hvort hann sé að skoða skjal eða bút, svo sem skjáskot.
RotateAndStraighten er háþróaður stilling sem gerir IronOCR kleift að fá einstaka hæfileika til að lesa skjöl sem eru ekki aðeins snúin heldur innihalda kannski sjónarhorn, svo sem ljósmyndir af textaskjölum.
ReadBarcodes er gagnlegur eiginleiki sem gerir IronOCR kleift að lesa sjálfkrafa strikamerki og QR kóða á síðum þar sem það les einnig texta án þess að bæta við meiri tímabyrði.
Litadýpt. Þessi stilling ákvarðar hversu marga bita á punkta OCR bókasafnið notar til að ákvarða dýpt litar. Meiri litadýpt getur aukið gæði OCR en mun einnig auka þann tíma sem OCR aðgerðinni lýkur.
Tungumál eru þýska, franska, enska, kínverska, japanska og margt fleira. Tungumálapakkar sérfræðinga eru til fyrir vegabréf MRZ, MICR eftirlit, fjárhagsleg gögn, númeraplötur og margt fleira. Þú getur líka notað hvaða ".traineddata" skjal sem er - - þar á meðal þær sem þú býrð til sjálfur.
Dæmi um tungumál
Notkun annarra OCR tungumála.
using IronOcr;// Þú þarft að setja IronOcr.Languages.Arabic upp í verkefnið með NuGetvarOcr = new IronTesseract();Ocr.Language = OcrLanguage.Arabic;using (var input = new OcrInput()){ // Bætir við arabísku myndinni í inntak input.AddImage("img/arabic.gif"); // Bættu við myndasíum ef þörf er á // Jafnvel þótt inntak sé lítil gæði þá getur IronTesseract lesið það varResult = Ocr.Read(input); // Stjórnborðið getur ekki prentað arabísku á Windows auðveldlega. // Vista í skrá í staðinn.Result.SaveAsTextFile("arabic.txt");}
using IronOcr;
// Þú þarft að setja IronOcr.Languages.Arabic upp í verkefnið með NuGet
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Arabic;
using (var input = new OcrInput())
{
// Bætir við arabísku myndinni í inntak
input.AddImage("img/arabic.gif");
// Bættu við myndasíum ef þörf er á
// Jafnvel þótt inntak sé lítil gæði þá getur IronTesseract lesið það
var Result = Ocr.Read(input);
// Stjórnborðið getur ekki prentað arabísku á Windows auðveldlega.
// Vista í skrá í staðinn.
Result.SaveAsTextFile("arabic.txt");
}
ImportsIronOcr' Þú þarft að setja IronOcr.Languages.Arabic upp í verkefnið með NuGetPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.ArabicUsing input = New OcrInput() ' Bætir við arabísku myndinni í inntak input.AddImage("img/arabic.gif") ' Bættu við myndasíum ef þörf er á ' Jafnvel þótt inntak sé lítil gæði þá getur IronTesseract lesið það DimResult = Ocr.Read(input) ' Stjórnborðið getur ekki prentað arabísku á Windows auðveldlega. ' Vista í skrá í staðinn.Result.SaveAsTextFile("arabic.txt")EndUsing
Imports IronOcr
' Þú þarft að setja IronOcr.Languages.Arabic upp í verkefnið með NuGet
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Arabic
Using input = New OcrInput()
' Bætir við arabísku myndinni í inntak
input.AddImage("img/arabic.gif")
' Bættu við myndasíum ef þörf er á
' Jafnvel þótt inntak sé lítil gæði þá getur IronTesseract lesið það
Dim Result = Ocr.Read(input)
' Stjórnborðið getur ekki prentað arabísku á Windows auðveldlega.
' Vista í skrá í staðinn.
Result.SaveAsTextFile("arabic.txt")
End Using
Dæmi um mörg tungumál
Það er einnig mögulegt að nota OCR á mörgum tungumálum samtímis. Þetta getur virkilega hjálpað til við að fá lýsigögn og slóðir á ensku í Unicode skjölum.
using IronOcr;// Þú þarft að setja IronOcr.Languages.ChineseSimplified upp í verkefnið með NuGetvarOcr = new IronTesseract();Ocr.Language = OcrLanguage.ChineseSimplified;Ocr.AddSecondaryLanguage(OcrLanguage.Icelandic);// Við getum bætt við hvaða tungumáli sem erusing (var input = new OcrInput()){ input.Add("multi-language.pdf"); varResult = Ocr.Read(input); // Geymir niðurstöðurnar sem textaskráResult.SaveAsTextFile("results.txt");}
using IronOcr;
// Þú þarft að setja IronOcr.Languages.ChineseSimplified upp í verkefnið með NuGet
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.ChineseSimplified;
Ocr.AddSecondaryLanguage(OcrLanguage.Icelandic);
// Við getum bætt við hvaða tungumáli sem er
using (var input = new OcrInput())
{
input.Add("multi-language.pdf");
var Result = Ocr.Read(input);
// Geymir niðurstöðurnar sem textaskrá
Result.SaveAsTextFile("results.txt");
}
ImportsIronOcr' Þú þarft að setja IronOcr.Languages.ChineseSimplified upp í verkefnið með NuGetPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.ChineseSimplifiedOcr.AddSecondaryLanguage(OcrLanguage.Icelandic)' Við getum bætt við hvaða tungumáli sem erUsing input = New OcrInput() input.Add("multi-language.pdf") DimResult = Ocr.Read(input) ' Geymir niðurstöðurnar sem textaskráResult.SaveAsTextFile("results.txt")EndUsing
Imports IronOcr
' Þú þarft að setja IronOcr.Languages.ChineseSimplified upp í verkefnið með NuGet
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.ChineseSimplified
Ocr.AddSecondaryLanguage(OcrLanguage.Icelandic)
' Við getum bætt við hvaða tungumáli sem er
Using input = New OcrInput()
input.Add("multi-language.pdf")
Dim Result = Ocr.Read(input)
' Geymir niðurstöðurnar sem textaskrá
Result.SaveAsTextFile("results.txt")
End Using
Ítarlegir hlutir OCR niðurstaðna
IronOCR skilar OCR niðurstöðu hlut fyrir hverja OCR aðgerð. Almennt nota forritarar aðeins textaeiginleika þessa hlutar til að fá textann skannaðan frá myndinni. OCR niðurstöður DOM eru þó miklu lengra komnar en þetta.
using IronOcr;using System.Drawing; // Bætir við kerfisritunar samkomutilvísunvarOcr = new IronTesseract();Ocr.Language = OcrLanguage.Icelandic;// Velur vélarstillingu fyrir TesseractOcr.Configuration.EngineMode = TesseractEngineMode.TesseractAndLstm;Ocr.Configuration.ReadBarCodes = true; // Mikilvægt að lesa strikamerkiusing (varInput = new OcrInput(@"images\sample.tiff")){ OcrResultResult = Ocr.Read(Input); varPages = Result.Pages; varWords = Pages[0].Words; varBarcodes = Result.Barcodes; // Kannaðu hér til að finna gríðarlegt, ítarlegt forritaskil: // - Síður, kubbar, paraphaphs, línur, orð, stafir // - Útflutningur mynda, leturhnit, tölfræðileg gögn}
using IronOcr;
using System.Drawing; // Bætir við kerfisritunar samkomutilvísun
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Icelandic;
// Velur vélarstillingu fyrir Tesseract
Ocr.Configuration.EngineMode = TesseractEngineMode.TesseractAndLstm;
Ocr.Configuration.ReadBarCodes = true; // Mikilvægt að lesa strikamerki
using (var Input = new OcrInput(@"images\sample.tiff"))
{
OcrResult Result = Ocr.Read(Input);
var Pages = Result.Pages;
var Words = Pages[0].Words;
var Barcodes = Result.Barcodes;
// Kannaðu hér til að finna gríðarlegt, ítarlegt forritaskil:
// - Síður, kubbar, paraphaphs, línur, orð, stafir
// - Útflutningur mynda, leturhnit, tölfræðileg gögn
}
ImportsIronOcrImportsSystem.Drawing' Bætir við kerfisritunar samkomutilvísunPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.Icelandic' Velur vélarstillingu fyrir TesseractOcr.Configuration.EngineMode = TesseractEngineMode.TesseractAndLstmOcr.Configuration.ReadBarCodes = True ' Mikilvægt að lesa strikamerkiUsingInput = New OcrInput("images\sample.tiff") DimResultAsOcrResult = Ocr.Read(Input) DimPages = Result.Pages DimWords = Pages(0).Words DimBarcodes = Result.Barcodes ' Kannaðu hér til að finna gríðarlegt, ítarlegt forritaskil: ' - Síður, kubbar, paraphaphs, línur, orð, stafir ' - Útflutningur mynda, leturhnit, tölfræðileg gögnEndUsing
Imports IronOcr
Imports System.Drawing ' Bætir við kerfisritunar samkomutilvísun
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Icelandic
' Velur vélarstillingu fyrir Tesseract
Ocr.Configuration.EngineMode = TesseractEngineMode.TesseractAndLstm
Ocr.Configuration.ReadBarCodes = True ' Mikilvægt að lesa strikamerki
Using Input = New OcrInput("images\sample.tiff")
Dim Result As OcrResult = Ocr.Read(Input)
Dim Pages = Result.Pages
Dim Words = Pages(0).Words
Dim Barcodes = Result.Barcodes
' Kannaðu hér til að finna gríðarlegt, ítarlegt forritaskil:
' - Síður, kubbar, paraphaphs, línur, orð, stafir
' - Útflutningur mynda, leturhnit, tölfræðileg gögn
End Using
Frammistaða
IronOCR vinnur út úr kassanum án þess að þurfa að stilla flutning eða breyta verulega inntaksmyndum.
Hraði er að loga: IronOCR.2020+ er allt að 10 sinnum hraðari og gerir yfir 250% færri villur en fyrri smíði.
Læra meira
Til að læra meira um OCR í C#, VB, F# eða einhverju öðru .NET tungumáli, vinsamlegast lestu námskeið okkar í samfélaginu, sem gefa raunveruleg dæmi um heiminn um hvernig hægt er að nota IronOCR og geta sýnt blæbrigði hvernig á að fá sem best út úr þetta bókasafn.
커티스 차우는 칼턴 대학교에서 컴퓨터 과학 학사 학위를 취득했으며, Node.js, TypeScript, JavaScript, React를 전문으로 하는 프론트엔드 개발자입니다. 직관적이고 미적으로 뛰어난 사용자 인터페이스를 만드는 데 열정을 가진 그는 최신 프레임워크를 활용하고, 잘 구성되고 시각적으로 매력적인 매뉴얼을 제작하는 것을 즐깁니다.