<meta http-equiv="content-language" content="lv" />
# Latvijas OCR C# un .NET
###### Citas šī dokumenta versijas:
- [Angļu (This Page in English)](/csharp/ocr/languages/latvian/)
- [Vairāk Languages](/csharp/ocr/languages/)
IronOCR ir C# programmatūras komponents, kas ļauj .NET kodētājiem lasīt tekstu no attēliem un PDF dokumentiem 126 valodās, ieskaitot latviešu valodu.
Tā ir uzlabota Tesseract dakša, kas paredzēta tikai .NET izstrādātājiem un regulāri pārspēj citus Tesseract dzinējus gan ātruma, gan precizitātes ziņā.
## IronOCR saturs. Valodas. Latviešu
Šajā paketē ir 46 OCR valodas .NET:
- Latvietis
- LatvianLabākais
- LatvianFast
## Lejupielādēt
Latviešu valodas pakete [latviešu valoda]
* Download as [Zip](/csharp/ocr/packages/language-packs/Latvian.ocrdata.zip) <i class='fas fa-download'></i><br/>
* Install with [NuGet](https://www.nuget.org/packages/IronOcr.Languages.Latvian/) <i class='nuget-icon'></i>
## Uzstādīšana
Pirmā lieta, kas mums jādara, ir instalēt mūsu **latviešu** OCR pakotni jūsu .NET projektā.
```shell
:InstallCmd Install-Package IronOcr.Languages.Latvian
```
## Kodu piemērs
Šis C# koda piemērs lasa latviešu valodas tekstu no attēla vai PDF dokumenta.
```csharp
// PM> Install-Package IronOcr.Languages.Latvian
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Latvian;
using (var Input = new OcrInput(@"images\Latvian.png"))
{
var Result = Ocr.Read(Input);
// Getting the recognized text
var AllText = Result.Text;
}
```
## Kāpēc izvēlēties IronOCR?
IronOCR ir viegli instalējama, pilnīga un labi dokumentēta .NET programmatūras bibliotēka.
Izvēlieties IronOCR, lai sasniegtu **99,8% + OCR precizitāti**, neizmantojot nekādus ārējos tīmekļa pakalpojumus, pastāvīgas maksas vai konfidenciālu dokumentu sūtīšanu internetā.
#### Kāpēc C# izstrādātāji izvēlas IronOCR, nevis Vanilla Tesseract:
- Instalējiet kā vienu DLL vai NuGet
- Komplektā Tesseract 5, 4 un 3 dzinēji ārpus kastes
- Precizitāte **99,8%** ievērojami pārspēj parasto Tesseract
- Blazing Speed un MultiThreading
- Saderīgs ar MVC, WebApp, darbvirsmu, konsoli un servera lietojumprogrammām
- Nav Exes vai C++ koda, ar kuru strādāt
- Pilna PDF OCR atbalsts
- Lai veiktu OCR gandrīz jebkuru attēla failu vai PDF failu
- Pilns .NET Core, Standard un Framework atbalsts
- Izvietojiet operētājsistēmās Windows, Mac, Linux, Azure, Docker, Lambda, AWS
- Lasiet svītrkodus un QR kodus
- Eksportēt OCR uz XHTML
- Eksportējiet OCR uz meklējamajiem PDF dokumentiem
- Vairāku pavedienu atbalsts
- 126 starptautiskās valodas, kuras visas tiek pārvaldītas, izmantojot NuGet vai OcrData failus
- Izvilkt attēlus, koordinātas, statistiku un fontus. Ne tikai tekstu
- Var izmantot Tesseract OCR izplatīšanai komerciālās un patentētās lietojumprogrammās.
_Dzelzs OCR spīd, strādājot ar reālās pasaules attēliem un nepilnīgiem dokumentiem, piemēram, fotogrāfijām vai zemas izšķirtspējas skenējumiem, kuriem var būt digitāls troksnis vai nepilnības._
Citas [bezmaksas OCR](/csharp/ocr/use-case/free-ocr-csharp/) bibliotēkas .NET platformai, piemēram, citas .NET Tesseract API un tīmekļa pakalpojumi, šajos reālās pasaules lietošanas gadījumos nedarbojas tik labi.
## OCR ar Tesseract 5 - sāciet kodēšanu C#
Zemāk redzamais koda paraugs parāda, cik viegli ir lasīt tekstu no attēla, izmantojot C# vai VB .NET.
### OneLiner
```csharp
string Text = new IronTesseract().Read(@"img\Screenshot.png").Text;
```
### Konfigurējama Hello World
```csharp
// PM> Install-Package IronOcr.Languages.Latvian
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Latvian;
using (var Input = new OcrInput())
{
Input.AddImage("images/sample.jpeg");
// ... jūs varat pievienot jebkuru attēlu skaitu
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
```
### C# PDF OCR
To pašu pieeju līdzīgi var izmantot, lai izvilktu tekstu no jebkura PDF dokumenta.
```csharp
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Latvian;
using (var input = new OcrInput())
{
input.AddPdf("example.pdf", "password"); // Mēs varam arī atlasīt OCR noteiktus PDF lapu numurus
var Result = Ocr.Read(input);
Console.WriteLine(Result.Text);
Console.WriteLine($"{Result.Pages.Count()} Pages");
// 1 lapa katrai PDF lappusei
}
```
### OCR daudzlapu TIFF
OCR TIFF faila formāta lasīšana, ieskaitot vairāku lapu dokumentus. TIFF var arī pārveidot tieši PDF failā ar meklējamu tekstu.
```csharp
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Latvian;
using (var Input = new OcrInput())
{
Input.AddMultiFrameTiff("multi-frame.tiff");
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
```
### Svītrkodi un QR
IronOCR unikālā iezīme ir tā, ka tā var lasīt svītrkodus un QR kodus no dokumentiem, kamēr tas skenē tekstu. `OcrResult.OcrBarcode` klases gadījumi sniedz izstrādātājam detalizētu informāciju par katru skenēto svītrkodu.
```csharp
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Configuration.ReadBarCodes = true;
using (var input = new OcrInput())
{
input.AddImage("img/Barcode.png");
var Result = Ocr.Read(input);
foreach (var Barcode in Result.Barcodes)
{
Console.WriteLine(Barcode.Value);
// veida un atrašanās vietas īpašības arī pakļautas
}
}
```
### OCR par konkrētām attēlu jomām
Visas IronOCR skenēšanas un lasīšanas metodes nodrošina iespēju precīzi norādīt, no kuras lapas vai lapām mēs vēlamies lasīt tekstu. Tas ir ļoti noderīgi, ja mēs skatāmies uz standartizētām veidlapām, un tas var ietaupīt ļoti daudz laika un uzlabot efektivitāti.
Lai izmantotu apgriešanas reģionus, mums būs jāpievieno sistēmas atsauce uz `System.Drawing`, lai mēs varētu izmantot objektu `System.Drawing.Rectangle`.
```csharp
using IronOcr;
using System.Drawing;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Latvian;
using (var Input = new OcrInput())
{
var ContentArea = new Rectangle { X = 215, Y = 1250, Height = 280, Width = 1335 };
// Izmēri ir pikseļos
Input.Add("document.png", ContentArea);
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
```
### OCR zemas kvalitātes skenēšanai
Dzelzs OCR `OcrInput` klase var izlabot skenējumus, kurus parasts Tesseract nevar lasīt.
```csharp
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Latvian;
using (var Input = new OcrInput(@"img\Potter.LowQuality.tiff"))
{
Input.DeNoise(); // novērš digitālo troksni un slikto skenēšanu
Input.Deskew(); // fiksē rotāciju un perspektīvu
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
```
### Eksportēt OCR rezultātus kā meklējamu PDF failu
Attēls uz PDF ar kopējamām teksta virknēm. To var indeksēt meklētājprogrammas un datu bāzes.
```csharp
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Latvian;
using (var Input = new OcrInput())
{
Input.Title = "Quarterly Report";
Input.AddImage("image1.jpeg");
Input.AddImage("image2.png");
Input.AddImage("image3.gif");
var Result = Ocr.Read(Input);
Result.SaveAsSearchablePdf("searchable.pdf");
}
```
### TIFF uz meklējamu PDF reklāmguvumu
Konvertējiet TIFF dokumentu (vai jebkuru attēlu failu grupu) tieši uz meklējamu PDF failu, kuru var indeksēt iekštīkls, vietne un google meklētājprogrammas.
```csharp
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Latvian;
using (var Input = new OcrInput())
{
Input.AddMultiFrameTiff("example.tiff");
var Result = Ocr.Read(Input);
Result.SaveAsSearchablePdf("searchable.pdf");
}
```
### Eksportēt OCR rezultātus kā HTML
OCR attēla pārveidošana par XHTML.
```csharp
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Latvian;
using (var Input = new OcrInput())
{
Input.Title = "Html Title";
Input.AddImage("image1.jpeg");
var Result = Ocr.Read(Input);
Result.SaveAsHocrFile("results.html");
}
```
## OCR attēlu uzlabošanas filtri
IronOCR nodrošina unikālus filtrus `OcrInput` objektiem, lai uzlabotu OCR veiktspēju.
### Attēla uzlabošanas koda piemērs
Uzlabo OCR ievades attēlu kvalitāti, lai iegūtu labākus un ātrākus OCR rezultātus.
```csharp
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Latvian;
using (var Input = new OcrInput(@"LowQuality.jpeg"))
{
Input.DeNoise(); // novērš digitālo troksni un slikto skenēšanu
Input.Deskew(); // fiksē rotāciju un perspektīvu
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
```
### OCR attēlu filtru saraksts
IronOCR iebūvētie ievades filtri OCR veiktspējas uzlabošanai ietver:
- **OcrInput.Rotate (dubultgrādi)** - pagriež attēlus par grādiem vairāk pulksteņrādītāja virzienā. Pretēji pulksteņrādītāja virzienam izmantojiet negatīvos skaitļus.
- **OcrInput.Binarize ()** - Šis attēla filtrs katru pikseļu padara melnu vai baltu bez vidusceļa. Var uzlabot OCR veiktspējas gadījumus ar ļoti zemu teksta un fona kontrastu.
- **OcrInput.ToGrayScale ()** - Šis attēlu filtrs katru pikseļu pārvērš par pelēktoņu nokrāsu. Maz ticams, ka tas uzlabos OCR precizitāti, bet var uzlabot ātrumu.
- **OcrInput.Contrast ()** - automātiski palielina kontrastu. Šis filtrs bieži uzlabo OCR ātrumu un precizitāti skenējot ar zemu kontrastu.
- **OcrInput.DeNoise ()** - noņem digitālo troksni. Šis filtrs jāizmanto tikai tur, kur ir paredzams troksnis.
- **OcrInput.Invert ()** - **pārvērš** visas krāsas. Piemēram, balts kļūst melns: melns kļūst balts.
- **OcrInput.Dilate ()** - uzlabotā morfoloģija. *Paplašināšana* pievieno pikseļus attēla objektu robežām. Pretī Erodei
- **OcrInput.Erode ()** - uzlabotā morfoloģija. *Erozijas rezultātā tiek* noņemti pikseļi uz objekta robežām.
- **OcrInput.Deskew ()** - pagriež attēlu, lai tas būtu pareizais ceļš uz augšu un ortogonāls. Tas ir ļoti noderīgi OCR, jo Tesseract pielaide šķībiem skenējumiem var būt pat 5 grādi.
- **OcrInput.DeepCleanBackgroundNoise ()** - **spēcīga** fona trokšņu noņemšana. Izmantojiet šo filtru tikai gadījumā, ja ir zināms ārkārtējs dokumenta fona troksnis, jo šis filtrs var arī samazināt tīru dokumentu OCR precizitāti un ir ļoti dārgs CPU.
- **OcrInput.EnhanceResolution** - uzlabo zemas kvalitātes attēlu izšķirtspēju. Šis filtrs nav bieži nepieciešams, jo *OcrInput.MinimumDPI* un *OcrInput.TargetDPI* automātiski *uztvers* un atrisinās zemas izšķirtspējas ievades.
**CleanBackgroundNoise.** Šis iestatījums ir nedaudz laikietilpīgs; tomēr tas ļauj bibliotēkai automātiski iztīrīt digitālo attēlu, papīra saburzīšanos un citas nepilnības digitālajā attēlā, kas citādi padarītu to nespēju lasīt citās OCR bibliotēkās.
**EnhanceContrast** ir iestatījums, kas liek dzelzs OCR automātiski palielināt teksta kontrastu uz attēla fona, palielinot OCR precizitāti un kopumā palielinot OCR veiktspēju un ātrumu.
**EnhanceResolution** ir iestatījums, kas automātiski noteiks zemas izšķirtspējas attēlus (kuru izšķirtspēja ir mazāka par 275 dpi), automātiski paaugstinās attēla līmeni un pēc tam asinās visu tekstu, lai OCR bibliotēka to varētu pilnīgi nolasīt. Lai gan šī darbība pati par sevi ir laikietilpīga, tā parasti samazina kopējo laiku OCR darbībai ar attēlu.
**Valodas** dzelzs OCR atbalsta 22 starptautiskus valodu pakotnes, un valodas iestatījumu var izmantot, lai izvēlētos vienu vai vairākas valodas, kas jāpiemēro OCR darbībai.
**Stratēģija** IronOCR atbalsta divas stratēģijas. Mēs varam izvēlēties vai nu veikt ātru un mazāk precīzu dokumenta skenēšanu, vai arī izmantot uzlabotu stratēģiju, kas izmanto dažus mākslīgā intelekta modeļus, lai automātiski uzlabotu OCR teksta precizitāti, teikumā aplūkojot vārdu statistiskās attiecības savā starpā.
**ColorSpace** ir iestatījums, ar kuru mēs varam izvēlēties OCR pelēktoņos vai krāsās. Parasti pelēktoņu nokrāsa ir labākais risinājums. Tomēr dažreiz, ja ir teksti vai foni ar līdzīgu nokrāsu, bet ļoti atšķirīgu krāsu, pilnkrāsu krāsu telpa nodrošinās labākus rezultātus.
**DetectWhiteTextOnDarkBackgrounds.** Parasti visas OCR bibliotēkas sagaida melnu tekstu uz balta fona. Šis iestatījums ļauj IronOCR automātiski noteikt negatīvus vai tumšas lapas ar baltu tekstu un tās nolasīt.
**InputImageType.** Šis iestatījums ļauj izstrādātājam vadīt OCR bibliotēku par to, vai tā skata pilnu dokumentu vai fragmentu, piemēram, ekrānuzņēmumu.
**RotateAndStraighten** ir uzlabots iestatījums, kas ļauj IronOCR unikālai spējai lasīt dokumentus, kas ir ne tikai pagriezti, bet varbūt satur perspektīvu, piemēram, teksta dokumentu fotogrāfijas.
**ReadBarcodes** ir noderīga funkcija, kas ļauj IronOCR automātiski lasīt svītrkodus un QR kodus lapās, jo tas arī lasa tekstu, nepievienojot lielu papildu laika slogu.
**KrāsaDziļums.** Šis iestatījums nosaka, cik bitu vienā pikseļā OCR bibliotēka izmantos, lai noteiktu krāsas dziļumu. Lielāks krāsu dziļums var uzlabot OCR kvalitāti, bet arī palielinās laiku, kas nepieciešams OCR darbības pabeigšanai.
## 126 valodu pakotnes
IronOCR atbalsta **126 starptautiskās valodas,** izmantojot valodu pakotnes, kuras tiek izplatītas kā DLL, kuras var [lejupielādēt no šīs vietnes](/csharp/ocr/languages/) vai arī no [NuGet Package Manager](https://www.nuget.org/packages?q=IronOcr.Languages).
Valodas ietver vācu, franču, angļu, ķīniešu, japāņu un daudzas citas. Speciālistu valodu pakotnes ir paredzētas MRZ pasēm, MICR pārbaudēm, finanšu datiem, numurzīmēm un daudzām citām. Varat arī izmantot jebkuru Tesseract ".traineddata" failu, ieskaitot tos, kurus pats izveidojāt.
### Valodas piemērs
Citu OCR valodu izmantošana.
```csharp
// using IronOcr;
// PM> Install IronOcr.Languages.Arabic
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Arabic;
using (var input = new OcrInput())
{
input.AddImage("img/arabic.gif");
// Ja nepieciešams, pievienojiet attēlu filtrus
// Šajā gadījumā pat domu ievadīšana ir ļoti zemas kvalitātes
// IronTesseract var izlasīt to, ko nevar tradicionālais Tesseract.
var Result = Ocr.Read(input);
// Konsole nevar viegli izdrukāt arābu valodu operētājsistēmā Windows.
// Tā vietā saglabāsim diskā.
Result.SaveAsTextFile("arabic.txt");
}
```
### Vairāku valodu piemērs
Ir iespējams arī OCR izmantot vienlaikus vairākas valodas. Tas patiešām var palīdzēt iegūt angļu valodas metadatus un URL unikoda dokumentos.
```csharp
// using IronOcr;
// PM> Install IronOcr.Languages.ChineseSimplified
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.ChineseSimplified;
Ocr.AddSecondaryLanguage(OcrLanguage.Latvian);
// Mēs varam pievienot jebkuru valodu skaitu
using (var input = new OcrInput())
{
input.Add("multi-language.pdf");
var Result = Ocr.Read(input);
Result.SaveAsTextFile("results.txt");
}
```
## Detalizēti OCR rezultātu objekti
IronOCR atgriež OCR rezultātu objektu katrai OCR operācijai. Parasti izstrādātāji šī objekta teksta rekvizītu izmanto tikai, lai tekstu skenētu no attēla. Tomēr OCR rezultāti DOM ir daudz progresīvāks nekā šis.
```csharp
using IronOcr;
using System.Drawing; //Pievienot montāžas atsauci
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Latvian;
Ocr.Configuration.EngineMode = TesseractEngineMode.TesseractAndLstm;
Ocr.Configuration.ReadBarCodes = true; //!Svarīgs
using (var Input = new OcrInput(@"images\sample.tiff"))
{
OcrResult Result = Ocr.Read(Input);
var Pages = Result.Pages;
var Words = Pages[0].Words;
var Barcodes = Result.Barcodes;
// Izpētiet šeit, lai atrastu masīvu, detalizētu API:
// - lapas, bloki, parafafi, rindas, vārdi, rakstzīmes
// - Attēlu eksportēšana, Fontu koordinātas, Statistikas dati
}
```
## Izrāde
IronOCR darbojas ārpus kastes, un nav nepieciešams pielāgot vai stipri pārveidot ievades attēlus.
Ātrums ir degošs: IronOCR.2020 + ir līdz pat 10 reizēm ātrāks un pieļauj vairāk nekā 250% mazāk kļūdu nekā iepriekšējie būvējumi.
## Uzzināt vairāk
Lai uzzinātu vairāk par OCR C#, VB, F# vai jebkurā citā .NET valodā, lūdzu, [izlasiet mūsu kopienas apmācības](/csharp/ocr/tutorials/how-to-read-text-from-an-image-in-csharp-net/), kurās sniegti reālas pasaules piemēri, kā var izmantot IronOCR, un var parādīt nianses, kā vislabāk izmantot šī bibliotēka.
Ir pieejama arī pilnīga [atsauce uz .NET izstrādātājiem](/csharp/ocr/object-reference/api/).
IronOCR ir C# programmatūras komponents, kas ļauj .NET kodētājiem lasīt tekstu no attēliem un PDF dokumentiem 126 valodās, ieskaitot latviešu valodu.
Tā ir uzlabota Tesseract dakša, kas paredzēta tikai .NET izstrādātājiem un regulāri pārspēj citus Tesseract dzinējus gan ātruma, gan precizitātes ziņā.
Pirmā lieta, kas mums jādara, ir instalēt mūsu latviešu OCR pakotni jūsu .NET projektā.
PM > Install-Package IronOcr.Languages.Latvian
Install-Package IronOcr.Languages.Latvian
Kodu piemērs
Šis C# koda piemērs lasa latviešu valodas tekstu no attēla vai PDF dokumenta.
// PM> Install-Package IronOcr.Languages.Latvianusing IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Latvian;using (varInput = new OcrInput(@"images\Latvian.png")){ varResult = Ocr.Read(Input); // Getting the recognized text varAllText = Result.Text;}
// PM> Install-Package IronOcr.Languages.Latvian
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Latvian;
using (var Input = new OcrInput(@"images\Latvian.png"))
{
var Result = Ocr.Read(Input);
// Getting the recognized text
var AllText = Result.Text;
}
' PM> Install-Package IronOcr.Languages.LatvianImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.LatvianUsingInput = New OcrInput("images\Latvian.png") DimResult = Ocr.Read(Input) ' Getting the recognized text DimAllText = Result.TextEndUsing
' PM> Install-Package IronOcr.Languages.Latvian
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Latvian
Using Input = New OcrInput("images\Latvian.png")
Dim Result = Ocr.Read(Input)
' Getting the recognized text
Dim AllText = Result.Text
End Using
Kāpēc izvēlēties IronOCR?
IronOCR ir viegli instalējama, pilnīga un labi dokumentēta .NET programmatūras bibliotēka.
Izvēlieties IronOCR, lai sasniegtu 99,8% + OCR precizitāti, neizmantojot nekādus ārējos tīmekļa pakalpojumus, pastāvīgas maksas vai konfidenciālu dokumentu sūtīšanu internetā.
Kāpēc C# izstrādātāji izvēlas IronOCR, nevis Vanilla Tesseract:
Instalējiet kā vienu DLL vai NuGet
Komplektā Tesseract 5, 4 un 3 dzinēji ārpus kastes
Precizitāte 99,8% ievērojami pārspēj parasto Tesseract
Blazing Speed un MultiThreading
Saderīgs ar MVC, WebApp, darbvirsmu, konsoli un servera lietojumprogrammām
Nav Exes vai C++ koda, ar kuru strādāt
Pilna PDF OCR atbalsts
Lai veiktu OCR gandrīz jebkuru attēla failu vai PDF failu
126 starptautiskās valodas, kuras visas tiek pārvaldītas, izmantojot NuGet vai OcrData failus
Izvilkt attēlus, koordinātas, statistiku un fontus. Ne tikai tekstu
Var izmantot Tesseract OCR izplatīšanai komerciālās un patentētās lietojumprogrammās.
Dzelzs OCR spīd, strādājot ar reālās pasaules attēliem un nepilnīgiem dokumentiem, piemēram, fotogrāfijām vai zemas izšķirtspējas skenējumiem, kuriem var būt digitāls troksnis vai nepilnības.
Citas bezmaksas OCR bibliotēkas .NET platformai, piemēram, citas .NET Tesseract API un tīmekļa pakalpojumi, šajos reālās pasaules lietošanas gadījumos nedarbojas tik labi.
OCR ar Tesseract 5 - sāciet kodēšanu C#
Zemāk redzamais koda paraugs parāda, cik viegli ir lasīt tekstu no attēla, izmantojot C# vai VB .NET.
OneLiner
stringText = new IronTesseract().Read(@"img\Screenshot.png").Text;
string Text = new IronTesseract().Read(@"img\Screenshot.png").Text;
DimTextAsString = (New IronTesseract()).Read("img\Screenshot.png").Text
Dim Text As String = (New IronTesseract()).Read("img\Screenshot.png").Text
Konfigurējama Hello World
// PM> Install-Package IronOcr.Languages.Latvianusing IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Latvian;using (varInput = new OcrInput()){Input.AddImage("images/sample.jpeg"); // ... jūs varat pievienot jebkuru attēlu skaitu varResult = Ocr.Read(Input);Console.WriteLine(Result.Text);}
// PM> Install-Package IronOcr.Languages.Latvian
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Latvian;
using (var Input = new OcrInput())
{
Input.AddImage("images/sample.jpeg");
// ... jūs varat pievienot jebkuru attēlu skaitu
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
' PM> Install-Package IronOcr.Languages.LatvianImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.LatvianUsingInput = New OcrInput()Input.AddImage("images/sample.jpeg") ' ... jūs varat pievienot jebkuru attēlu skaitu DimResult = Ocr.Read(Input)Console.WriteLine(Result.Text)EndUsing
' PM> Install-Package IronOcr.Languages.Latvian
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Latvian
Using Input = New OcrInput()
Input.AddImage("images/sample.jpeg")
' ... jūs varat pievienot jebkuru attēlu skaitu
Dim Result = Ocr.Read(Input)
Console.WriteLine(Result.Text)
End Using
C# PDF OCR
To pašu pieeju līdzīgi var izmantot, lai izvilktu tekstu no jebkura PDF dokumenta.
using IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Latvian;using (var input = new OcrInput()){ input.AddPdf("example.pdf", "password"); // Mēs varam arī atlasīt OCR noteiktus PDF lapu numurus varResult = Ocr.Read(input);Console.WriteLine(Result.Text);Console.WriteLine($"{Result.Pages.Count()} Pages"); // 1 lapa katrai PDF lappusei}
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Latvian;
using (var input = new OcrInput())
{
input.AddPdf("example.pdf", "password"); // Mēs varam arī atlasīt OCR noteiktus PDF lapu numurus
var Result = Ocr.Read(input);
Console.WriteLine(Result.Text);
Console.WriteLine($"{Result.Pages.Count()} Pages");
// 1 lapa katrai PDF lappusei
}
ImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.LatvianUsing input = New OcrInput() input.AddPdf("example.pdf", "password") ' Mēs varam arī atlasīt OCR noteiktus PDF lapu numurus DimResult = Ocr.Read(input)Console.WriteLine(Result.Text)Console.WriteLine($"{Result.Pages.Count()} Pages") ' 1 lapa katrai PDF lappuseiEndUsing
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Latvian
Using input = New OcrInput()
input.AddPdf("example.pdf", "password") ' Mēs varam arī atlasīt OCR noteiktus PDF lapu numurus
Dim Result = Ocr.Read(input)
Console.WriteLine(Result.Text)
Console.WriteLine($"{Result.Pages.Count()} Pages")
' 1 lapa katrai PDF lappusei
End Using
OCR daudzlapu TIFF
OCR TIFF faila formāta lasīšana, ieskaitot vairāku lapu dokumentus. TIFF var arī pārveidot tieši PDF failā ar meklējamu tekstu.
using IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Latvian;using (varInput = new OcrInput()){Input.AddMultiFrameTiff("multi-frame.tiff"); varResult = Ocr.Read(Input);Console.WriteLine(Result.Text);}
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Latvian;
using (var Input = new OcrInput())
{
Input.AddMultiFrameTiff("multi-frame.tiff");
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
ImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.LatvianUsingInput = New OcrInput()Input.AddMultiFrameTiff("multi-frame.tiff") DimResult = Ocr.Read(Input)Console.WriteLine(Result.Text)EndUsing
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Latvian
Using Input = New OcrInput()
Input.AddMultiFrameTiff("multi-frame.tiff")
Dim Result = Ocr.Read(Input)
Console.WriteLine(Result.Text)
End Using
Svītrkodi un QR
IronOCR unikālā iezīme ir tā, ka tā var lasīt svītrkodus un QR kodus no dokumentiem, kamēr tas skenē tekstu. OcrResult.OcrBarcode klases gadījumi sniedz izstrādātājam detalizētu informāciju par katru skenēto svītrkodu.
using IronOcr;varOcr = new IronTesseract();Ocr.Configuration.ReadBarCodes = true;using (var input = new OcrInput()){ input.AddImage("img/Barcode.png"); varResult = Ocr.Read(input); foreach (varBarcodeinResult.Barcodes) {Console.WriteLine(Barcode.Value); // veida un atrašanās vietas īpašības arī pakļautas }}
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Configuration.ReadBarCodes = true;
using (var input = new OcrInput())
{
input.AddImage("img/Barcode.png");
var Result = Ocr.Read(input);
foreach (var Barcode in Result.Barcodes)
{
Console.WriteLine(Barcode.Value);
// veida un atrašanās vietas īpašības arī pakļautas
}
}
ImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Configuration.ReadBarCodes = TrueUsing input = New OcrInput() input.AddImage("img/Barcode.png") DimResult = Ocr.Read(input) For EachBarcodeInResult.BarcodesConsole.WriteLine(Barcode.Value) ' veida un atrašanās vietas īpašības arī pakļautas NextBarcodeEndUsing
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Configuration.ReadBarCodes = True
Using input = New OcrInput()
input.AddImage("img/Barcode.png")
Dim Result = Ocr.Read(input)
For Each Barcode In Result.Barcodes
Console.WriteLine(Barcode.Value)
' veida un atrašanās vietas īpašības arī pakļautas
Next Barcode
End Using
OCR par konkrētām attēlu jomām
Visas IronOCR skenēšanas un lasīšanas metodes nodrošina iespēju precīzi norādīt, no kuras lapas vai lapām mēs vēlamies lasīt tekstu. Tas ir ļoti noderīgi, ja mēs skatāmies uz standartizētām veidlapām, un tas var ietaupīt ļoti daudz laika un uzlabot efektivitāti.
Lai izmantotu apgriešanas reģionus, mums būs jāpievieno sistēmas atsauce uz System.Drawing, lai mēs varētu izmantot objektu System.Drawing.Rectangle.
using IronOcr;using System.Drawing;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Latvian;using (varInput = new OcrInput()){ varContentArea = new Rectangle { X = 215, Y = 1250, Height = 280, Width = 1335 }; // Izmēri ir pikseļosInput.Add("document.png", ContentArea); varResult = Ocr.Read(Input);Console.WriteLine(Result.Text);}
using IronOcr;
using System.Drawing;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Latvian;
using (var Input = new OcrInput())
{
var ContentArea = new Rectangle { X = 215, Y = 1250, Height = 280, Width = 1335 };
// Izmēri ir pikseļos
Input.Add("document.png", ContentArea);
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
ImportsIronOcrImportsSystem.DrawingPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.LatvianUsingInput = New OcrInput() DimContentArea = New RectangleWith { .X = 215, .Y = 1250, .Height = 280, .Width = 1335 } ' Izmēri ir pikseļosInput.Add("document.png", ContentArea) DimResult = Ocr.Read(Input)Console.WriteLine(Result.Text)EndUsing
Imports IronOcr
Imports System.Drawing
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Latvian
Using Input = New OcrInput()
Dim ContentArea = New Rectangle With {
.X = 215,
.Y = 1250,
.Height = 280,
.Width = 1335
}
' Izmēri ir pikseļos
Input.Add("document.png", ContentArea)
Dim Result = Ocr.Read(Input)
Console.WriteLine(Result.Text)
End Using
OCR zemas kvalitātes skenēšanai
Dzelzs OCR OcrInput klase var izlabot skenējumus, kurus parasts Tesseract nevar lasīt.
using IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Latvian;using (varInput = new OcrInput(@"img\Potter.LowQuality.tiff")){Input.DeNoise(); // novērš digitālo troksni un slikto skenēšanuInput.Deskew(); // fiksē rotāciju un perspektīvu varResult = Ocr.Read(Input);Console.WriteLine(Result.Text);}
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Latvian;
using (var Input = new OcrInput(@"img\Potter.LowQuality.tiff"))
{
Input.DeNoise(); // novērš digitālo troksni un slikto skenēšanu
Input.Deskew(); // fiksē rotāciju un perspektīvu
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
ImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.LatvianUsingInput = New OcrInput("img\Potter.LowQuality.tiff")Input.DeNoise() ' novērš digitālo troksni un slikto skenēšanuInput.Deskew() ' fiksē rotāciju un perspektīvu DimResult = Ocr.Read(Input)Console.WriteLine(Result.Text)EndUsing
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Latvian
Using Input = New OcrInput("img\Potter.LowQuality.tiff")
Input.DeNoise() ' novērš digitālo troksni un slikto skenēšanu
Input.Deskew() ' fiksē rotāciju un perspektīvu
Dim Result = Ocr.Read(Input)
Console.WriteLine(Result.Text)
End Using
Eksportēt OCR rezultātus kā meklējamu PDF failu
Attēls uz PDF ar kopējamām teksta virknēm. To var indeksēt meklētājprogrammas un datu bāzes.
using IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Latvian;using (varInput = new OcrInput()){Input.Title = "Quarterly Report";Input.AddImage("image1.jpeg");Input.AddImage("image2.png");Input.AddImage("image3.gif"); varResult = Ocr.Read(Input);Result.SaveAsSearchablePdf("searchable.pdf");}
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Latvian;
using (var Input = new OcrInput())
{
Input.Title = "Quarterly Report";
Input.AddImage("image1.jpeg");
Input.AddImage("image2.png");
Input.AddImage("image3.gif");
var Result = Ocr.Read(Input);
Result.SaveAsSearchablePdf("searchable.pdf");
}
ImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.LatvianUsingInput = New OcrInput()Input.Title = "Quarterly Report"Input.AddImage("image1.jpeg")Input.AddImage("image2.png")Input.AddImage("image3.gif") DimResult = Ocr.Read(Input)Result.SaveAsSearchablePdf("searchable.pdf")EndUsing
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Latvian
Using Input = New OcrInput()
Input.Title = "Quarterly Report"
Input.AddImage("image1.jpeg")
Input.AddImage("image2.png")
Input.AddImage("image3.gif")
Dim Result = Ocr.Read(Input)
Result.SaveAsSearchablePdf("searchable.pdf")
End Using
TIFF uz meklējamu PDF reklāmguvumu
Konvertējiet TIFF dokumentu (vai jebkuru attēlu failu grupu) tieši uz meklējamu PDF failu, kuru var indeksēt iekštīkls, vietne un google meklētājprogrammas.
using IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Latvian;using (varInput = new OcrInput()){Input.AddMultiFrameTiff("example.tiff"); varResult = Ocr.Read(Input);Result.SaveAsSearchablePdf("searchable.pdf");}
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Latvian;
using (var Input = new OcrInput())
{
Input.AddMultiFrameTiff("example.tiff");
var Result = Ocr.Read(Input);
Result.SaveAsSearchablePdf("searchable.pdf");
}
ImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.LatvianUsingInput = New OcrInput()Input.AddMultiFrameTiff("example.tiff") DimResult = Ocr.Read(Input)Result.SaveAsSearchablePdf("searchable.pdf")EndUsing
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Latvian
Using Input = New OcrInput()
Input.AddMultiFrameTiff("example.tiff")
Dim Result = Ocr.Read(Input)
Result.SaveAsSearchablePdf("searchable.pdf")
End Using
Eksportēt OCR rezultātus kā HTML
OCR attēla pārveidošana par XHTML.
using IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Latvian;using (varInput = new OcrInput()){Input.Title = "Html Title";Input.AddImage("image1.jpeg"); varResult = Ocr.Read(Input);Result.SaveAsHocrFile("results.html");}
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Latvian;
using (var Input = new OcrInput())
{
Input.Title = "Html Title";
Input.AddImage("image1.jpeg");
var Result = Ocr.Read(Input);
Result.SaveAsHocrFile("results.html");
}
ImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.LatvianUsingInput = New OcrInput()Input.Title = "Html Title"Input.AddImage("image1.jpeg") DimResult = Ocr.Read(Input)Result.SaveAsHocrFile("results.html")EndUsing
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Latvian
Using Input = New OcrInput()
Input.Title = "Html Title"
Input.AddImage("image1.jpeg")
Dim Result = Ocr.Read(Input)
Result.SaveAsHocrFile("results.html")
End Using
OCR attēlu uzlabošanas filtri
IronOCR nodrošina unikālus filtrus OcrInput objektiem, lai uzlabotu OCR veiktspēju.
Attēla uzlabošanas koda piemērs
Uzlabo OCR ievades attēlu kvalitāti, lai iegūtu labākus un ātrākus OCR rezultātus.
using IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Latvian;using (varInput = new OcrInput(@"LowQuality.jpeg")){Input.DeNoise(); // novērš digitālo troksni un slikto skenēšanuInput.Deskew(); // fiksē rotāciju un perspektīvu varResult = Ocr.Read(Input);Console.WriteLine(Result.Text);}
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Latvian;
using (var Input = new OcrInput(@"LowQuality.jpeg"))
{
Input.DeNoise(); // novērš digitālo troksni un slikto skenēšanu
Input.Deskew(); // fiksē rotāciju un perspektīvu
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
ImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.LatvianUsingInput = New OcrInput("LowQuality.jpeg")Input.DeNoise() ' novērš digitālo troksni un slikto skenēšanuInput.Deskew() ' fiksē rotāciju un perspektīvu DimResult = Ocr.Read(Input)Console.WriteLine(Result.Text)EndUsing
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Latvian
Using Input = New OcrInput("LowQuality.jpeg")
Input.DeNoise() ' novērš digitālo troksni un slikto skenēšanu
Input.Deskew() ' fiksē rotāciju un perspektīvu
Dim Result = Ocr.Read(Input)
Console.WriteLine(Result.Text)
End Using
OcrInput.Rotate (dubultgrādi) - pagriež attēlus par grādiem vairāk pulksteņrādītāja virzienā. Pretēji pulksteņrādītāja virzienam izmantojiet negatīvos skaitļus.
OcrInput.Binarize () - Šis attēla filtrs katru pikseļu padara melnu vai baltu bez vidusceļa. Var uzlabot OCR veiktspējas gadījumus ar ļoti zemu teksta un fona kontrastu.
OcrInput.ToGrayScale () - Šis attēlu filtrs katru pikseļu pārvērš par pelēktoņu nokrāsu. Maz ticams, ka tas uzlabos OCR precizitāti, bet var uzlabot ātrumu.
OcrInput.Contrast () - automātiski palielina kontrastu. Šis filtrs bieži uzlabo OCR ātrumu un precizitāti skenējot ar zemu kontrastu.
OcrInput.DeNoise () - noņem digitālo troksni. Šis filtrs jāizmanto tikai tur, kur ir paredzams troksnis.
OcrInput.Invert () - pārvērš visas krāsas. Piemēram, balts kļūst melns: melns kļūst balts.
OcrInput.Dilate () - uzlabotā morfoloģija. Paplašināšana pievieno pikseļus attēla objektu robežām. Pretī Erodei
OcrInput.Erode () - uzlabotā morfoloģija. Erozijas rezultātā tiek noņemti pikseļi uz objekta robežām.
OcrInput.Deskew () - pagriež attēlu, lai tas būtu pareizais ceļš uz augšu un ortogonāls. Tas ir ļoti noderīgi OCR, jo Tesseract pielaide šķībiem skenējumiem var būt pat 5 grādi.
OcrInput.DeepCleanBackgroundNoise () - spēcīga fona trokšņu noņemšana. Izmantojiet šo filtru tikai gadījumā, ja ir zināms ārkārtējs dokumenta fona troksnis, jo šis filtrs var arī samazināt tīru dokumentu OCR precizitāti un ir ļoti dārgs CPU.
OcrInput.EnhanceResolution - uzlabo zemas kvalitātes attēlu izšķirtspēju. Šis filtrs nav bieži nepieciešams, jo OcrInput.MinimumDPI un OcrInput.TargetDPI automātiski uztvers un atrisinās zemas izšķirtspējas ievades.
CleanBackgroundNoise. Šis iestatījums ir nedaudz laikietilpīgs; tomēr tas ļauj bibliotēkai automātiski iztīrīt digitālo attēlu, papīra saburzīšanos un citas nepilnības digitālajā attēlā, kas citādi padarītu to nespēju lasīt citās OCR bibliotēkās.
EnhanceContrast ir iestatījums, kas liek dzelzs OCR automātiski palielināt teksta kontrastu uz attēla fona, palielinot OCR precizitāti un kopumā palielinot OCR veiktspēju un ātrumu.
EnhanceResolution ir iestatījums, kas automātiski noteiks zemas izšķirtspējas attēlus (kuru izšķirtspēja ir mazāka par 275 dpi), automātiski paaugstinās attēla līmeni un pēc tam asinās visu tekstu, lai OCR bibliotēka to varētu pilnīgi nolasīt. Lai gan šī darbība pati par sevi ir laikietilpīga, tā parasti samazina kopējo laiku OCR darbībai ar attēlu.
Valodas dzelzs OCR atbalsta 22 starptautiskus valodu pakotnes, un valodas iestatījumu var izmantot, lai izvēlētos vienu vai vairākas valodas, kas jāpiemēro OCR darbībai.
Stratēģija IronOCR atbalsta divas stratēģijas. Mēs varam izvēlēties vai nu veikt ātru un mazāk precīzu dokumenta skenēšanu, vai arī izmantot uzlabotu stratēģiju, kas izmanto dažus mākslīgā intelekta modeļus, lai automātiski uzlabotu OCR teksta precizitāti, teikumā aplūkojot vārdu statistiskās attiecības savā starpā.
ColorSpace ir iestatījums, ar kuru mēs varam izvēlēties OCR pelēktoņos vai krāsās. Parasti pelēktoņu nokrāsa ir labākais risinājums. Tomēr dažreiz, ja ir teksti vai foni ar līdzīgu nokrāsu, bet ļoti atšķirīgu krāsu, pilnkrāsu krāsu telpa nodrošinās labākus rezultātus.
DetectWhiteTextOnDarkBackgrounds. Parasti visas OCR bibliotēkas sagaida melnu tekstu uz balta fona. Šis iestatījums ļauj IronOCR automātiski noteikt negatīvus vai tumšas lapas ar baltu tekstu un tās nolasīt.
InputImageType. Šis iestatījums ļauj izstrādātājam vadīt OCR bibliotēku par to, vai tā skata pilnu dokumentu vai fragmentu, piemēram, ekrānuzņēmumu.
RotateAndStraighten ir uzlabots iestatījums, kas ļauj IronOCR unikālai spējai lasīt dokumentus, kas ir ne tikai pagriezti, bet varbūt satur perspektīvu, piemēram, teksta dokumentu fotogrāfijas.
ReadBarcodes ir noderīga funkcija, kas ļauj IronOCR automātiski lasīt svītrkodus un QR kodus lapās, jo tas arī lasa tekstu, nepievienojot lielu papildu laika slogu.
KrāsaDziļums. Šis iestatījums nosaka, cik bitu vienā pikseļā OCR bibliotēka izmantos, lai noteiktu krāsas dziļumu. Lielāks krāsu dziļums var uzlabot OCR kvalitāti, bet arī palielinās laiku, kas nepieciešams OCR darbības pabeigšanai.
Valodas ietver vācu, franču, angļu, ķīniešu, japāņu un daudzas citas. Speciālistu valodu pakotnes ir paredzētas MRZ pasēm, MICR pārbaudēm, finanšu datiem, numurzīmēm un daudzām citām. Varat arī izmantot jebkuru Tesseract ".traineddata" failu, ieskaitot tos, kurus pats izveidojāt.
Valodas piemērs
Citu OCR valodu izmantošana.
// using IronOcr;// PM> Install IronOcr.Languages.Arabicusing IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Arabic;using (var input = new OcrInput()){ input.AddImage("img/arabic.gif"); // Ja nepieciešams, pievienojiet attēlu filtrus // Šajā gadījumā pat domu ievadīšana ir ļoti zemas kvalitātes // IronTesseract var izlasīt to, ko nevar tradicionālais Tesseract. varResult = Ocr.Read(input); // Konsole nevar viegli izdrukāt arābu valodu operētājsistēmā Windows. // Tā vietā saglabāsim diskā.Result.SaveAsTextFile("arabic.txt");}
// using IronOcr;
// PM> Install IronOcr.Languages.Arabic
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Arabic;
using (var input = new OcrInput())
{
input.AddImage("img/arabic.gif");
// Ja nepieciešams, pievienojiet attēlu filtrus
// Šajā gadījumā pat domu ievadīšana ir ļoti zemas kvalitātes
// IronTesseract var izlasīt to, ko nevar tradicionālais Tesseract.
var Result = Ocr.Read(input);
// Konsole nevar viegli izdrukāt arābu valodu operētājsistēmā Windows.
// Tā vietā saglabāsim diskā.
Result.SaveAsTextFile("arabic.txt");
}
' using IronOcr;' PM> Install IronOcr.Languages.ArabicImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.ArabicUsing input = New OcrInput() input.AddImage("img/arabic.gif") ' Ja nepieciešams, pievienojiet attēlu filtrus ' Šajā gadījumā pat domu ievadīšana ir ļoti zemas kvalitātes ' IronTesseract var izlasīt to, ko nevar tradicionālais Tesseract. DimResult = Ocr.Read(input) ' Konsole nevar viegli izdrukāt arābu valodu operētājsistēmā Windows. ' Tā vietā saglabāsim diskā.Result.SaveAsTextFile("arabic.txt")EndUsing
' using IronOcr;
' PM> Install IronOcr.Languages.Arabic
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Arabic
Using input = New OcrInput()
input.AddImage("img/arabic.gif")
' Ja nepieciešams, pievienojiet attēlu filtrus
' Šajā gadījumā pat domu ievadīšana ir ļoti zemas kvalitātes
' IronTesseract var izlasīt to, ko nevar tradicionālais Tesseract.
Dim Result = Ocr.Read(input)
' Konsole nevar viegli izdrukāt arābu valodu operētājsistēmā Windows.
' Tā vietā saglabāsim diskā.
Result.SaveAsTextFile("arabic.txt")
End Using
Vairāku valodu piemērs
Ir iespējams arī OCR izmantot vienlaikus vairākas valodas. Tas patiešām var palīdzēt iegūt angļu valodas metadatus un URL unikoda dokumentos.
// using IronOcr;// PM> Install IronOcr.Languages.ChineseSimplifiedusing IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.ChineseSimplified;Ocr.AddSecondaryLanguage(OcrLanguage.Latvian);// Mēs varam pievienot jebkuru valodu skaituusing (var input = new OcrInput()){ input.Add("multi-language.pdf"); varResult = Ocr.Read(input);Result.SaveAsTextFile("results.txt");}
// using IronOcr;
// PM> Install IronOcr.Languages.ChineseSimplified
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.ChineseSimplified;
Ocr.AddSecondaryLanguage(OcrLanguage.Latvian);
// Mēs varam pievienot jebkuru valodu skaitu
using (var input = new OcrInput())
{
input.Add("multi-language.pdf");
var Result = Ocr.Read(input);
Result.SaveAsTextFile("results.txt");
}
' using IronOcr;' PM> Install IronOcr.Languages.ChineseSimplifiedImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.ChineseSimplifiedOcr.AddSecondaryLanguage(OcrLanguage.Latvian)' Mēs varam pievienot jebkuru valodu skaituUsing input = New OcrInput() input.Add("multi-language.pdf") DimResult = Ocr.Read(input)Result.SaveAsTextFile("results.txt")EndUsing
' using IronOcr;
' PM> Install IronOcr.Languages.ChineseSimplified
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.ChineseSimplified
Ocr.AddSecondaryLanguage(OcrLanguage.Latvian)
' Mēs varam pievienot jebkuru valodu skaitu
Using input = New OcrInput()
input.Add("multi-language.pdf")
Dim Result = Ocr.Read(input)
Result.SaveAsTextFile("results.txt")
End Using
Detalizēti OCR rezultātu objekti
IronOCR atgriež OCR rezultātu objektu katrai OCR operācijai. Parasti izstrādātāji šī objekta teksta rekvizītu izmanto tikai, lai tekstu skenētu no attēla. Tomēr OCR rezultāti DOM ir daudz progresīvāks nekā šis.
using IronOcr;
using System.Drawing; //Pievienot montāžas atsauci
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Latvian;
Ocr.Configuration.EngineMode = TesseractEngineMode.TesseractAndLstm;
Ocr.Configuration.ReadBarCodes = true; //!Svarīgs
using (var Input = new OcrInput(@"images\sample.tiff"))
{
OcrResult Result = Ocr.Read(Input);
var Pages = Result.Pages;
var Words = Pages[0].Words;
var Barcodes = Result.Barcodes;
// Izpētiet šeit, lai atrastu masīvu, detalizētu API:
// - lapas, bloki, parafafi, rindas, vārdi, rakstzīmes
// - Attēlu eksportēšana, Fontu koordinātas, Statistikas dati
}
Imports IronOcr
Imports System.Drawing 'Pievienot montāžas atsauci
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Latvian
Ocr.Configuration.EngineMode = TesseractEngineMode.TesseractAndLstm
Ocr.Configuration.ReadBarCodes = True '!Svarīgs
Using Input = New OcrInput("images\sample.tiff")
Dim Result As OcrResult = Ocr.Read(Input)
Dim Pages = Result.Pages
Dim Words = Pages(0).Words
Dim Barcodes = Result.Barcodes
' Izpētiet šeit, lai atrastu masīvu, detalizētu API:
' - lapas, bloki, parafafi, rindas, vārdi, rakstzīmes
' - Attēlu eksportēšana, Fontu koordinātas, Statistikas dati
End Using
Izrāde
IronOCR darbojas ārpus kastes, un nav nepieciešams pielāgot vai stipri pārveidot ievades attēlus.
Ātrums ir degošs: IronOCR.2020 + ir līdz pat 10 reizēm ātrāks un pieļauj vairāk nekā 250% mazāk kļūdu nekā iepriekšējie būvējumi.
Uzzināt vairāk
Lai uzzinātu vairāk par OCR C#, VB, F# vai jebkurā citā .NET valodā, lūdzu, izlasiet mūsu kopienas apmācības, kurās sniegti reālas pasaules piemēri, kā var izmantot IronOCR, un var parādīt nianses, kā vislabāk izmantot šī bibliotēka.
Curtis Chau tiene una licenciatura en Ciencias de la Computación (Carleton University) y se especializa en el desarrollo front-end con experiencia en Node.js, TypeScript, JavaScript y React. Apasionado por crear interfaces de usuario intuitivas y estéticamente agradables, disfruta trabajando con frameworks modernos y creando manuales bien estructurados y visualmente atractivos.