<meta http-equiv="content-language" content="sk" />
<h1>Slovenské OCR v C# a .NET</h1>
<h6> Ostatné verzie tohto dokumentu:</h6>
<ul>
<li> <a rel='alternate' hreflang='en' href="/csharp/ocr/languages/slovak/">Angličtina (This Page in English)</a></li>
<li> <a href="/csharp/ocr/languages/">Viac Jazykov</a></li>
</ul>
<p> IronOCR je softvérový komponent C#, ktorý umožňuje kódovačom .NET čítať text z obrázkov a dokumentov PDF v 126
jazykoch vrátane slovenčiny.</p>
<p> Je to pokročilá vidlica Tesseractu, postavená výhradne pre vývojárov .NET. Pravidelne prekonáva ostatné motory
Tesseract z hľadiska rýchlosti aj presnosti.</p>
<h2> Obsah jazykov IronOcr.Slovak</h2>
<p> Tento balík obsahuje 61 jazykov OCR pre .NET:</p>
<ul>
<li> Slovák</li>
<li> SlovakBest</li>
<li> SlovakFast</li>
<li> SlovakFraktur</li>
</ul>
<h2> Stiahnuť ▼</h2>
<p> Slovenský jazykový balíček <span style='white-space:default'>[slovenčina]</span> <br/> * Download as <a
class='languages-dll' href='/csharp/ocr/packages/language-packs/Slovak.ocrdata.zip'>PSČ <i
class='fas fa-download'></i></a><br/> * Install with <a target='_blank' class='languages-nuget'
href="https://www.nuget.org/packages/IronOcr.Languages.Slovak/">https://www.nuget.org/packages/IronOcr.Languages.Slovak/</a>'
NuGet<i class='nuget-icon'></i></p>
<h2> Inštalácia</h2>
<p> Prvá vec, ktorú musíme urobiť, je nainštalovať náš <strong>slovenský</strong> balík OCR do vášho projektu .NET.</p>
<p> <code>PM> Install-Package IronOcr.Languages.Slovak</code></p>
<h2> Príklad kódu</h2>
<p> Tento príklad kódu C# číta slovenský text z obrázka alebo dokumentu PDF.</p>
```cs
// PM> Install-Package IronOcr.Languages.Slovak
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Slovak;
using (var Input = new OcrInput(@"images\Slovak.png"))
{
var Result = Ocr.Read(Input);
string AllText = Result.Text;
Console.WriteLine(AllText);
}
```
<h2>Prečo zvoliť IronOCR?</h2>
<p> IronOCR je ľahko inštalovateľná, kompletná a dobre zdokumentovaná softvérová knižnica .NET.</p>
<p> Vyberte si IronOCR, aby ste dosiahli <strong>presnosť 99,8% + OCR</strong> bez použitia akýchkoľvek externých
webových služieb, priebežných poplatkov alebo odosielania dôverných dokumentov cez internet.</p>
<h4> Prečo si vývojári v C# vybrali IronOCR pred Vanilla Tesseract:</h4>
<ul>
<li> Nainštalujte si ako jednu DLL alebo NuGet</li>
<li> Zahŕňa pre motor Tesseract 5, 4 a 3 z krabice.</li>
<li> Presnosť <strong>99,8%</strong> výrazne prekonáva bežný Tesseract.</li>
<li> Blazing Speed a MultiThreading</li>
<li> Kompatibilné s aplikáciami MVC, WebApp, Desktop, Console a Server</li>
<li> Žiadne Exes alebo C ++ kódy na prácu</li>
<li> Plná podpora OCR PDF</li>
<li> Ak chcete vykonať OCR, takmer akýkoľvek obrazový súbor alebo PDF</li>
<li> Plná podpora .NET Core, Standard a FrameWork</li>
<li> Nasadené na Windows, Mac, Linux, Azure, Docker, Lambda, AWS</li>
<li> Prečítajte si čiarové kódy a QR kódy</li>
<li> Exportujte OCR ako do XHTML</li>
<li> Exportujte OCR do prehľadávateľných dokumentov PDF</li>
<li> Podpora viacerých vlákien</li>
<li> 126 medzinárodných jazykov, všetky spravované prostredníctvom súborov NuGet alebo OcrData</li>
<li> Extrahujte obrázky, súradnice, štatistiku a písma. Nielen text.</li>
<li> Môže byť použitý na redistribúciu Tesseract OCR v komerčných a proprietárnych aplikáciách.</li>
</ul>
<p> <em>Železné OCR svieti pri práci s obrázkami zo skutočného sveta a nedokonalými dokumentmi, ako sú fotografie alebo
skeny s nízkym rozlíšením, ktoré môžu mať digitálny šum alebo nedokonalosti.</em></p>
<p> Ostatné <a href="/csharp/ocr/use-case/free-ocr-csharp/">bezplatné</a> knižnice <a
href="/csharp/ocr/use-case/free-ocr-csharp/">OCR</a> pre platformu .NET, ako sú iné rozhrania API a webové
služby .NET Tesseract, v týchto prípadoch použitia v reálnom svete nefungujú tak dobre.</p>
<h2> OCR s Tesseract 5 - Začnite kódovať v C#</h2>
<p> Nasledujúca ukážka kódu ukazuje, aké ľahké je čítať text z obrázka pomocou C# alebo VB .NET.</p>
<h3> OneLiner</h3>
```cs
string Text = new IronTesseract().Read(@"img\Screenshot.png").Text;
```
<h3>Konfigurovateľný Hello World</h3>
```cs
// PM> Install-Package IronOcr.Languages.Slovak
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Slovak;
using (var Input = new OcrInput())
{
Input.AddImage("images/sample.jpeg");
//... môžete pridať ľubovoľný počet obrázkov
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
```
<h3>C# PDF OCR</h3>
<p> Rovnaký prístup je možné podobne použiť na extrahovanie textu z ľubovoľného dokumentu PDF.</p>
```cs
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Slovak;
using (var input = new OcrInput())
{
input.AddPdf("example.pdf", "password");
// Môžeme tiež vybrať konkrétnych číselníkov stránok PDF pre OCR
var Result = Ocr.Read(input);
Console.WriteLine(Result.Text);
Console.WriteLine($"{Result.Pages.Count} Pages");
// 1 strana pre každú stránku PDF
}
```
<h3>OCR pre viacstránkové TIFF</h3>
<p> OCR Čítanie formátu súboru TIFF vrátane viacstranových dokumentov. TIFF možno tiež previesť priamo do súboru PDF s
prehľadateľným textom.</p>
```cs
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Slovak;
using (var Input = new OcrInput())
{
Input.AddMultiFrameTiff("multi-frame.tiff");
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
```
<h3>Čiarové kódy a QR</h3>
<p> Jedinečnou vlastnosťou programu IronOCR je, že dokáže čítať čiarové kódy a QR kódy z dokumentov pri skenovaní
textu. Trieda <code>OcrResult.OcrBarcode</code> poskytuje vývojárovi podrobné informácie o každom naskenovanom čiarovom kóde.</p>
```cs
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Configuration.ReadBarCodes = true;
using (var input = new OcrInput())
{
input.AddImage("img/Barcode.png");
var Result = Ocr.Read(input);
foreach (var Barcode in Result.Barcodes)
{
Console.WriteLine(Barcode.Value);
// typ a umiestnenie vlastnosti tiež vystavené
}
}
```
<h3>OCR pre konkrétne oblasti obrázkov</h3>
<p> Všetky metódy skenovania a čítania programu IronOCR poskytujú schopnosť presne určiť, z ktorej časti stránky alebo
stránok chceme čítať text. To je veľmi užitočné, keď sa pozrieme na štandardizované formuláre, ktoré vám môžu
ušetriť strašne veľa času a zvýšiť efektivitu.</p>
<p> Ak chcete použiť oblasti orezania, budeme musieť do <code>System.Drawing</code> pridať systémový odkaz, aby sme
mohli použiť objekt <code>System.Drawing.Rectangle</code> .</p>
```cs
using IronOcr;
using System.Drawing;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Slovak;
using (var Input = new OcrInput())
{
var ContentArea = new Rectangle() { X = 215, Y = 1250, Height = 280, Width = 1335 };
// Rozmery sú v pixloch
Input.Add("document.png", ContentArea);
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
```
<h3>OCR pre skenovanie nízkej kvality</h3>
<p> Trieda IronOCR <code>OcrInput</code> dokáže opraviť skeny, ktoré bežný Tesseract nedokáže prečítať.</p>
```cs
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Slovak;
using (var Input = new OcrInput(@"img\Potter.LowQuality.tiff"))
{
Input.DeNoise(); // opravuje digitálny šum a zlé skenovanie
Input.Deskew(); // opravuje rotáciu a perspektívu
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
```
<h3>Exportujte výsledky OCR ako prehľadávateľný PDF</h3>
<p> Obrázok do formátu PDF s kopírovateľnými textovými reťazcami. Môžu byť indexované vyhľadávačmi a databázami.</p>
```cs
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Slovak;
using (var Input = new OcrInput())
{
Input.Title = "Quarterly Report";
Input.AddImage("image1.jpeg");
Input.AddImage("image2.png");
Input.AddImage("image3.gif");
var Result = Ocr.Read(Input);
Result.SaveAsSearchablePdf("searchable.pdf");
}
```
<h3>Konverzia TIFF na prehľadávateľný súbor PDF</h3>
<p> Konvertujte dokument TIFF (alebo ľubovoľnú skupinu obrazových súborov) priamo do prehľadávateľného PDF, ktorý je
možné indexovať pomocou intranetu, webových stránok a vyhľadávacích nástrojov Google.</p>
```cs
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Slovak;
using (var Input = new OcrInput())
{
Input.AddMultiFrameTiff("example.tiff");
var Result = Ocr.Read(Input).SaveAsSearchablePdf("searchable.pdf");
}
```
<h3>Exportujte výsledky OCR ako HTML</h3>
<p> Konverzia obrazu z OCR na XHTML.</p>
```cs
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Slovak;
using (var Input = new OcrInput())
{
Input.Title = "Html Title";
Input.AddImage("image1.jpeg");
var Result = Ocr.Read(Input);
Result.SaveAsHocrFile("results.html");
}
```
<h2>Filtre na vylepšenie obrazu OCR</h2>
<p> IronOCR poskytuje jedinečné filtre pre objekty <code>OcrInput</code> na zlepšenie výkonu OCR.</p>
<h3> Príklad kódu na vylepšenie obrázka</h3>
<p> Zvyšuje kvalitu vstupných obrázkov OCR a poskytuje lepšie a rýchlejšie výsledky OCR.</p>
```cs
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Slovak;
using (var Input = new OcrInput(@"LowQuality.jpeg"))
{
Input.DeNoise(); // opravuje digitálny šum a zlé skenovanie
Input.Deskew(); // opravuje rotáciu a perspektívu
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
```
<h3>Zoznam obrazových filtrov OCR</h3>
<p> Vstupné filtre na zvýšenie výkonu OCR, ktoré sú zabudované do programu IronOCR, zahŕňajú:</p>
<ul>
<li> <strong>OcrInput.Rotate (dvojité stupne)</strong> - Otočí obrázky o niekoľko stupňov v smere hodinových
ručičiek. V protismere hodinových ručičiek použite záporné čísla.</li>
<li> <strong>OcrInput.Binarize ()</strong> - tento obrazový filter zmení každý pixel na čierny alebo biely bez
akejkoľvek strednej <strong>výšky</strong> . Môže zlepšiť prípady výkonu OCR pri veľmi malom kontraste textu k
pozadiu.</li>
<li> <strong>OcrInput.ToGrayScale ()</strong> - tento obrazový filter premení každý pixel na odtieň v odtieňoch
sivej. Je nepravdepodobné, že by sa zlepšila presnosť OCR, ale môže to zvýšiť rýchlosť</li>
<li> <strong>OcrInput.Contrast ()</strong> - automatické zvýšenie kontrastu. Tento filter často zvyšuje rýchlosť a
presnosť OCR pri skenovaní s nízkym kontrastom.</li>
<li> <strong>OcrInput.DeNoise ()</strong> - Odstráni digitálny šum. Tento filter by sa mal používať iba tam, kde sa
očakáva hluk.</li>
<li> <strong>OcrInput.Invert ()</strong> - Invertuje každú farbu. Napr. Biela sa stáva čiernou: čierna sa stáva
bielou.</li>
<li> <strong>OcrInput.Dilate ()</strong> - pokročilá morfológia. <em>Dilatácia</em> pridá pixely na hranice objektov
v obraze. Oproti Erode</li>
<li> <strong>OcrInput.Erode ()</strong> - pokročilá morfológia. <em>Erózia</em> odstraňuje pixely na hraniciach
objektov Na rozdiel od rozšírenia</li>
<li> <strong>OcrInput.Deskew ()</strong> - Otočí obrázok tak, aby bol správnym smerom nahor a kolmý. To je pre OCR
veľmi užitočné, pretože tolerancia Tesseractu pri skreslených skenoch môže byť až 5 stupňov.</li>
<li> <strong>OcrInput.DeepCleanBackgroundNoise ()</strong> - odstránenie <strong>silného</strong> pozadia. Tento
filter používajte iba v prípade, že je známy extrémny šum pozadia dokumentu, pretože tento filter tiež riskuje
zníženie presnosti OCR čistých dokumentov a je veľmi nákladný na procesor.</li>
<li> <strong>OcrInput.EnhanceResolution</strong> - zvyšuje rozlíšenie obrázkov nízkej kvality. Tento filter nie je
často potrebný, pretože <em>OcrInput.MinimumDPI</em> a <em>OcrInput.TargetDPI</em> automaticky zachytí a vyrieši
vstupy s nízkym rozlíšením.</li>
</ul>
<p> <strong>CleanBackgroundNoise.</strong> Toto je nastavenie, ktoré je trochu časovo náročné; umožňuje však knižnici
automaticky čistiť digitálny šum, deformácie papiera a ďalšie nedokonalosti digitálneho obrazu, ktoré by ho inak
spôsobili, že ho nebude možné prečítať v iných knižniciach OCR.</p>
<p> <strong>EnhanceContrast</strong> je nastavenie, ktoré spôsobuje, že program IronOCR automaticky zvyšuje kontrast
textu na pozadí obrázka, zvyšuje presnosť OCR a všeobecne zvyšuje výkon a rýchlosť OCR.</p>
<p> <strong>EnhanceResolution</strong> je nastavenie, ktoré automaticky detekuje obrázky s nízkym rozlíšením (ktoré
<strong>nedosahujú</strong> 275 dpi), automaticky ich zväčší a potom zostrí všetok text, aby ho mohol knižnica OCR
perfektne prečítať. Aj keď je táto operácia sama osebe časovo náročná, spravidla znižuje celkový čas operácie OCR v
obraze.</p>
<p> <strong>Jazyk</strong> IronOCR podporuje 22 medzinárodných jazykových balíkov a jazykové nastavenie je možné použiť
na výber jedného alebo viacerých jazykov, ktoré sa použijú pre operáciu OCR.</p>
<p> <strong>Strategy</strong> IronOCR podporuje dve stratégie. Môžeme sa rozhodnúť buď pre rýchle a menej presné
skenovanie dokumentu, alebo použiť pokročilú stratégiu, ktorá využíva niektoré modely umelej inteligencie na
automatické zlepšenie presnosti textu OCR pri pohľade na štatistický vzťah slov k sebe navzájom vo vete.</p>
<p> <strong>ColorSpace</strong> je nastavenie, pri ktorom môžeme zvoliť OCR v odtieňoch sivej alebo farebne. Všeobecne
je najlepšou voľbou škála šedej. Avšak niekedy, keď existujú texty alebo pozadia podobného odtieňa, ale veľmi
odlišnej farby, poskytne plnofarebný farebný priestor lepšie výsledky.</p>
<p> <strong>DetectWhiteTextOnDarkBackgrounds.</strong> Všeobecne všetky knižnice OCR očakávajú, že sa čierny text
zobrazí na bielom pozadí. Toto nastavenie umožňuje aplikácii IronOCR automaticky detekovať negatívy alebo tmavé
stránky s bielym textom a čítať ich.</p>
<p> <strong>InputImageType.</strong> Toto nastavenie umožňuje vývojárovi viesť knižnicu OCR, či sa pozerá na celý
dokument alebo úryvok, napríklad na snímku obrazovky.</p>
<p> <strong>RotateAndStraighten</strong> je pokročilé nastavenie, ktoré umožňuje aplikácii IronOCR jedinečnú schopnosť
čítať dokumenty, ktoré nielen rotujú, ale obsahujú aj perspektívu, napríklad fotografie textových dokumentov.</p>
<p> <strong>ReadBarcodes</strong> je užitočná funkcia, ktorá umožňuje aplikácii IronOCR automaticky čítať čiarové kódy
a QR kódy na stránkach, pretože tiež číta text, a to bez ďalšej veľkej časovej záťaže.</p>
<p> <strong>Hĺbka farieb.</strong> Toto nastavenie určuje, koľko bitov na pixel bude knižnica OCR používať na určenie
hĺbky farby. Vyššia farebná hĺbka môže zvýšiť kvalitu OCR, ale tiež predĺži čas potrebný na dokončenie operácie OCR.</p>
<h2> 126 jazykových balíkov</h2>
<p> Program IronOCR podporuje <strong>126 medzinárodných jazykov</strong> prostredníctvom jazykových balíkov
distribuovaných ako DLL, ktoré si môžete <a href="/csharp/ocr/languages/">stiahnuť z tejto webovej stránky</a> alebo
tiež z nástroja <a href="https://www.nuget.org/packages?q=IronOcr.Languages">NuGet Package Manager</a> .</p>
<p> Medzi jazyky patrí nemčina, francúzština, angličtina, čínština, japončina a mnoho ďalších. K dispozícii sú
špecializované jazykové balíčky pre pasy MRZ, kontroly MICR, finančné údaje, ŠPZ a mnoho ďalších. Môžete tiež použiť
akýkoľvek súbor Tesseract „.traineddata“ - vrátane tých, ktoré si sami vytvoríte.</p>
<h3> Príklad jazyka</h3>
<p> Používanie iných jazykov OCR.</p>
```cs
// using IronOcr;
// PM> Install-Package IronOcr.Languages.Arabic
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Arabic;
using (var input = new OcrInput())
{
input.AddImage("img/arabic.gif");
// V prípade potreby pridajte obrázkové filtre
// V takom prípade je aj myšlienkový vstup veľmi nízkej kvality
// IronTesseract dokáže prečítať to, čo bežný Tesseract nie
var Result = Ocr.Read(input);
// Konzola nedokáže ľahko vytlačiť arabčinu v systéme Windows.
// Namiesto toho uložme na disk.
Result.SaveAsTextFile("arabic.txt");
}
```
<h3>Viacjazyčný príklad</h3>
<p> Je tiež možné OCR pomocou viacerých jazykov súčasne. To skutočne môže pomôcť získať metadáta a adresy URL v
anglickom jazyku v dokumentoch Unicode.</p>
```cs
// using IronOcr;
// PM> Install-Package IronOcr.Languages.ChineseSimplified
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.ChineseSimplified;
Ocr.AddSecondaryLanguage(OcrLanguage.Slovak);
// Môžeme pridať ľubovoľný počet jazykov
using (var input = new OcrInput())
{
input.Add("multi-language.pdf");
var Result = Ocr.Read(input);
Result.SaveAsTextFile("results.txt");
}
```
<h2>Podrobné objekty výsledkov OCR</h2>
<p> IronOCR vráti objekt výsledku OCR pre každú operáciu OCR. Vývojári spravidla používajú iba textovú vlastnosť tohto
objektu na získanie textu naskenovaného z obrázka. Výsledky OCR v DOM sú však oveľa pokročilejšie.</p>
```cs
using IronOcr;
using System.Drawing; // Pridajte odkaz na zostavu
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Slovak;
Ocr.Configuration.EngineMode = TesseractEngineMode.TesseractAndLstm;
Ocr.Configuration.ReadBarCodes = true; //! Dôležité
using (var Input = new OcrInput(@"images\sample.tiff"))
{
OcrResult Result = Ocr.Read(Input);
var Pages = Result.Pages;
var Words = Pages[0].Words;
var Barcodes = Result.Barcodes;
// Preskúmajte tu a nájdite rozsiahle a podrobné API:
// - Stránky, bloky, parafafy, čiary, slová, znamienka
// - Export obrázkov, súradnice písma, štatistické údaje
}
```
<h2>Výkon</h2>
<p> Aplikácia IronOCR funguje po vybalení z krabice bez potreby vyladenia výkonu alebo výraznejšej úpravy vstupných
obrázkov.</p>
<p> Rýchlosť je ohromujúca: IronOCR.2020+ je až 10-krát rýchlejší a robí o 250% menej chýb ako predchádzajúce verzie.</p>
<h2> Uč sa viac</h2>
<p> Ak sa chcete dozvedieť viac informácií o OCR v jazykoch C#, VB, F# alebo v akomkoľvek inom jazyku .NET, prečítajte
<a href="/csharp/ocr/tutorials/how-to-read-text-from-an-image-in-csharp-net/">si naše komunitné výukové programy</a>
, ktoré poskytujú príklady skutočného sveta toho, ako sa dá IronOCR použiť, a môžu ukázať nuansy toho, ako z nich
vyťažiť maximum. tejto knižnice.</p>
<p> K dispozícii je tiež úplná <a href="/csharp/ocr/object-reference/api/">referencia na objekt pre vývojárov .NET</a> .</p>
IronOCR je softvérový komponent C#, ktorý umožňuje kódovačom .NET čítať text z obrázkov a dokumentov PDF v 126
jazykoch vrátane slovenčiny.
Je to pokročilá vidlica Tesseractu, postavená výhradne pre vývojárov .NET. Pravidelne prekonáva ostatné motory
Tesseract z hľadiska rýchlosti aj presnosti.
Prvá vec, ktorú musíme urobiť, je nainštalovať náš slovenský balík OCR do vášho projektu .NET.
PM> Install-Package IronOcr.Languages.Slovak
Príklad kódu
Tento príklad kódu C# číta slovenský text z obrázka alebo dokumentu PDF.
// PM> Install-Package IronOcr.Languages.Slovakusing IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Slovak;using (varInput = new OcrInput(@"images\Slovak.png")){ varResult = Ocr.Read(Input); stringAllText = Result.Text;Console.WriteLine(AllText);}
// PM> Install-Package IronOcr.Languages.Slovak
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Slovak;
using (var Input = new OcrInput(@"images\Slovak.png"))
{
var Result = Ocr.Read(Input);
string AllText = Result.Text;
Console.WriteLine(AllText);
}
' PM> Install-Package IronOcr.Languages.SlovakImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.SlovakUsingInput = New OcrInput("images\Slovak.png") DimResult = Ocr.Read(Input) DimAllTextAsString = Result.TextConsole.WriteLine(AllText)EndUsing
' PM> Install-Package IronOcr.Languages.Slovak
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Slovak
Using Input = New OcrInput("images\Slovak.png")
Dim Result = Ocr.Read(Input)
Dim AllText As String = Result.Text
Console.WriteLine(AllText)
End Using
Prečo zvoliť IronOCR?
IronOCR je ľahko inštalovateľná, kompletná a dobre zdokumentovaná softvérová knižnica .NET.
Vyberte si IronOCR, aby ste dosiahli presnosť 99,8% + OCR bez použitia akýchkoľvek externých
webových služieb, priebežných poplatkov alebo odosielania dôverných dokumentov cez internet.
Prečo si vývojári v C# vybrali IronOCR pred Vanilla Tesseract:
Nainštalujte si ako jednu DLL alebo NuGet
Zahŕňa pre motor Tesseract 5, 4 a 3 z krabice.
Presnosť 99,8% výrazne prekonáva bežný Tesseract.
Blazing Speed a MultiThreading
Kompatibilné s aplikáciami MVC, WebApp, Desktop, Console a Server
Žiadne Exes alebo C ++ kódy na prácu
Plná podpora OCR PDF
Ak chcete vykonať OCR, takmer akýkoľvek obrazový súbor alebo PDF
Plná podpora .NET Core, Standard a FrameWork
Nasadené na Windows, Mac, Linux, Azure, Docker, Lambda, AWS
Prečítajte si čiarové kódy a QR kódy
Exportujte OCR ako do XHTML
Exportujte OCR do prehľadávateľných dokumentov PDF
Podpora viacerých vlákien
126 medzinárodných jazykov, všetky spravované prostredníctvom súborov NuGet alebo OcrData
Extrahujte obrázky, súradnice, štatistiku a písma. Nielen text.
Môže byť použitý na redistribúciu Tesseract OCR v komerčných a proprietárnych aplikáciách.
Železné OCR svieti pri práci s obrázkami zo skutočného sveta a nedokonalými dokumentmi, ako sú fotografie alebo
skeny s nízkym rozlíšením, ktoré môžu mať digitálny šum alebo nedokonalosti.
Ostatné bezplatné knižnice OCR pre platformu .NET, ako sú iné rozhrania API a webové
služby .NET Tesseract, v týchto prípadoch použitia v reálnom svete nefungujú tak dobre.
OCR s Tesseract 5 - Začnite kódovať v C#
Nasledujúca ukážka kódu ukazuje, aké ľahké je čítať text z obrázka pomocou C# alebo VB .NET.
OneLiner
stringText = new IronTesseract().Read(@"img\Screenshot.png").Text;
string Text = new IronTesseract().Read(@"img\Screenshot.png").Text;
DimTextAsString = (New IronTesseract()).Read("img\Screenshot.png").Text
Dim Text As String = (New IronTesseract()).Read("img\Screenshot.png").Text
Konfigurovateľný Hello World
// PM> Install-Package IronOcr.Languages.Slovakusing IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Slovak;using (varInput = new OcrInput()){Input.AddImage("images/sample.jpeg"); //... môžete pridať ľubovoľný počet obrázkov varResult = Ocr.Read(Input);Console.WriteLine(Result.Text);}
// PM> Install-Package IronOcr.Languages.Slovak
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Slovak;
using (var Input = new OcrInput())
{
Input.AddImage("images/sample.jpeg");
//... môžete pridať ľubovoľný počet obrázkov
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
ImportsIronOcrDimOcr = New IronTesseract()Ocr.Language = OcrLanguage.SlovakUsingInput = New OcrInput()Input.AddImage("images/sample.jpeg") '... môžete pridať ľubovoľný počet obrázkov DimResult = Ocr.Read(Input)Console.WriteLine(Result.Text)EndUsing
Imports IronOcr
Dim Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Slovak
Using Input = New OcrInput()
Input.AddImage("images/sample.jpeg")
'... môžete pridať ľubovoľný počet obrázkov
Dim Result = Ocr.Read(Input)
Console.WriteLine(Result.Text)
End Using
C# PDF OCR
Rovnaký prístup je možné podobne použiť na extrahovanie textu z ľubovoľného dokumentu PDF.
using IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Slovak;using (var input = new OcrInput()){ input.AddPdf("example.pdf", "password"); // Môžeme tiež vybrať konkrétnych číselníkov stránok PDF pre OCR varResult = Ocr.Read(input);Console.WriteLine(Result.Text);Console.WriteLine($"{Result.Pages.Count} Pages"); // 1 strana pre každú stránku PDF}
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Slovak;
using (var input = new OcrInput())
{
input.AddPdf("example.pdf", "password");
// Môžeme tiež vybrať konkrétnych číselníkov stránok PDF pre OCR
var Result = Ocr.Read(input);
Console.WriteLine(Result.Text);
Console.WriteLine($"{Result.Pages.Count} Pages");
// 1 strana pre každú stránku PDF
}
ImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.SlovakUsing input = New OcrInput() input.AddPdf("example.pdf", "password") ' Môžeme tiež vybrať konkrétnych číselníkov stránok PDF pre OCR DimResult = Ocr.Read(input)Console.WriteLine(Result.Text)Console.WriteLine($"{Result.Pages.Count} Pages") ' 1 strana pre každú stránku PDFEndUsing
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Slovak
Using input = New OcrInput()
input.AddPdf("example.pdf", "password")
' Môžeme tiež vybrať konkrétnych číselníkov stránok PDF pre OCR
Dim Result = Ocr.Read(input)
Console.WriteLine(Result.Text)
Console.WriteLine($"{Result.Pages.Count} Pages")
' 1 strana pre každú stránku PDF
End Using
OCR pre viacstránkové TIFF
OCR Čítanie formátu súboru TIFF vrátane viacstranových dokumentov. TIFF možno tiež previesť priamo do súboru PDF s
prehľadateľným textom.
using IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Slovak;using (varInput = new OcrInput()){Input.AddMultiFrameTiff("multi-frame.tiff"); varResult = Ocr.Read(Input);Console.WriteLine(Result.Text);}
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Slovak;
using (var Input = new OcrInput())
{
Input.AddMultiFrameTiff("multi-frame.tiff");
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
ImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.SlovakUsingInput = New OcrInput()Input.AddMultiFrameTiff("multi-frame.tiff") DimResult = Ocr.Read(Input)Console.WriteLine(Result.Text)EndUsing
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Slovak
Using Input = New OcrInput()
Input.AddMultiFrameTiff("multi-frame.tiff")
Dim Result = Ocr.Read(Input)
Console.WriteLine(Result.Text)
End Using
Čiarové kódy a QR
Jedinečnou vlastnosťou programu IronOCR je, že dokáže čítať čiarové kódy a QR kódy z dokumentov pri skenovaní
textu. Trieda OcrResult.OcrBarcode poskytuje vývojárovi podrobné informácie o každom naskenovanom čiarovom kóde.
using IronOcr;varOcr = new IronTesseract();Ocr.Configuration.ReadBarCodes = true;using (var input = new OcrInput()){ input.AddImage("img/Barcode.png"); varResult = Ocr.Read(input); foreach (varBarcodeinResult.Barcodes) {Console.WriteLine(Barcode.Value); // typ a umiestnenie vlastnosti tiež vystavené }}
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Configuration.ReadBarCodes = true;
using (var input = new OcrInput())
{
input.AddImage("img/Barcode.png");
var Result = Ocr.Read(input);
foreach (var Barcode in Result.Barcodes)
{
Console.WriteLine(Barcode.Value);
// typ a umiestnenie vlastnosti tiež vystavené
}
}
ImportsIronOcrDimOcr = New IronTesseract()Ocr.Configuration.ReadBarCodes = TrueUsing input = New OcrInput() input.AddImage("img/Barcode.png") DimResult = Ocr.Read(input) For EachBarcodeInResult.BarcodesConsole.WriteLine(Barcode.Value) ' typ a umiestnenie vlastnosti tiež vystavené NextEndUsing
Imports IronOcr
Dim Ocr = New IronTesseract()
Ocr.Configuration.ReadBarCodes = True
Using input = New OcrInput()
input.AddImage("img/Barcode.png")
Dim Result = Ocr.Read(input)
For Each Barcode In Result.Barcodes
Console.WriteLine(Barcode.Value)
' typ a umiestnenie vlastnosti tiež vystavené
Next
End Using
OCR pre konkrétne oblasti obrázkov
Všetky metódy skenovania a čítania programu IronOCR poskytujú schopnosť presne určiť, z ktorej časti stránky alebo
stránok chceme čítať text. To je veľmi užitočné, keď sa pozrieme na štandardizované formuláre, ktoré vám môžu
ušetriť strašne veľa času a zvýšiť efektivitu.
Ak chcete použiť oblasti orezania, budeme musieť do System.Drawing pridať systémový odkaz, aby sme
mohli použiť objekt System.Drawing.Rectangle .
using IronOcr;using System.Drawing;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Slovak;using (varInput = new OcrInput()){ varContentArea = new Rectangle() { X = 215, Y = 1250, Height = 280, Width = 1335 }; // Rozmery sú v pixlochInput.Add("document.png", ContentArea); varResult = Ocr.Read(Input);Console.WriteLine(Result.Text);}
using IronOcr;
using System.Drawing;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Slovak;
using (var Input = new OcrInput())
{
var ContentArea = new Rectangle() { X = 215, Y = 1250, Height = 280, Width = 1335 };
// Rozmery sú v pixloch
Input.Add("document.png", ContentArea);
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
ImportsIronOcrImportsSystem.DrawingPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.SlovakUsingInput = New OcrInput() DimContentArea = New Rectangle() With { .X = 215, .Y = 1250, .Height = 280, .Width = 1335 } ' Rozmery sú v pixlochInput.Add("document.png", ContentArea) DimResult = Ocr.Read(Input)Console.WriteLine(Result.Text)EndUsing
Imports IronOcr
Imports System.Drawing
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Slovak
Using Input = New OcrInput()
Dim ContentArea = New Rectangle() With {
.X = 215,
.Y = 1250,
.Height = 280,
.Width = 1335
}
' Rozmery sú v pixloch
Input.Add("document.png", ContentArea)
Dim Result = Ocr.Read(Input)
Console.WriteLine(Result.Text)
End Using
OCR pre skenovanie nízkej kvality
Trieda IronOCR OcrInput dokáže opraviť skeny, ktoré bežný Tesseract nedokáže prečítať.
using IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Slovak;using (varInput = new OcrInput(@"img\Potter.LowQuality.tiff")){Input.DeNoise(); // opravuje digitálny šum a zlé skenovanieInput.Deskew(); // opravuje rotáciu a perspektívu varResult = Ocr.Read(Input);Console.WriteLine(Result.Text);}
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Slovak;
using (var Input = new OcrInput(@"img\Potter.LowQuality.tiff"))
{
Input.DeNoise(); // opravuje digitálny šum a zlé skenovanie
Input.Deskew(); // opravuje rotáciu a perspektívu
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
ImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.SlovakUsingInput = New OcrInput("img\Potter.LowQuality.tiff")Input.DeNoise() ' opravuje digitálny šum a zlé skenovanieInput.Deskew() ' opravuje rotáciu a perspektívu DimResult = Ocr.Read(Input)Console.WriteLine(Result.Text)EndUsing
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Slovak
Using Input = New OcrInput("img\Potter.LowQuality.tiff")
Input.DeNoise() ' opravuje digitálny šum a zlé skenovanie
Input.Deskew() ' opravuje rotáciu a perspektívu
Dim Result = Ocr.Read(Input)
Console.WriteLine(Result.Text)
End Using
Exportujte výsledky OCR ako prehľadávateľný PDF
Obrázok do formátu PDF s kopírovateľnými textovými reťazcami. Môžu byť indexované vyhľadávačmi a databázami.
using IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Slovak;using (varInput = new OcrInput()){Input.Title = "Quarterly Report";Input.AddImage("image1.jpeg");Input.AddImage("image2.png");Input.AddImage("image3.gif"); varResult = Ocr.Read(Input);Result.SaveAsSearchablePdf("searchable.pdf");}
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Slovak;
using (var Input = new OcrInput())
{
Input.Title = "Quarterly Report";
Input.AddImage("image1.jpeg");
Input.AddImage("image2.png");
Input.AddImage("image3.gif");
var Result = Ocr.Read(Input);
Result.SaveAsSearchablePdf("searchable.pdf");
}
ImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.SlovakUsingInput = New OcrInput()Input.Title = "Quarterly Report"Input.AddImage("image1.jpeg")Input.AddImage("image2.png")Input.AddImage("image3.gif") DimResult = Ocr.Read(Input)Result.SaveAsSearchablePdf("searchable.pdf")EndUsing
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Slovak
Using Input = New OcrInput()
Input.Title = "Quarterly Report"
Input.AddImage("image1.jpeg")
Input.AddImage("image2.png")
Input.AddImage("image3.gif")
Dim Result = Ocr.Read(Input)
Result.SaveAsSearchablePdf("searchable.pdf")
End Using
Konverzia TIFF na prehľadávateľný súbor PDF
Konvertujte dokument TIFF (alebo ľubovoľnú skupinu obrazových súborov) priamo do prehľadávateľného PDF, ktorý je
možné indexovať pomocou intranetu, webových stránok a vyhľadávacích nástrojov Google.
using IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Slovak;using (varInput = new OcrInput()){Input.AddMultiFrameTiff("example.tiff"); varResult = Ocr.Read(Input).SaveAsSearchablePdf("searchable.pdf");}
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Slovak;
using (var Input = new OcrInput())
{
Input.AddMultiFrameTiff("example.tiff");
var Result = Ocr.Read(Input).SaveAsSearchablePdf("searchable.pdf");
}
ImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.SlovakUsingInput = New OcrInput()Input.AddMultiFrameTiff("example.tiff") DimResult = Ocr.Read(Input).SaveAsSearchablePdf("searchable.pdf")EndUsing
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Slovak
Using Input = New OcrInput()
Input.AddMultiFrameTiff("example.tiff")
Dim Result = Ocr.Read(Input).SaveAsSearchablePdf("searchable.pdf")
End Using
Exportujte výsledky OCR ako HTML
Konverzia obrazu z OCR na XHTML.
using IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Slovak;using (varInput = new OcrInput()){Input.Title = "Html Title";Input.AddImage("image1.jpeg"); varResult = Ocr.Read(Input);Result.SaveAsHocrFile("results.html");}
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Slovak;
using (var Input = new OcrInput())
{
Input.Title = "Html Title";
Input.AddImage("image1.jpeg");
var Result = Ocr.Read(Input);
Result.SaveAsHocrFile("results.html");
}
ImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.SlovakUsingInput = New OcrInput()Input.Title = "Html Title"Input.AddImage("image1.jpeg") DimResult = Ocr.Read(Input)Result.SaveAsHocrFile("results.html")EndUsing
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Slovak
Using Input = New OcrInput()
Input.Title = "Html Title"
Input.AddImage("image1.jpeg")
Dim Result = Ocr.Read(Input)
Result.SaveAsHocrFile("results.html")
End Using
Filtre na vylepšenie obrazu OCR
IronOCR poskytuje jedinečné filtre pre objekty OcrInput na zlepšenie výkonu OCR.
Príklad kódu na vylepšenie obrázka
Zvyšuje kvalitu vstupných obrázkov OCR a poskytuje lepšie a rýchlejšie výsledky OCR.
using IronOcr;varOcr = new IronTesseract();Ocr.Language = OcrLanguage.Slovak;using (varInput = new OcrInput(@"LowQuality.jpeg")){Input.DeNoise(); // opravuje digitálny šum a zlé skenovanieInput.Deskew(); // opravuje rotáciu a perspektívu varResult = Ocr.Read(Input);Console.WriteLine(Result.Text);}
using IronOcr;
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Slovak;
using (var Input = new OcrInput(@"LowQuality.jpeg"))
{
Input.DeNoise(); // opravuje digitálny šum a zlé skenovanie
Input.Deskew(); // opravuje rotáciu a perspektívu
var Result = Ocr.Read(Input);
Console.WriteLine(Result.Text);
}
ImportsIronOcrPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.SlovakUsingInput = New OcrInput("LowQuality.jpeg")Input.DeNoise() ' opravuje digitálny šum a zlé skenovanieInput.Deskew() ' opravuje rotáciu a perspektívu DimResult = Ocr.Read(Input)Console.WriteLine(Result.Text)EndUsing
Imports IronOcr
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Slovak
Using Input = New OcrInput("LowQuality.jpeg")
Input.DeNoise() ' opravuje digitálny šum a zlé skenovanie
Input.Deskew() ' opravuje rotáciu a perspektívu
Dim Result = Ocr.Read(Input)
Console.WriteLine(Result.Text)
End Using
Zoznam obrazových filtrov OCR
Vstupné filtre na zvýšenie výkonu OCR, ktoré sú zabudované do programu IronOCR, zahŕňajú:
OcrInput.Rotate (dvojité stupne) - Otočí obrázky o niekoľko stupňov v smere hodinových
ručičiek. V protismere hodinových ručičiek použite záporné čísla.
OcrInput.Binarize () - tento obrazový filter zmení každý pixel na čierny alebo biely bez
akejkoľvek strednej výšky . Môže zlepšiť prípady výkonu OCR pri veľmi malom kontraste textu k
pozadiu.
OcrInput.ToGrayScale () - tento obrazový filter premení každý pixel na odtieň v odtieňoch
sivej. Je nepravdepodobné, že by sa zlepšila presnosť OCR, ale môže to zvýšiť rýchlosť
OcrInput.Contrast () - automatické zvýšenie kontrastu. Tento filter často zvyšuje rýchlosť a
presnosť OCR pri skenovaní s nízkym kontrastom.
OcrInput.DeNoise () - Odstráni digitálny šum. Tento filter by sa mal používať iba tam, kde sa
očakáva hluk.
OcrInput.Invert () - Invertuje každú farbu. Napr. Biela sa stáva čiernou: čierna sa stáva
bielou.
OcrInput.Dilate () - pokročilá morfológia. Dilatácia pridá pixely na hranice objektov
v obraze. Oproti Erode
OcrInput.Erode () - pokročilá morfológia. Erózia odstraňuje pixely na hraniciach
objektov Na rozdiel od rozšírenia
OcrInput.Deskew () - Otočí obrázok tak, aby bol správnym smerom nahor a kolmý. To je pre OCR
veľmi užitočné, pretože tolerancia Tesseractu pri skreslených skenoch môže byť až 5 stupňov.
OcrInput.DeepCleanBackgroundNoise () - odstránenie silného pozadia. Tento
filter používajte iba v prípade, že je známy extrémny šum pozadia dokumentu, pretože tento filter tiež riskuje
zníženie presnosti OCR čistých dokumentov a je veľmi nákladný na procesor.
OcrInput.EnhanceResolution - zvyšuje rozlíšenie obrázkov nízkej kvality. Tento filter nie je
často potrebný, pretože OcrInput.MinimumDPI a OcrInput.TargetDPI automaticky zachytí a vyrieši
vstupy s nízkym rozlíšením.
CleanBackgroundNoise. Toto je nastavenie, ktoré je trochu časovo náročné; umožňuje však knižnici
automaticky čistiť digitálny šum, deformácie papiera a ďalšie nedokonalosti digitálneho obrazu, ktoré by ho inak
spôsobili, že ho nebude možné prečítať v iných knižniciach OCR.
EnhanceContrast je nastavenie, ktoré spôsobuje, že program IronOCR automaticky zvyšuje kontrast
textu na pozadí obrázka, zvyšuje presnosť OCR a všeobecne zvyšuje výkon a rýchlosť OCR.
EnhanceResolution je nastavenie, ktoré automaticky detekuje obrázky s nízkym rozlíšením (ktoré
nedosahujú 275 dpi), automaticky ich zväčší a potom zostrí všetok text, aby ho mohol knižnica OCR
perfektne prečítať. Aj keď je táto operácia sama osebe časovo náročná, spravidla znižuje celkový čas operácie OCR v
obraze.
Jazyk IronOCR podporuje 22 medzinárodných jazykových balíkov a jazykové nastavenie je možné použiť
na výber jedného alebo viacerých jazykov, ktoré sa použijú pre operáciu OCR.
Strategy IronOCR podporuje dve stratégie. Môžeme sa rozhodnúť buď pre rýchle a menej presné
skenovanie dokumentu, alebo použiť pokročilú stratégiu, ktorá využíva niektoré modely umelej inteligencie na
automatické zlepšenie presnosti textu OCR pri pohľade na štatistický vzťah slov k sebe navzájom vo vete.
ColorSpace je nastavenie, pri ktorom môžeme zvoliť OCR v odtieňoch sivej alebo farebne. Všeobecne
je najlepšou voľbou škála šedej. Avšak niekedy, keď existujú texty alebo pozadia podobného odtieňa, ale veľmi
odlišnej farby, poskytne plnofarebný farebný priestor lepšie výsledky.
DetectWhiteTextOnDarkBackgrounds. Všeobecne všetky knižnice OCR očakávajú, že sa čierny text
zobrazí na bielom pozadí. Toto nastavenie umožňuje aplikácii IronOCR automaticky detekovať negatívy alebo tmavé
stránky s bielym textom a čítať ich.
InputImageType. Toto nastavenie umožňuje vývojárovi viesť knižnicu OCR, či sa pozerá na celý
dokument alebo úryvok, napríklad na snímku obrazovky.
RotateAndStraighten je pokročilé nastavenie, ktoré umožňuje aplikácii IronOCR jedinečnú schopnosť
čítať dokumenty, ktoré nielen rotujú, ale obsahujú aj perspektívu, napríklad fotografie textových dokumentov.
ReadBarcodes je užitočná funkcia, ktorá umožňuje aplikácii IronOCR automaticky čítať čiarové kódy
a QR kódy na stránkach, pretože tiež číta text, a to bez ďalšej veľkej časovej záťaže.
Hĺbka farieb. Toto nastavenie určuje, koľko bitov na pixel bude knižnica OCR používať na určenie
hĺbky farby. Vyššia farebná hĺbka môže zvýšiť kvalitu OCR, ale tiež predĺži čas potrebný na dokončenie operácie OCR.
Medzi jazyky patrí nemčina, francúzština, angličtina, čínština, japončina a mnoho ďalších. K dispozícii sú
špecializované jazykové balíčky pre pasy MRZ, kontroly MICR, finančné údaje, ŠPZ a mnoho ďalších. Môžete tiež použiť
akýkoľvek súbor Tesseract „.traineddata“ - vrátane tých, ktoré si sami vytvoríte.
Príklad jazyka
Používanie iných jazykov OCR.
// using IronOcr;// PM> Install-Package IronOcr.Languages.ArabicvarOcr = new IronTesseract();Ocr.Language = OcrLanguage.Arabic;using (var input = new OcrInput()){ input.AddImage("img/arabic.gif"); // V prípade potreby pridajte obrázkové filtre // V takom prípade je aj myšlienkový vstup veľmi nízkej kvality // IronTesseract dokáže prečítať to, čo bežný Tesseract nie varResult = Ocr.Read(input); // Konzola nedokáže ľahko vytlačiť arabčinu v systéme Windows. // Namiesto toho uložme na disk.Result.SaveAsTextFile("arabic.txt");}
// using IronOcr;
// PM> Install-Package IronOcr.Languages.Arabic
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Arabic;
using (var input = new OcrInput())
{
input.AddImage("img/arabic.gif");
// V prípade potreby pridajte obrázkové filtre
// V takom prípade je aj myšlienkový vstup veľmi nízkej kvality
// IronTesseract dokáže prečítať to, čo bežný Tesseract nie
var Result = Ocr.Read(input);
// Konzola nedokáže ľahko vytlačiť arabčinu v systéme Windows.
// Namiesto toho uložme na disk.
Result.SaveAsTextFile("arabic.txt");
}
' using IronOcr;' PM> Install-Package IronOcr.Languages.ArabicDimOcr = New IronTesseract()Ocr.Language = OcrLanguage.ArabicUsing input = New OcrInput() input.AddImage("img/arabic.gif") ' V prípade potreby pridajte obrázkové filtre ' V takom prípade je aj myšlienkový vstup veľmi nízkej kvality ' IronTesseract dokáže prečítať to, čo bežný Tesseract nie DimResult = Ocr.Read(input) ' Konzola nedokáže ľahko vytlačiť arabčinu v systéme Windows. ' Namiesto toho uložme na disk.Result.SaveAsTextFile("arabic.txt")EndUsing
' using IronOcr;
' PM> Install-Package IronOcr.Languages.Arabic
Dim Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Arabic
Using input = New OcrInput()
input.AddImage("img/arabic.gif")
' V prípade potreby pridajte obrázkové filtre
' V takom prípade je aj myšlienkový vstup veľmi nízkej kvality
' IronTesseract dokáže prečítať to, čo bežný Tesseract nie
Dim Result = Ocr.Read(input)
' Konzola nedokáže ľahko vytlačiť arabčinu v systéme Windows.
' Namiesto toho uložme na disk.
Result.SaveAsTextFile("arabic.txt")
End Using
Viacjazyčný príklad
Je tiež možné OCR pomocou viacerých jazykov súčasne. To skutočne môže pomôcť získať metadáta a adresy URL v
anglickom jazyku v dokumentoch Unicode.
// using IronOcr;// PM> Install-Package IronOcr.Languages.ChineseSimplifiedvarOcr = new IronTesseract();Ocr.Language = OcrLanguage.ChineseSimplified;Ocr.AddSecondaryLanguage(OcrLanguage.Slovak);// Môžeme pridať ľubovoľný počet jazykovusing (var input = new OcrInput()){ input.Add("multi-language.pdf"); varResult = Ocr.Read(input);Result.SaveAsTextFile("results.txt");}
// using IronOcr;
// PM> Install-Package IronOcr.Languages.ChineseSimplified
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.ChineseSimplified;
Ocr.AddSecondaryLanguage(OcrLanguage.Slovak);
// Môžeme pridať ľubovoľný počet jazykov
using (var input = new OcrInput())
{
input.Add("multi-language.pdf");
var Result = Ocr.Read(input);
Result.SaveAsTextFile("results.txt");
}
' using IronOcr;' PM> Install-Package IronOcr.Languages.ChineseSimplifiedDimOcr = New IronTesseract()Ocr.Language = OcrLanguage.ChineseSimplifiedOcr.AddSecondaryLanguage(OcrLanguage.Slovak)' Môžeme pridať ľubovoľný počet jazykovUsing input = New OcrInput() input.Add("multi-language.pdf") DimResult = Ocr.Read(input)Result.SaveAsTextFile("results.txt")EndUsing
' using IronOcr;
' PM> Install-Package IronOcr.Languages.ChineseSimplified
Dim Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.ChineseSimplified
Ocr.AddSecondaryLanguage(OcrLanguage.Slovak)
' Môžeme pridať ľubovoľný počet jazykov
Using input = New OcrInput()
input.Add("multi-language.pdf")
Dim Result = Ocr.Read(input)
Result.SaveAsTextFile("results.txt")
End Using
Podrobné objekty výsledkov OCR
IronOCR vráti objekt výsledku OCR pre každú operáciu OCR. Vývojári spravidla používajú iba textovú vlastnosť tohto
objektu na získanie textu naskenovaného z obrázka. Výsledky OCR v DOM sú však oveľa pokročilejšie.
using IronOcr;using System.Drawing; // Pridajte odkaz na zostavuvarOcr = new IronTesseract();Ocr.Language = OcrLanguage.Slovak;Ocr.Configuration.EngineMode = TesseractEngineMode.TesseractAndLstm;Ocr.Configuration.ReadBarCodes = true; //! Dôležitéusing (varInput = new OcrInput(@"images\sample.tiff")){ OcrResultResult = Ocr.Read(Input); varPages = Result.Pages; varWords = Pages[0].Words; varBarcodes = Result.Barcodes; // Preskúmajte tu a nájdite rozsiahle a podrobné API: // - Stránky, bloky, parafafy, čiary, slová, znamienka // - Export obrázkov, súradnice písma, štatistické údaje}
using IronOcr;
using System.Drawing; // Pridajte odkaz na zostavu
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Slovak;
Ocr.Configuration.EngineMode = TesseractEngineMode.TesseractAndLstm;
Ocr.Configuration.ReadBarCodes = true; //! Dôležité
using (var Input = new OcrInput(@"images\sample.tiff"))
{
OcrResult Result = Ocr.Read(Input);
var Pages = Result.Pages;
var Words = Pages[0].Words;
var Barcodes = Result.Barcodes;
// Preskúmajte tu a nájdite rozsiahle a podrobné API:
// - Stránky, bloky, parafafy, čiary, slová, znamienka
// - Export obrázkov, súradnice písma, štatistické údaje
}
ImportsIronOcrImportsSystem.Drawing' Pridajte odkaz na zostavuPrivateOcr = New IronTesseract()Ocr.Language = OcrLanguage.SlovakOcr.Configuration.EngineMode = TesseractEngineMode.TesseractAndLstmOcr.Configuration.ReadBarCodes = True '! DôležitéUsingInput = New OcrInput("images\sample.tiff") DimResultAsOcrResult = Ocr.Read(Input) DimPages = Result.Pages DimWords = Pages(0).Words DimBarcodes = Result.Barcodes ' Preskúmajte tu a nájdite rozsiahle a podrobné API: ' - Stránky, bloky, parafafy, čiary, slová, znamienka ' - Export obrázkov, súradnice písma, štatistické údajeEndUsing
Imports IronOcr
Imports System.Drawing ' Pridajte odkaz na zostavu
Private Ocr = New IronTesseract()
Ocr.Language = OcrLanguage.Slovak
Ocr.Configuration.EngineMode = TesseractEngineMode.TesseractAndLstm
Ocr.Configuration.ReadBarCodes = True '! Dôležité
Using Input = New OcrInput("images\sample.tiff")
Dim Result As OcrResult = Ocr.Read(Input)
Dim Pages = Result.Pages
Dim Words = Pages(0).Words
Dim Barcodes = Result.Barcodes
' Preskúmajte tu a nájdite rozsiahle a podrobné API:
' - Stránky, bloky, parafafy, čiary, slová, znamienka
' - Export obrázkov, súradnice písma, štatistické údaje
End Using
Výkon
Aplikácia IronOCR funguje po vybalení z krabice bez potreby vyladenia výkonu alebo výraznejšej úpravy vstupných
obrázkov.
Rýchlosť je ohromujúca: IronOCR.2020+ je až 10-krát rýchlejší a robí o 250% menej chýb ako predchádzajúce verzie.
Uč sa viac
Ak sa chcete dozvedieť viac informácií o OCR v jazykoch C#, VB, F# alebo v akomkoľvek inom jazyku .NET, prečítajte
si naše komunitné výukové programy
, ktoré poskytujú príklady skutočného sveta toho, ako sa dá IronOCR použiť, a môžu ukázať nuansy toho, ako z nich
vyťažiť maximum. tejto knižnice.
커티스 차우는 칼턴 대학교에서 컴퓨터 과학 학사 학위를 취득했으며, Node.js, TypeScript, JavaScript, React를 전문으로 하는 프론트엔드 개발자입니다. 직관적이고 미적으로 뛰어난 사용자 인터페이스를 만드는 데 열정을 가진 그는 최신 프레임워크를 활용하고, 잘 구성되고 시각적으로 매력적인 매뉴얼을 제작하는 것을 즐깁니다.