IRONSOFTWAREHOME

Eesti OCR C# ja .NET

Curtis Chau
Curtis Chau
Updated: 2026년 5월 9일
Selle dokumendi muud versioonid:

IronOCR on C# tarkvarakomponent, mis võimaldab .NET-kodeerijatel lugeda teksti piltidest ja PDF-dokumentidest 126 keeles, sealhulgas eesti keeles.

See on täiustatud Tesseracti kahvliharu, mis on ehitatud ainult .NET-i arendajatele ja edestab regulaarselt teisi Tesseract-mootoreid nii kiiruse kui ka täpsuse poolest.

IronOCR sisu. Keeled. Eesti

See pakett sisaldab 49 NET-i OCR-keelt:

  • Eestlane
  • Eesti Parim
  • EstonianFast

Lae alla

Eesti keele pakett [eesti]
* Download as Zip
* Install with as
https://www.nuget.org/packages/IronOcr.Languages.Estonian/'> NuGet

Paigaldamine

Esimene asi, mida peame tegema, on installida meie Eesti OCR-pakett teie .NET-projekti.

PM> Install-Package IronOcr.Languages.Estonian

Koodinäide

See C#-koodi näide loeb eestikeelset teksti pilt- või PDF-dokumendist.

// PM> Install-Package IronOcr.Languages.Estonian
using IronOcr;

var Ocr = new IronTesseract();
// Määra OCR-i keeleks Eesti
Ocr.Language = OcrLanguage.Estonian;

// Ava OCR-Input-fail
using (var Input = new OcrInput(@"images\Estonian.png"))
{
    // Loeb teksti etteantud pildifailist
    var Result = Ocr.Read(Input);
    // Resultaat tekstis
    var AllText = Result.Text;
}

Miks valida IronOCR?

Raud OCR on hõlpsasti installitav, täielik ja hästi dokumenteeritud .NET tarkvarakogu.

Valige IronOCR, et saavutada 99,8% + OCR-i täpsus ilma väliseid veebiteenuseid, jooksvaid tasusid kasutamata või konfidentsiaalseid dokumente Interneti kaudu saatmata.

Miks C# arendajad valivad IronOCR-i Vanilla Tesseract'i asemel:

  • Installige ühe DLL-i või Nugetina
  • Komplekti kuulub Tesseract 5, 4 ja 3 mootorid karbist.
  • Täpsus 99,8% ületab oluliselt tavalist Tesseract'i.
  • Lõõskav kiirus ja mitmekeermineerimine
  • Ühilduvad MVC, WebApp, töölaud, konsool ja serverirakendus
  • Töötamiseks pole Exesi ega C ++ koodi
  • Täielik PDF OCR-i tugi
  • OCR-i tegemiseks peaaegu iga pildifail või PDF
  • Täielik .NET Core, Standard ja FrameWork tugi
  • Paigaldage Windows, Mac, Linux, Azure, Docker, Lambda, AWS
  • Lugege vöötkoode ja QR-koode
  • Ekspordi OCR XHTML-i
  • Eksportige OCR otsitavatesse PDF-dokumentidesse
  • Mitme lõime tugi
  • 126 rahvusvahelist keelt, mida kõiki hallatakse Nugeti või OcrData failide kaudu
  • Väljavõtte pildid, koordinaadid, statistika ja fondid. Mitte ainult tekst.
  • Saab kasutada Tesseract OCR-i levitamiseks kaubanduslikes ja varalistes rakendustes.

Raudne OCR särab, kui töötate reaalsete piltide ja ebatäiuslike dokumentidega, nagu fotod, või madala eraldusvõimega skannidega, millel võib olla digitaalset müra või puudusi.

Teised .NET-platvormi jaoks mõeldud tasuta OCR- teegid, näiteks muud .NET Tesseract API-d ja veebiteenused, ei toimi nendes reaalses maailmas kasutamiseks nii hästi.

OCR koos Tesseract 5-ga - alustage kodeerimist C#-ga

Allpool olev koodinäide näitab, kui lihtne on pildilt teksti lugeda C# või VB .NET abil.

OneLiner

// Kiire tekstilugeja
string Text = new IronTesseract().Read(@"img\Screenshot.png").Text;

Konfigureeritav Hello World

// PM> Install-Package IronOcr.Languages.Estonian
using IronOcr;

var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Estonian;

// Kasutame OCR Input class-i piltide lisamiseks
using (var Input = new OcrInput())
{
    // Lisa pilt, millelt teksti lugeda
    Input.AddImage("images/sample.jpeg");
    // ... saate lisada suvalise arvu pilte
    var Result = Ocr.Read(Input);
    Console.WriteLine(Result.Text);
}

C# PDF OCR

Sama lähenemist saab samamoodi kasutada teksti väljavõtmiseks igast PDF-dokumendist.

using IronOcr;

var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Estonian;

// Pdf Input failide lugemine
using (var input = new OcrInput())
{
    input.AddPdf("example.pdf", "password");
    // Saame OCR-iks valida ka konkreetsed PDF-i leheküljenumbrid

    var Result = Ocr.Read(input);

    Console.WriteLine(Result.Text);
    Console.WriteLine($"{Result.Pages.Count()} Pages");
    // 1 leht igale PDF-i lehele
}

OCR mitme lehe TIFF-ide jaoks

OCR TIFF-failivormingu, sealhulgas mitmeleheküljeliste dokumentide lugemine. TIFF-i saab teisendada ka otsitava tekstiga PDF-failiks.

using IronOcr;

var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Estonian;

using (var Input = new OcrInput())
{
    // Lisatakse multiframes TIFF
    Input.AddMultiFrameTiff("multi - frame.tiff");
    var Result = Ocr.Read(Input);
    Console.WriteLine(Result.Text);
}

Vöötkoodid ja QR

Raudse OCR-i ainulaadne omadus on see, et ta saab teksti skannimise ajal dokumentidest lugeda vöötkoode ja QR-koode. OcrResult.OcrBarcode klassi OcrResult.OcrBarcode annavad arendajale üksikasjalikku teavet iga skannitud vöötkoodi kohta.

using IronOcr;

var Ocr = new IronTesseract();
Ocr.Configuration.ReadBarCodes = true;

using (var input = new OcrInput())
{
    input.AddImage("img/Barcode.png");
    var Result = Ocr.Read(input);
    foreach (var Barcode in Result.Barcodes)
    {
        Console.WriteLine(Barcode.Value);
        // Saadaval on ka muu teave nagu tüüp ja asukoht
    }
}

OCR piltide konkreetsetes piirkondades

Kõik IronOCR-i skannimis- ja lugemismeetodid võimaldavad täpselt määratleda, millist lehe osa või lehti me teksti lugeda tahame. See on standardiseeritud vormide vaatamisel väga kasulik ja võib säästa tohutult palju aega ja parandada tõhusust.

Kärpimispiirkondade kasutamiseks peame lisama süsteemiviite süsteemile System.Drawing, et saaksime kasutada objekti System.Drawing.Rectangle.

using IronOcr;
using System.Drawing;

var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Estonian;

using (var Input = new OcrInput())
{
    // Määrame konkreetse ala mõõtmed piksli täpsusega
    var ContentArea = new Rectangle() { X = 215, Y = 1250, Height = 280, Width = 1335 };

    Input.Add("document.png", ContentArea);

    var Result = Ocr.Read(Input);
    Console.WriteLine(Result.Text);
}

OCR madala kvaliteediga skannimiseks

Raud OCR OcrInput klass suudab parandada skaneeringuid, mida tavaline Tesseract ei oska lugeda.

using IronOcr;

var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Estonian;

using (var Input = new OcrInput(@"img\Potter.LowQuality.tiff"))
{
    Input.DeNoise(); // parandab digitaalse müra ja halva skannimise
    Input.Deskew(); // fikseerib pöörlemise ja perspektiivi
    var Result = Ocr.Read(Input);
    Console.WriteLine(Result.Text);
}

Ekspordi OCR-i tulemused otsitava PDF-failina

Pilt PDF-i, kopeeritavate tekstistringidega. Saab otsingumootorite ja andmebaaside abil indekseerida.

using IronOcr;

var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Estonian;

using (var Input = new OcrInput())
{
    Input.Title = "Quarterly Report";
    Input.AddImage("image1.jpeg");
    Input.AddImage("image2.png");
    Input.AddImage("image3.gif");

    var Result = Ocr.Read(Input);
    Result.SaveAsSearchablePdf("searchable.pdf");
}

TIFF otsitava PDF-i teisendamiseks

T teisendage TIFF-dokument (või mis tahes pildifailide rühm) otse otsitavaks PDF-failiks, mille siseveeb, veebisait ja Google'i otsingumootorid saavad üles indekseerida.

using IronOcr;

var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Estonian;

using (var Input = new OcrInput())
{
    Input.AddMultiFrameTiff("example.tiff");
    var Result = Ocr.Read(Input).SaveAsSearchablePdf("searchable.pdf");
}

Ekspordi OCR-i tulemused HTML-iga

OCR-pildi XHTML-teisendamine.

using IronOcr;

var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Estonian;

using (var Input = new OcrInput())
{
    Input.Title = "Html Title";
    Input.AddImage("image1.jpeg");
    var Result = Ocr.Read(Input);
    Result.SaveAsHocrFile("results.html");
}

OCR-pildi täiustamise filtrid

IronOCR pakub OCR-i jõudluse parandamiseks ainulaadseid filtreid OcrInput objektidele.

Kujutise täiustamise koodi näide

Muudab OCR-sisendkujutiste kvaliteedi paremate ja kiiremate OCR-tulemuste saamiseks.

using IronOcr;

var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Estonian;

using (var Input = new OcrInput(@"LowQuality.jpeg"))
{
    Input.DeNoise(); // parandab digitaalse müra ja halva skannimise
    Input.Deskew(); // fikseerib pöörlemise ja perspektiivi
    var Result = Ocr.Read(Input);
    Console.WriteLine(Result.Text);
}

OCR-pildifiltrite loend

IronOCR-i sisseehitatud sisendfiltrid OCR-i jõudluse parandamiseks hõlmavad järgmist:

  • OcrInput.Rotate (topelt kraadi) - pöörab pilte mitu kraadi päripäeva. Päripäeva liikumiseks kasutage negatiivseid numbreid.
  • OcrInput.Binarize () - see pildifilter muudab iga piksli mustaks või valgeks ilma keskteeta. Võib parandada OCR-i juhtumeid, kui teksti ja tausta taust on väga väike.
  • OcrInput.ToGrayScale () - see pildifilter muudab iga piksli halltooni varjundiks. Tõenäoliselt ei paranda OCR-i täpsust, kuid võib parandada kiirust
  • OcrInput.Contrast () - suurendab kontrasti automaatselt. See filter parandab madala kontrastsusega skannimisel sageli OCR-i kiirust ja täpsust.
  • OcrInput.DeNoise () - eemaldab digitaalse müra. Seda filtrit tuleks kasutada ainult eeldatava müra korral.
  • OcrInput.Invert () - muudab kõik värvid. Nt Valgest saab must: must saab valgeks.
  • OcrInput.Dilate () - täiustatud morfoloogia. Laiendamine lisab pildil olevate objektide piiridele piksleid. Erode'i vastas
  • OcrInput.Erode () - täiustatud morfoloogia. Erosioon eemaldab pikslid objekti piiridest Vastupidi laiendusele
  • OcrInput.Deskew () - pöörab pilti nii, et see oleks õige üles- ja ristkülikukujuline. See on OCR-i jaoks väga kasulik, sest Tesseract'i tolerants vildakate skannide jaoks võib olla kuni 5 kraadi.
  • OcrInput.DeepCleanBackgroundNoise () - tugeva taustamüra eemaldamine. Kasutage seda filtrit ainult juhul, kui on teada dokumendi äärmine taustamüra, kuna see filter võib vähendada ka puhaste dokumentide OCR-täpsust ja on väga protsessoriga kulukas.
  • OcrInput.EnhanceResolution - suurendab madala kvaliteediga piltide eraldusvõimet. Seda filtrit pole sageli vaja, sest OcrInput.MinimumDPI ja OcrInput.TargetDPI püüavad ja lahendavad madala eraldusvõimega sisendid automaatselt.

CleanBackgroundMüra. See on seade, mis on mõnevõrra aeganõudev; see võimaldab siiski raamatukogul digitaalset müra, kortsusid ja muid puudusi automaatselt puhastada, mis muidu muudaksid selle OCR-i raamatukogudes loetamatuks.

EnhanceContrast on seade, mis paneb Raud-OCR-i suurendama teksti kontrastsust automaatselt pildi taustal, suurendades OCR-i täpsust ning üldiselt suurendades OCR-i jõudlust ja kiirust.

EnhanceResolution on säte, mis tuvastab automaatselt madala eraldusvõimega pildid (mis on alla 275 dpi), suurendab pilti automaatselt ja teravustab kogu teksti, nii et OCR-i raamatukogu saaks seda ideaalselt lugeda. Kuigi see toiming on iseenesest aeganõudev, vähendab see üldjuhul pildi OCR-toimingu kogu aega.

Keel IronOCR toetab 22 rahvusvahelist keelepaketti ja keeleseadet saab kasutada ühe või mitme OCR-i jaoks rakendatava keele valimiseks.

Strategy IronOCR toetab kahte strateegiat. Võime valida kas dokumendi kiire ja vähem täpse skannimise või kasutada täpsemat strateegiat, mis kasutab mõningaid tehisintellekti mudeleid OCR-teksti täpsuse automaatseks parandamiseks, vaadates lauses sõnade statistilist suhet. .

ColorSpace on seade, mille abil saame valida OCR-i halltoonides või värvides. Üldiselt on halltoon parim valik. Kuid mõnikord, kui tekstid või taust on sarnase tooniga, kuid väga erineva värviga, annab täisvärviline värviruum paremaid tulemusi.

DetectWhiteTextOnDarkBackgrounds. Üldiselt loodavad kõik OCR-i raamatukogud näha musta teksti valgel taustal. See seade võimaldab raua OCR-il tuvastada negatiivseid või tumedaid valge tekstiga lehti ja neid lugeda.

InputImageType. See seade võimaldab arendajal suunata OCR-i teeki, kas see vaatab täielikku dokumenti või fragmenti, näiteks ekraanipilti.

RotateAndStraighten on täiustatud seade, mis võimaldab raud-OCR- il ainulaadset võimalust lugeda dokumente, mis pole ainult pööratud, vaid võivad sisaldada perspektiivi, näiteks tekstidokumentide fotosid.

ReadBarcodes on kasulik funktsioon, mis võimaldab IronOCR- il lugeda lehtedel automaatselt vöötkoode ja QR-koode, kuna see loeb ka teksti, lisamata suurt ajakulu.

VärvSügavus. See säte määrab, mitu bitti piksli kohta kasutab OCR-raamatukogu värvi sügavuse määramiseks. Suurem värvisügavus võib suurendada OCR-kvaliteeti, kuid pikendab ka OCR-toimingu lõpuleviimiseks vajalikku aega.

126 keelepaketti

Raud OCR toetab 126 rahvusvahelist keelt keelepakettide kaudu, mida levitatakse DLL- failidena, mille saab alla laadida sellelt veebisaidilt või ka NuGet Package Managerist.

Keeled hõlmavad saksa, prantsuse, inglise, hiina, jaapani ja palju muud. Spetsialistide keelepaketid on olemas passide MRZ, MICR kontrollide, finantsandmete, numbrimärkide ja paljude muude jaoks. Võite kasutada ka mis tahes Tesseract ".traineddata" faili - ka neid, mille olete ise loonud.

Keele näide

Muude OCR-keelte kasutamine.

using IronOcr;

// PM> Install IronOcr.Languages.Arabic
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Arabic;

using (var input = new OcrInput())
{
    input.AddImage("img/arabic.gif");
    // Vajadusel lisage pildifiltrid
    // Sellisel juhul on isegi mõte sisendi väga madala kvaliteediga
    // IronTesseract suudab lugeda seda, mida tavaline Tesseract ei suuda.

    var Result = Ocr.Read(input);

    // Konsool ei saa araabia keelt Windowsis hõlpsalt printida.
    // Salvestame selle asemel kettale.
    Result.SaveAsTextFile("arabic.txt");
}

Näide mitme keelega

Samuti on võimalik OCR-i kasutada mitut keelt korraga. See võib tõesti aidata saada ingliskeelseid metaandmeid ja URL-e Unicode'i dokumentidesse.

using IronOcr;

// PM> Install IronOcr.Languages.ChineseSimplified
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.ChineseSimplified;

// Lisame teise keele
Ocr.AddSecondaryLanguage(OcrLanguage.Estonian);

// Saame lisada suvalise arvu keeli
using (var input = new OcrInput())
{
    input.Add("multi - language.pdf");
    var Result = Ocr.Read(input);
    Result.SaveAsTextFile("results.txt");
}

Üksikasjalikud OCR-i tulemuste objektid

Raud OCR tagastab iga OCR-toimingu jaoks OCR-i tulemuse objekti. Üldiselt kasutavad arendajad selle objekti tekstiomadust ainult pildilt skannitud teksti saamiseks. Kuid OCR-i tulemuste DOM on sellest palju arenenum.

using IronOcr;
using System.Drawing; // Lisa kokkupaneku viide

var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Estonian;
Ocr.Configuration.EngineMode = TesseractEngineMode.TesseractAndLstm;
Ocr.Configuration.ReadBarCodes = true; // Tähtis

using (var Input = new OcrInput(@"images\sample.tiff"))
{
    OcrResult Result = Ocr.Read(Input);
    var Pages = Result.Pages;
    var Words = Pages[0].Words;
    var Barcodes = Result.Barcodes;
    // Uurige siit, et leida ulatuslik ja üksikasjalik API:
    // - lehed, plokid, parafafid, read, sõnad, sümbolid
    // - piltide eksport, fondide koordinaadid, statistilised andmed
}

Performance

IronOCR töötab karbist välja, ilma et oleks vaja sisendkujutisi jõudlust häälestada või tugevalt muuta.

Kiirus on lõõskav: IronOCR.2020 + on kuni 10 korda kiirem ja teeb üle 250% vähem vigu kui eelmised järkud.

Lisateave

Lisateabe saamiseks OCR-i kohta C #, VB, F # või mõnes muus .NET keeles lugege palun meie kogukonna õpetusi, mis toovad reaalses maailmas näiteid selle kohta, kuidas rauda OCR-i saab kasutada, ja võivad näidata nüansse, kuidas parimat saavutada see raamatukogu.

Saadaval on ka täielik NET-arendajate objektiviide.

Curtis Chau
기술 문서 작성자

커티스 차우는 칼턴 대학교에서 컴퓨터 과학 학사 학위를 취득했으며, Node.js, TypeScript, JavaScript, React를 전문으로 하는 프론트엔드 개발자입니다. 직관적이고 미적으로 뛰어난 사용자 인터페이스를 만드는 데 열정을 가진 그는 최신 프레임워크를 활용하고, 잘 구성되고 시각적으로 매력적인 매뉴얼을 제작하는 것을 즐깁니다.

...
더 읽어보기

시작할 준비 되셨나요?

Nuget Downloads 6,236,385버전:2026.9방금 출시

지금 바로 30일 무료 체험판 키를 받으세요.
신용카드나 계정 생성은 필요하지 않습니다.
PDF용 C# NuGet 라이브러리
NuGet을 사용하여 설치하세요

버전: 2026.9

PM > Install-Package IronOcr
nuget.org/packages/IronOcr/
  1. 솔루션 탐색기에서 참조를 마우스 오른쪽 버튼으로 클릭하고 NuGet 패키지 관리를 선택합니다.
  2. 찾아보기를 선택하고 "IronOCR"을 검색하세요.
  3. 패키지를 선택하고 설치하세요
C# PDF DLL
DLL 다운로드

버전: 2026.9

또는 여기에서 Windows 설치 프로그램을 다운로드하십시오.

  1. IronOCR을 다운로드하고 솔루션 디렉터리 내의 ~/Libs와 같은 위치에 압축을 푸세요.
  2. Visual Studio 솔루션 탐색기에서 참조를 마우스 오른쪽 버튼으로 클릭합니다. 찾아보기를 선택하고 "IronOCR.dll"을 선택합니다.

라이선스 가격은 749달러 부터 시작합니다.

Key in blue circle

무료 30일 체험 키를 즉시 받으세요.

Your trial license will be sent to your email address

제한 없음. 100% 무제한 이용. 신용카드 불필요.

bullet_checked신용카드나 계정 생성은 필요하지 않습니다.제한 없음. 100% 무제한 이용. 신용카드 불필요.
  • Logo Aetna
  • Logo NASA
  • Logo GE
  • Logo Porsche
  • Logo USDA
  • Logo Qatar
Join Millions of Engineers who’ve tried IronPDF
부담 없는 무료 상담을 받아보세요
아래 양식을 작성하시거나 sales@ironsoftware.com으로 이메일을 보내주세요.
고객님의 정보는 항상 비밀로 유지됩니다.
전 세계 수백만 엔지니어들이 신뢰하는 제품입니다.
Iron Software의 고객 로고
지금 바로 30일 무료 체험판 키를 받으세요.
신용카드나 계정 생성은 필요하지 않습니다.