IRONSOFTWAREHOME

Suomalainen OCR C# ja .NET

Curtis Chau
Curtis Chau
Updated: 2026年5月9日
Tämän asiakirjan muut versiot:

IronOCR on C#-ohjelmistokomponentti, jonka avulla .NET-kooderit voivat lukea tekstiä kuvista ja PDF-dokumenteista 126 kielellä, mukaan lukien suomi.

Se on edistyksellinen Tesseract-haarukka, joka on rakennettu yksinomaan .NET-kehittäjille ja joka ylittää säännöllisesti muita Tesseract-moottoreita sekä nopeuden että tarkkuuden suhteen.

IronOcr. Kielet -suomi

Tämä paketti sisältää 46 OCR-kieltä .NET-verkkotunnukselle:

  • Suomalainen
  • Suomen paras
  • FinnishNopea

Ladata

Suomen kielipaketti [suomi]
* Download as Postinumero
* Install with https://www.nuget.org/packages/IronOcr.Languages.Finnish/ NuGet

Asennus

Ensimmäinen asia, joka meidän on tehtävä, on asentaa suomalainen OCR-pakettimme .NET-projektiisi.

PM> Install-Package IronOcr.Languages.Finnish

Koodiesimerkki

Tämä C#-koodiesimerkki lukee suomen kielen kuvan tai PDF-asiakirjan.

// This C# example shows how to use IronOCR to read Finnish text from an image.
using IronOCR;

var Ocr = new IronTesseract();

// Set the OCR language to Finnish
Ocr.Language = OcrLanguage.Finnish;

// Load the image and perform OCR
using (var Input = new OcrInput(@"images\Finnish.png"))
{
    var Result = Ocr.Read(Input);
    var AllText = Result.Text;
}
C#

Miksi valita IronOCR?

IronOCR on helposti asennettava, täydellinen ja hyvin dokumentoitu .NET-ohjelmistokirjasto.

Valitse IronOCR saavuttaaksesi 99,8% + OCR-tarkkuuden käyttämättä ulkoisia verkkopalveluja, jatkuvia maksuja tai lähettämättä luottamuksellisia asiakirjoja Internetin kautta.

Miksi C#-kehittäjät valitsevat IronOCR: n Vanilla Tesseractin sijaan:

  • Asenna yhtenä DLL tai NuGet
  • Sisältää Tesseract 5, 4 ja 3 -moottorit laatikosta.
  • Tarkkuus 99,8% ylittää merkittävästi tavallisen Tesseractin.
  • Räjähtävä nopeus ja monisäikeisyys
  • MVC, WebApp, työpöytä, konsoli ja palvelinsovellus yhteensopiva
  • Ei Exes- tai C ++ -koodia
  • Täysi PDF OCR -tuki
  • Suorita OCR lähes mille tahansa kuvatiedostolle tai PDF: lle
  • Täysi .NET Core, Standard ja FrameWork -tuki
  • Ota käyttöön Windows, Mac, Linux, Azure, Docker, Lambda, AWS
  • Lue viivakoodit ja QR-koodit
  • Vie OCR XHTML: ksi
  • Vie tekstintunnistus haettaviin PDF-tiedostoihin
  • Monisäikeinen tuki
  • 126 kansainvälistä kieltä, joita kaikkia hallitaan NuGet- tai OcrData-tiedostojen kautta
  • Pura kuvat, koordinaatit, tilastot ja fontit. Ei vain tekstiä.
  • Voidaan käyttää Tesseract OCR -toiminnon jakamiseen kaupallisissa ja omistetuissa sovelluksissa.

Rauta-OCR loistaa työskenneltäessä tosielämän kuvien ja epätäydellisten asiakirjojen, kuten valokuvien, tai pienikokoisten skannausten kanssa, joissa voi olla digitaalista kohinaa tai puutteita.

Muut .NET-alustan ilmaiset OCR- kirjastot, kuten muut .net tesseract -sovellusliittymät ja verkkopalvelut, eivät toimi niin hyvin näissä todellisen maailman käyttötapauksissa.

OCR Tesseract 5:llä - Aloita koodaus C#:ssä

Alla oleva koodinäyte osoittaa, kuinka helppoa on lukea tekstiä kuvasta käyttämällä C# tai VB.NET.

One Liner

// A one-liner example of reading text from an image using IronOCR
string Text = new IronTesseract().Read(@"img\Screenshot.png").Text;

Konfiguroitava Hello World

// Configurable Hello World example using IronOCR
// PM> `Install-Package IronOcr.Languages.Finnish`
using IronOCR;

var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Finnish;

using (var Input = new OcrInput())
{
    Input.AddImage("images/sample.jpeg");
    // You can add any number of images
    var Result = Ocr.Read(Input);
    Console.WriteLine(Result.Text);
}
C#

C# PDF OCR

Samaa lähestymistapaa voidaan käyttää samalla tavoin poimia tekstiä mistä tahansa PDF-dokumentista.

// Extract text from a PDF document using IronOCR
var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Finnish;

using (var Input = new OcrInput())
{
    Input.AddPdf("example.pdf", "password");
    // We can also select specific PDF page numbers for OCR

    var Result = Ocr.Read(Input);

    Console.WriteLine(Result.Text);
    Console.WriteLine($"{Result.Pages.Count()} Pages");
    // 1 page for each PDF page
}

OCR monisivuisille TIFF-tiedostoille

OCR TIFF-tiedostomuodon lukeminen, mukaan lukien monisivuiset asiakirjat. TIFF voidaan myös muuntaa suoraan PDF-tiedostoksi, jossa on haettavaa tekstiä.

// Read a multi-page TIFF file using IronOCR
using IronOCR;

var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Finnish;

using (var Input = new OcrInput())
{
    Input.AddMultiFrameTiff("multi-frame.tiff");
    var Result = Ocr.Read(Input);
    Console.WriteLine(Result.Text);
}
C#

Viivakoodit ja QR

IronOCR: n ainutlaatuinen piirre on se, että se voi lukea viivakoodeja ja QR-koodeja asiakirjoista, kun se etsii tekstiä. OcrResult.OcrBarcode luokan OcrResult.OcrBarcode antavat kehittäjälle yksityiskohtaisia tietoja kustakin skannatusta viivakoodista.

// Detect barcodes and QR codes using IronOCR
using IronOCR;

var Ocr = new IronTesseract();
Ocr.Configuration.ReadBarCodes = true;

using (var Input = new OcrInput())
{
    Input.AddImage("img/Barcode.png");
    var Result = Ocr.Read(Input);
    foreach (var Barcode in Result.Barcodes)
    {
        Console.WriteLine(Barcode.Value);
        // Type and location properties are also exposed
    }
}
C#

OCR tietyillä kuvialueilla

Kaikki IronOCR: n skannaus- ja lukumenetelmät antavat mahdollisuuden määrittää tarkalleen, mistä sivun tai sivuista haluamme lukea tekstiä. Tämä on erittäin hyödyllistä, kun tarkastelemme standardoituja lomakkeita, ja se voi säästää paljon aikaa ja parantaa tehokkuutta.

Raja-alueiden käyttämiseksi meidän on lisättävä System.Drawing järjestelmäviitta, jotta voimme käyttää System.Drawing.Rectangle objektia.

// Specify a rectangular area in an image for OCR
using IronOCR;
using System.Drawing; // Required for Rectangle

var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Finnish;

using (var Input = new OcrInput())
{
    // Define the area to OCR in pixels
    var ContentArea = new System.Drawing.Rectangle() { X = 215, Y = 1250, Height = 280, Width = 1335 };

    Input.Add("document.png", ContentArea);

    var Result = Ocr.Read(Input);
    Console.WriteLine(Result.Text);
}
C#

OCR heikkolaatuisille skannauksille

IronOCR OcrInput -luokka voi korjata skannaukset, joita normaali Tesseract ei osaa lukea.

// Improve OCR performance on low-quality scans with IronOCR
using IronOCR;

var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Finnish;

using (var Input = new OcrInput(@"img\Potter.LowQuality.tiff"))
{
    Input.DeNoise(); // Fixes digital noise and low-quality scanning
    Input.Deskew(); // Corrects image rotation and perspective
    var Result = Ocr.Read(Input);
    Console.WriteLine(Result.Text);
}
C#

Vie OCR-tulokset haettavana PDF-tiedostona

Kuva PDF-tiedostoon kopioitavilla tekstijonoilla. Hakukoneet ja tietokannat voivat indeksoida ne.

// Export an image with OCR text to a searchable PDF
using IronOCR;

var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Finnish;

using (var Input = new OcrInput())
{
    Input.Title = "Quarterly Report";
    Input.AddImage("image1.jpeg");
    Input.AddImage("image2.png");
    Input.AddImage("image3.gif");

    var Result = Ocr.Read(Input);
    Result.SaveAsSearchablePdf("searchable.pdf");
}
C#

TIFF haettavaksi PDF-muunnokseksi

Muunna TIFF-asiakirja (tai mikä tahansa kuvatiedostoryhmä) suoraan haettavaksi PDF-tiedostoksi, jonka intranet, verkkosivusto ja google-hakukoneet voivat indeksoida.

// Convert a TIFF file directly to a searchable PDF
using IronOCR;

var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Finnish;

using (var Input = new OcrInput())
{
    Input.AddMultiFrameTiff("example.tiff");
    var Result = Ocr.Read(Input).SaveAsSearchablePdf("searchable.pdf");
}
C#

Vie OCR-tulokset HTML-muodossa

OCR-kuvan XHTML-muunnos.

// Convert OCR results to an HTML file (XHTML)
using IronOCR;

var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Finnish;

using (var Input = new OcrInput())
{
    Input.Title = "Html Title";
    Input.AddImage("image1.jpeg");
    var Result = Ocr.Read(Input);
    Result.SaveAsHocrFile("results.html");
}
C#

OCR-kuvanparannussuodattimet

IronOCR tarjoaa ainutlaatuiset suodattimet OcrInput objekteille OCR-suorituskyvyn parantamiseksi.

Kuvanparannuskoodiesimerkki

Tekee OCR-tulokuvista paremman laadun parempien ja nopeampien OCR-tulosten tuottamiseksi.

// Improve image quality for better OCR results
using IronOCR;

var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Finnish;

using (var Input = new OcrInput(@"LowQuality.jpeg"))
{
    Input.DeNoise(); // Reduces digital noise and improves image quality
    Input.Deskew(); // Fixes rotation and perspective of the image
    var Result = Ocr.Read(Input);
    Console.WriteLine(Result.Text);
}
C#

Luettelo OCR-kuvasuodattimista

IronOCR: ään sisäänrakennetut tulosuodattimet OCR-suorituskyvyn parantamiseksi ovat:

  • OcrInput.Rotate (kaksinkertainen aste) - Kierrä kuvia useita astetta myötäpäivään. Käytä vastapäivään negatiivisia lukuja.
  • OcrInput.Binarize () - Tämä kuvasuodatin muuttaa jokaisen pikselin mustaksi tai valkoiseksi ilman keskipistettä. Voi parantaa OCR-suorituskykyä, kun tekstin ja taustan kontrasti on hyvin pieni.
  • OcrInput.ToGrayScale () - Tämä kuvasuodatin muuttaa jokaisen pikselin harmaasävyiseksi. Ei todennäköisesti paranna OCR-tarkkuutta, mutta voi parantaa nopeutta
  • OcrInput.Contrast () - Lisää kontrastia automaattisesti. Tämä suodatin parantaa usein tekstintunnistuksen nopeutta ja tarkkuutta pienikontrastisissa skannauksissa.
  • OcrInput.DeNoise () - Poistaa digitaalisen kohinan. Tätä suodatinta tulisi käyttää vain siellä, missä melua odotetaan.
  • OcrInput.Invert () - Kääntää kaikki värit. Esimerkiksi valkoisesta tulee musta: mustasta tulee valkoinen.
  • OcrInput.Dilate () - Edistynyt morfologia. Laajennus lisää pikseleitä kuvan kohteiden rajoihin. Eroden vastakohta
  • OcrInput.Erode () - Edistynyt morfologia. Eroosio poistaa pikselit objektirajoilta
  • OcrInput.Deskew () - Kierrä kuvaa niin, että se on oikea tie ylöspäin ja kohtisuorassa. Tämä on erittäin hyödyllistä OCR: lle, koska Tesseract-toleranssi vinossa skannauksessa voi olla jopa 5 astetta.
  • OcrInput.DeepCleanBackgroundNoise () - voimakas taustamelun poisto. Käytä tätä suodatinta vain, jos tiedetään äärimmäisen asiakirjan taustamelu, koska tämä suodatin saattaa myös vähentää puhtaiden asiakirjojen OCR-tarkkuutta ja on erittäin prosessorikallis.
  • OcrInput.EnhanceResolution - parantaa heikkolaatuisten kuvien tarkkuutta. Suodatinta ei tarvita usein, koska OcrInput.MinimumDPI ja OcrInput.TargetDPI saavat automaattisesti kiinni ja ratkaisevat matalan resoluution tulot.

PuhdasTaustaMelu. Tämä on aikaavievä asetus; se sallii kuitenkin kirjaston puhdistaa digitaalisen kohinan, paperin rypistykset ja muut puutteet digitaalisessa kuvassa, mikä muuten tekisi siitä kyvyttömän lukemaan muissa OCR-kirjastoissa.

EnhanceContrast on asetus, joka saa IronOCR: n lisäämään tekstin kontrastia automaattisesti kuvan taustaa vasten, lisäämällä OCR: n tarkkuutta ja yleisesti lisäämällä OCR: n suorituskykyä ja nopeutta.

EnhanceResolution on asetus, joka tunnistaa automaattisesti pieniresoluutioiset kuvat (jotka ovat alle 275 dpi), skaalaa kuvan automaattisesti ja terävöittää sitten kaiken tekstin, jotta OCR-kirjasto voi lukea sen täydellisesti. Vaikka tämä toimenpide on sinänsä aikaa vievää, se yleensä vähentää kuvan OCR-toiminnon kokonaisaikaa.

Language IronOCR tukee 22 kansainvälistä kielipakettia, ja kieliasetuksella voidaan valita yksi tai useampi OCR-toimintoon käytettävä kieli.

Strategia IronOCR tukee kahta strategiaa. Voimme joko valita asiakirjan nopean ja vähemmän tarkan skannauksen tai käyttää edistynyttä strategiaa, joka käyttää joitain tekoälymalleja OCR-tekstin tarkkuuden parantamiseksi automaattisesti tarkastelemalla sanojen tilastollista suhdetta lauseeseen .

ColorSpace on asetus, jolla voimme valita tekstintunnistuksen harmaasävyinä tai väreinä. Harmaasävy on yleensä paras vaihtoehto. Joskus, kun tekstit tai taustat ovat samankaltaisia, mutta hyvin erivärisiä, väriväritila antaa parempia tuloksia.

DetectWhiteTextOnDarkBackgrounds. Yleensä kaikki OCR-kirjastot odottavat näkevänsä mustaa tekstiä valkoisella taustalla. Tämän asetuksen avulla IronOCR tunnistaa negatiiviset tai tummat sivut valkoisella tekstillä ja lukee ne.

InputImageType. Tämän asetuksen avulla kehittäjä voi ohjata OCR-kirjastoa tarkastelemaan onko se kokonaista asiakirjaa vai katkelmaa, kuten kuvakaappausta.

RotateAndStraighten on edistynyt asetus, joka antaa IronOCR: lle ainutlaatuisen kyvyn lukea asiakirjoja, jotka eivät ole vain käännettyjä, mutta ehkä perspektiiviä, kuten valokuvia tekstidokumenteista.

ReadBarcodes on hyödyllinen ominaisuus, jonka avulla IronOCR voi lukea viivakoodit ja QR-koodit sivuilta automaattisesti lukiessaan tekstiä lisäämättä suurta lisäaikaa.

Värisyvyys. Tämä asetus määrittää, kuinka monta bittiä pikseliä kohden OCR-kirjasto käyttää värin syvyyden määrittämiseen. Suurempi värisyvyys voi lisätä OCR-laatua, mutta pidentää myös OCR-toiminnon suorittamiseen tarvittavaa aikaa.

126 kielipakettia

IronOCR tukee 126 kansainvälistä kieltä kielipakettien kautta, jotka jaetaan DLL-tiedostoina, jotka voidaan ladata tältä verkkosivustolta tai myös NuGet Package Managerista.

Kieliä ovat saksa, ranska, englanti, kiina, japani ja monet muut. Erikoiskielipaketteja on olemassa MRZ-passeille, MICR-tarkastuksille, taloudellisille tiedoille, rekisterikilville ja monille muille. Voit myös käyttää mitä tahansa tesseract ".traineddata" -tiedostoa - mukaan lukien itse luomasi tiedostot.

Kieliesimerkki

Muiden OCR-kielten käyttäminen.

// Using IronOCR with Arabic language support
// PM> Install IronOcr.Languages.Arabic

using IronOCR;

var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Arabic;

using (var Input = new OcrInput())
{
    Input.AddImage("img/arabic.gif");
    // Add image filters if necessary
    // IronTesseract can read what conventional Tesseract cannot, even if the input is of very low quality

    var Result = Ocr.Read(Input);

    // Console can't easily display Arabic text on Windows, so save it to file instead.
    Result.SaveAsTextFile("arabic.txt");
}
C#

Esimerkki monikielisestä

On myös mahdollista käyttää tekstintunnistusta useilla kielillä samanaikaisesti. Tämä voi todella auttaa saamaan englanninkielisiä metatietoja ja URL-osoitteita Unicode-asiakirjoihin.

// Using IronOCR for multi-language recognition
// PM> Install IronOcr.Languages.ChineseSimplified

using IronOCR;

var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.ChineseSimplified;
Ocr.AddSecondaryLanguage(OcrLanguage.Finnish);

// We can add any number of languages

using (var Input = new OcrInput())
{
    Input.Add("multi-language.pdf");
    var Result = Ocr.Read(Input);
    Result.SaveAsTextFile("results.txt");
}
C#

Yksityiskohtaiset OCR-tulokset-objektit

IronOCR palauttaa OCR-tulosobjektin jokaiselle OCR-toiminnolle. Yleensä kehittäjät käyttävät vain tämän objektin tekstiominaisuutta saadakseen tekstin skannatuksi kuvasta. OCR-tulosten DOM on kuitenkin paljon edistyneempi kuin tämä.

// Detailed OCR results using IronOCR
using IronOCR;
using System.Drawing; // Required assembly reference

var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Finnish;
Ocr.Configuration.EngineMode = TesseractEngineMode.TesseractAndLstm;
Ocr.Configuration.ReadBarCodes = true; // Important

using (var Input = new OcrInput(@"images\sample.tiff"))
{
    OcrResult Result = Ocr.Read(Input);
    var Pages = Result.Pages;
    var Words = Pages[0].Words;
    var Barcodes = Result.Barcodes;
    // Explore the extensive, detailed API for:
    // - Pages, Blocks, Paragraphs, Lines, Words, Characters
    // - Image exports, font coordinates, statistics
}
C#

Esitys

IronOCR toimii laatikosta ilman, että tarvitsee virittää tai muokata voimakkaasti tulokuvia.

Nopeus on loistava: IronOcr.2020 + on jopa 10 kertaa nopeampi ja tekee yli 250% vähemmän virheitä kuin aiemmat koontiversiot.

Lisätietoja

Jos haluat lisätietoja OCR: stä C#, VB, F# tai millä tahansa muulla .NET-kielellä, lue yhteisön oppaat, jotka antavat todellisia esimerkkejä siitä, miten IronOCR: ää voidaan käyttää, ja ne saattavat näyttää vivahteita siitä, miten saada parhaansa irti tämä kirjasto.

Täydellinen objektiviite .NET-kehittäjille on myös saatavana.

Curtis Chau
技术作家

Curtis Chau 拥有卡尔顿大学的计算机科学学士学位,专注于前端开发,精通 Node.js、TypeScript、JavaScript 和 React。他热衷于打造直观且美观的用户界面,喜欢使用现代框架并创建结构良好、视觉吸引力强的手册。

...
阅读更多

准备开始了吗?

Nuget Downloads 6,236,385版本:2026.9刚刚发布

立即获取您的免费30 天试用密钥
无需信用卡或创建账户
C# 用于 PDF 的 NuGet 库
通过 NuGet 安装

版本: 2026.9

PM > Install-Package IronOcr
nuget.org/packages/IronOcr/
  1. 在解决方案资源管理器中,右键点击引用,管理 NuGet 包
  2. 选择浏览并搜索"IronOCR"
  3. 选择包并安装
C# PDF DLL
下载 DLL

版本: 2026.9

或在这里下载Windows安装程序。

  1. 下载并解压IronOCR到你的解决方案目录中的~/Libs位置
  2. 在Visual Studio解决方案资源管理器中,右键点击引用。选择浏览,“IronOCR.dll”

许可证售价$999

Key in blue circle

立即获取免费的 30 天试用版密钥

Your trial license will be sent to your email address

无任何限制。100% 解锁。无需信用卡。

bullet_checked无需信用卡或创建账户无任何限制。100% 解锁。无需信用卡。
  • Logo Aetna
  • Logo NASA
  • Logo GE
  • Logo Porsche
  • Logo USDA
  • Logo Qatar
Join Millions of Engineers who’ve tried IronPDF
获取您的无义务咨询
填写下面的表格或通过sales@ironsoftware.com
您的资料将始终保密。
深受全球数百万工程师信赖
Iron Software 的客户徽标
立即获取您的免费30 天试用密钥
无需信用卡或创建账户