IRONSOFTWAREHOME

Македонски OCR во C# и .NET

Curtis Chau
Curtis Chau
Updated: 2026년 4월 23일
Други верзии на овој документ:

IronOCR е компонента на софтвер C# што им овозможува на .NET кодерите да читаат текст од слики и PDF документи на 126 јазици, вклучително и македонски.

Тоа е напредна вилушка на Tesseract, изградена исклучиво за .NET развивачите и редовно ги надминува другите Tesseract мотори и за брзина и за точност.

Содржина на IronOCR.Јазиците.македонски

Овој пакет содржи 55 јазици на OCR за .NET:

  • Македонски
  • MacedonianBest
  • MacedonianFast

Преземи

Пакет за македонски јазик [македонски јазик]

Инсталација

Првото нешто што треба да направиме е да го инсталираме нашиот македонски пакет OCR во вашиот .NET проект.

PM > Install-Package IronOcr.Languages.Macedonian

Пример за код

Овој пример со код C# чита македонски текст од документ за слика или PDF.

// Првично, инсталирајте го пакетот преку NuGet:
// PM> Install-Package IronOcr.Languages.Macedonian
using IronOcr;

var Ocr = new IronTesseract();
// Поставување на јазикот на Македонски
Ocr.Language = OcrLanguage.Macedonian;

using (var Input = new OcrInput(@"images\Macedonian.png"))
{
    var Result = Ocr.Read(Input);
    // Извлекување на текстот од OCR резултатите
    var AllText = Result.Text;
    // Прикажување на извлечениот текст
    Console.WriteLine(AllText);
}

Зошто да изберете IronOCR?

IronOCR е лесна за инсталација, комплетна и добро документирана .NET софтверска библиотека.

Изберете IronOCR за да постигнете 99,8% + OCR точност без употреба на надворешни веб-услуги, постојани такси или испраќање доверливи документи преку Интернет.

Зошто програмерите на C# избираат IronOCR наместо Vanilla Tesseract:

  • Инсталирајте како единствена DLL или NuGet
  • Вклучува мотори Tesseract 5, 4 и 3 надвор од кутијата
  • Точност 99,8% значително го надминува редовниот Tesseract
  • Брзина на светлината и мулти-нишка
  • Компатибилна со MVC, WebApp, Desktop, Console & Server апликација
  • Нема Exes или C++ код за работа
  • Целосна PDF OCR поддршка
  • Да извршите OCR скоро секоја датотека со слика или PDF
  • Целосна .NET Core, Standard и FrameWork поддршка
  • Распоредување на Windows, Mac, Linux, Azure, Docker, Lambda, AWS
  • Прочитајте баркодови и QR-кодови
  • Извоз на OCR како на XHTML
  • Изведете OCR во PDF документи што може да се пребаруваат
  • Поддршка за повеќе нишки
  • Со 126 меѓународни јазици управувано преку датотеките NuGet или OcrData
  • Извлечете слики, координати, статистика и фонтови. Не само текст.
  • Може да се користи за прераспределба на Tesseract OCR во комерцијални и сопственички апликации.

Ironелезниот OCR сјае кога работите со реални слики и несовршени документи, како што се фотографии, или скенирања со ниска резолуција што може да имаат дигитален шум или несовршености.

Другите бесплатни библиотеки за OCR за .NET платформата, како што се другите API-мрежи и мрежни услуги на .NET не функционираат толку добро во овие случаи на употреба во реалниот свет.

OCR со Tesseract 5 - започнете со кодирање во C#

Примерокот со код подолу покажува колку е лесно да се чита текст од слика со помош на C# или VB .NET.

OneLiner

// Оваа линија го чита текстот од слика со една линија
string Text = new IronTesseract().Read(@"img\Screenshot.png").Text;
// Приказ на добиениот текст
Console.WriteLine(Text);

Конфигурирање Здраво на светот

// PM> Install-Package IronOcr.Languages.Macedonian
using IronOcr;

var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Macedonian;

using (var Input = new OcrInput())
{
    // Додавање слика за OCR
    Input.AddImage("images/sample.jpeg");
    // Може да додадете кој било број на слики
    var Result = Ocr.Read(Input);
    // Прикажување на добиениот текст
    Console.WriteLine(Result.Text);
}

C# PDF OCR

Истиот пристап може слично да се искористи за да се извлече текст од кој било PDF документ.

using IronOcr;

var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Macedonian;

using (var input = new OcrInput())
{
    // Додавање на PDF документи и нивна лозинка ако е потребно
    input.AddPdf("example.pdf", "password");
    // Ние исто така можеме да избереме броеви на специфични PDF страници во OCR

    var Result = Ocr.Read(input);
    // Прикажување на извлечениот текст
    Console.WriteLine(Result.Text);
    // Броење на страниците од PDF
    Console.WriteLine($"{Result.Pages.Count} Pages");
    // 1 страница за секоја страница од PDF
}

OCR за повеќе страници TIFF

ОЦЦ читање формат на датотека TIFF, вклучувајќи повеќе страни документи. TIFF исто така може да се претвори директно во PDF-датотека со текст што може да се пребарува.

using IronOcr;

var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Macedonian;

using (var Input = new OcrInput())
{
    // Load a multi-frame TIFF image
    Input.AddMultiFrameTiff("multi-frame.tiff");
    var Result = Ocr.Read(Input);
    // Display the extracted text from TIFF image
    Console.WriteLine(Result.Text);
}

Баркодови и QR

Единствена карактеристика на IronOCR е тоа што може да чита баркодови и QR-кодови од документи додека скенира за текст. Инстанци од класата OcrResult.OcrBarcode му даваат на инвеститорот детални информации за секој скениран баркод.

using IronOcr;

var Ocr = new IronTesseract();
// Enable barcode reading
Ocr.Configuration.ReadBarCodes = true;

using (var input = new OcrInput())
{
    // Add an image that contains barcodes
    input.AddImage("img/Barcode.png");
    var Result = Ocr.Read(input);

    // Iterate through all detected barcodes and print their values
    foreach (var Barcode in Result.Barcodes)
    {
        Console.WriteLine(Barcode.Value);
        // Видот и својствата на локацијата исто така се изложени
    }
}

OCR на специфични области на слики

Сите методи на скенирање и читање на Ironелезниот OCR обезбедуваат можност точно да одредите од кој дел од страницата или страниците сакаме да читаме текст. Ова е многу корисно кога разгледуваме стандардизирани форми и може да заштедиме многу време и да ја подобриме ефикасноста.

За да користиме региони за сечење, ќе треба да додадеме системска референца на System.Drawing за да можеме да го користиме објектот System.Drawing.Rectangle.

using IronOcr;
using System.Drawing;

var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Macedonian;

using (var Input = new OcrInput())
{
    // Define the specific content area in an image to process OCR
    var ContentArea = new Rectangle() { X = 215, Y = 1250, Height = 280, Width = 1335 };
    // Димензиите се во px
    Input.Add("document.png", ContentArea);
    var Result = Ocr.Read(Input);
    // Print extracted text from the specified image region
    Console.WriteLine(Result.Text);
}

OCR за скенирање со низок квалитет

OcrInput класа може да поправи скенирање што нормалното Tesseract не може да ги прочита.

using IronOcr;

var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Macedonian;

using (var Input = new OcrInput(@"img\Potter.LowQuality.tiff"))
{
    // Apply image enhancements to improve OCR accuracy
    Input.DeNoise();   // Поправа дигитален шум и слабо скенирање
    Input.Deskew();    // Ги поправа ротацијата и перспективата
    var Result = Ocr.Read(Input);
    // Display extracted text
    Console.WriteLine(Result.Text);
}

Извоз на резултати од OCR како PDF што може да се пребарува

Слика во PDF со текстуални низи што може да се копираат. Може да се индексира од пребарувачите и базите на податоци.

using IronOcr;

var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Macedonian;

using (var Input = new OcrInput())
{
    // Give a title to the PDF
    Input.Title = "Quarterly Report";
    // Add images to process for OCR
    Input.AddImage("image1.jpeg");
    Input.AddImage("image2.png");
    Input.AddImage("image3.gif");

    var Result = Ocr.Read(Input);
    // Save the OCR result as a searchable PDF
    Result.SaveAsSearchablePdf("searchable.pdf");
}

TIFF конверзија во PDF со пребарување

Свртете документ TIFF (или која било група датотеки со слика) директно во PDF што може да се пребарува, а може да се индексира преку интранет, веб-страница и машини за пребарување на Google.

using IronOcr;

var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Macedonian;

using (var Input = new OcrInput())
{
    // Add multi-frame TIFF image for OCR processing
    Input.AddMultiFrameTiff("example.tiff");
    // Save results as a searchable PDF
    var Result = Ocr.Read(Input).SaveAsSearchablePdf("searchable.pdf");
}

Извоз на резултати од OCR како HTML

Конверзија на слика на OCR во XHTML.

using IronOcr;

var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Macedonian;

using (var Input = new OcrInput())
{
    // Set the title for HTML output
    Input.Title = "Html Title";
    Input.AddImage("image1.jpeg");
    var Result = Ocr.Read(Input);
    // Save OCR output in HOCR format
    Result.SaveAsHocrFile("results.html");
}

Филтри за подобрување на сликата OCR

IronOCR обезбедува уникатни филтри за објектите на OcrInput за подобрување на перформансите на OCR.

Пример за код за подобрување на сликата

Ги прави влезните слики на OCR повисок квалитет за да произведе подобри, побрзи резултати на OCR.

using IronOcr;

var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Macedonian;

using (var Input = new OcrInput(@"LowQuality.jpeg"))
{
    // Improve image quality using built-in filters
    Input.DeNoise();   // Поправа дигитален шум и слабо скенирање
    Input.Deskew();    // Ги поправа ротацијата и перспективата
    var Result = Ocr.Read(Input);
    // Display extracted text
    Console.WriteLine(Result.Text);
}

Список на филтри за слики на OCR

Влезните филтри за подобрување на перформансите на OCR кои се вградени во IronOCR вклучуваат:

  • OcrInput.Rotate(double degrees) - Ротира слики за голем број степени во насока на стрелките на часовникот. За анти-стрелките на часовникот, користете негативни броеви.
  • OcrInput.Binarize() - Овој филтер за слики го претвора секој пиксел во црно-бело без средно решение. Може да ги подобри случаите на изведба на OCR со многу мал контраст на текстот со позадината.
  • OcrInput.ToGrayScale() - Овој филтер за слики го претвора секој пиксел во нијанса на сива скала. Веројатно нема да ја подобри точноста на OCR, но може да ја подобри брзината.
  • OcrInput.Contrast() - автоматски го зголемува контрастот. Овој филтер често ја подобрува брзината и точноста на OCR при скенирање со низок контраст.
  • OcrInput.DeNoise() - го отстранува дигиталниот шум. Овој филтер треба да се користи само таму каде што се очекува бучава.
  • OcrInput.Invert() - Ја превртува секоја боја. На пр. Белата станува црна: црната станува бела.
  • OcrInput.Dilate() - Напредна морфологија. Проширувањето додава пиксели на границите на објектите на сликата. Наспроти Ероде.
  • OcrInput.Erode() - Напредна морфологија. Ерозијата ги отстранува пикселите на границите на предметите, спроти Дилатација.
  • OcrInput.Deskew() - Ротира слика, така што тоа е вистинскиот пат нагоре и ортогонално. Ова е многу корисно за OCR затоа што толеранцијата на Тесеракт за искривени скенирања може да биде до 5 степени.
  • OcrInput.DeepCleanBackgroundNoise() - Отстранување на бучавата во тешка позадина. Користете го овој филтер само во случај да е познат екстремен шум на позадината на документот, бидејќи овој филтер исто така ризикува да ја намали точноста на OCR на чистите документи и е многу скап за процесорот.
  • OcrInput.EnhanceResolution - Ја подобрува резолуцијата на слики со низок квалитет. Овој филтер не е често потребен затоа што OcrInput.MinimumDPI и OcrInput.TargetDPI автоматски ќе ги фатат и решат влезовите со ниска резолуција.

CleanBackgroundNoise. Ова е поставка што е малку време, сепак, тоа и овозможува на библиотеката автоматски да чисти дигитален шум, трошки од хартија и други несовршености во дигиталната слика што инаку би ја направило неспособна за читање од другите библиотеки на OCR.

EnhanceContrast е поставка што предизвикува железо OCR автоматски да го зголемува контрастот на текстот наспроти позадината на сликата, зголемувајќи ја точноста на OCR и генерално ја зголемува перформансите и брзината на OCR.

EnhanceResolution е поставка што автоматски ќе открива слики со ниска резолуција (кои се под 275 dpi) и автоматски ја зголемуваат сликата, а потоа го изоструваат целиот текст за да може совршено да се чита од библиотеката OCR. Иако оваа операција е само по себе одзема многу време, таа генерално го намалува целокупното време за операција со OCR на слика.

Јазично железо OCR поддржува 22 меѓународни јазични пакети, а поставката за јазик може да се искористи за избор на еден или повеќе повеќе јазици што ќе се применуваат за операција со OCR.

Стратегија Ironелезо OCR поддржува две стратегии. Може да избереме или да бараме брзо и помалку точно скенирање на документ или да користиме напредна стратегија што користи некои модели на вештачка интелигенција за автоматско подобрување на точноста на текстот на OCR со гледање на статистичката врска на зборовите еден со друг во реченица.

ColorSpace е поставка според која можеме да избереме OCR во сиво или во боја. Општо земено, сивата скала е најдобра опција. Сепак, понекогаш кога има текстови или позадини со слична нијанса, но со многу различна боја, просторот во боја во целосна боја ќе обезбеди подобри резултати.

Откријте белиот текст на мрачните позадини. Општо, сите библиотеки на OCR очекуваат да видат црн текст на бела позадина. Оваа поставка му овозможува на IronOCR автоматски да открива негативни страни или темни страници со бел текст и да ги чита.

InputImageType. Оваа поставка му овозможува на развивачот да ја води библиотеката OCR за тоа дали гледа целосен документ или фрагмент, како што е слика на екранот.

RotateAndStraighten е напредна поставка што му овозможува на железниот OCR единствена можност за читање документи кои не само што се ротираат, туку можеби содржат и перспектива, како што се фотографии на текстуални документи.

ReadBarcodes е корисна карактеристика што му овозможува на железниот OCR автоматски да чита бар-кодови и QR-кодови на страниците бидејќи исто така чита текст, без додавање на голем дополнителен временски товар.

Длабочина на бојата. Оваа поставка одредува колку битови по пиксел библиотеката OCR ќе користи за да ја одреди длабочината на бојата. Поголема длабочина на боја може да го зголеми квалитетот на OCR, но исто така ќе го зголеми времето потребно за завршување на операцијата OCR.

126 јазични пакети

IronOCR поддржува 126 меѓународни јазици преку јазични пакети кои се дистрибуираат како DLL, кои може да се преземат од оваа веб-страница, или исто така од NuGet Package Manager.

Јазиците вклучуваат германски, француски, англиски, кинески, јапонски и многу повеќе. Постојат специјални пакети за јазици за пасоши MRZ, проверки на MICR, финансиски податоци, регистарски таблички и многу повеќе. Можете исто така да користите која било датотека на Tesseract ".traineddata" - вклучувајќи ги и оние што сами ги креирате.

Јазик Пример

Користење на други јазици на OCR.

// PM> Install IronOcr.Languages.Arabic
using IronOcr;

var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Arabic;

using (var input = new OcrInput())
{
    // Adding an image for Arabic OCR
    input.AddImage("img/arabic.gif");
    // Optionally apply image filters if necessary
    // In this case, input is thought to be low quality
    // But IronTesseract can read what conventional Tesseract cannot.
    
    var Result = Ocr.Read(input);
    
    // The console might have difficulty displaying Arabic on Windows.
    // Instead, save to disk.
    Result.SaveAsTextFile("arabic.txt");
}

Пример за повеќе јазици

Исто така е можно да OCR користи повеќе јазици истовремено. Ова навистина може да помогне да се добијат метаподатоци и урлови на англиски јазик во документите на Уникод.

// PM> Install IronOcr.Languages.ChineseSimplified
using IronOcr;

var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.ChineseSimplified;
// Adding secondary language for OCR
Ocr.AddSecondaryLanguage(OcrLanguage.Macedonian);

// Можеме да додадеме кој било број на јазици

using (var input = new OcrInput())
{
    // Adding a multi-language PDF document
    input.Add("multi-language.pdf");
    var Result = Ocr.Read(input);
    // Saving result text to a file
    Result.SaveAsTextFile("results.txt");
}

Детални објекти на резултатите од OCR

IronOCR враќа објект со резултат на OCR за секоја операција со OCR. Општо, програмерите користат само својство на текст на овој објект за да го скенираат текстот од сликата. Сепак, резултатите од OCR, ДОМ е многу понапреден од овој.

using IronOcr;
using System.Drawing; // Додадете референца за склопување

var Ocr = new IronTesseract();
Ocr.Language = OcrLanguage.Macedonian;
// Set engine mode for OCR
Ocr.Configuration.EngineMode = TesseractEngineMode.TesseractAndLstm;
Ocr.Configuration.ReadBarCodes = true; // Важно

using (var Input = new OcrInput(@"images\sample.tiff"))
{
    OcrResult Result = Ocr.Read(Input);
    var Pages = Result.Pages;
    var Words = Pages[0].Words;
    var Barcodes = Result.Barcodes;
    // Истражете тука за да пронајдете масивен, детален API:
    // - Страници, блокови, парафрачи, редови, зборови, карактери
    // - Извоз на слика, координати на фонтови, статистички податоци
}

Изведба

IronOCR работи надвор од кутијата, без потреба за прилагодување на перформансите или силно менување на влезните слики.

Брзината е горлива: IronOCR.2020+ е до 10 пати побрз и прави над 250% помалку грешки од претходните изработки.

Научи повеќе

За да дознаете повеќе за OCR на C#, VB, F# или кој било друг јазик .NET, прочитајте ги упатствата за заедницата, кои даваат примери од реалниот свет за тоа како може да се користи железо OCR и може да покажат нијанси како да го извлечете најдоброто од оваа библиотека.

Исто така, достапна е целосна референца за објектот за .NET развивачите.

Curtis Chau
기술 문서 작성자

커티스 차우는 칼턴 대학교에서 컴퓨터 과학 학사 학위를 취득했으며, Node.js, TypeScript, JavaScript, React를 전문으로 하는 프론트엔드 개발자입니다. 직관적이고 미적으로 뛰어난 사용자 인터페이스를 만드는 데 열정을 가진 그는 최신 프레임워크를 활용하고, 잘 구성되고 시각적으로 매력적인 매뉴얼을 제작하는 것을 즐깁니다.

...
더 읽어보기

시작할 준비 되셨나요?

Nuget Downloads 6,236,385버전:2026.9방금 출시

지금 바로 30일 무료 체험판 키를 받으세요.
신용카드나 계정 생성은 필요하지 않습니다.
PDF용 C# NuGet 라이브러리
NuGet을 사용하여 설치하세요

버전: 2026.9

PM > Install-Package IronOcr
nuget.org/packages/IronOcr/
  1. 솔루션 탐색기에서 참조를 마우스 오른쪽 버튼으로 클릭하고 NuGet 패키지 관리를 선택합니다.
  2. 찾아보기를 선택하고 "IronOCR"을 검색하세요.
  3. 패키지를 선택하고 설치하세요
C# PDF DLL
DLL 다운로드

버전: 2026.9

또는 여기에서 Windows 설치 프로그램을 다운로드하십시오.

  1. IronOCR을 다운로드하고 솔루션 디렉터리 내의 ~/Libs와 같은 위치에 압축을 푸세요.
  2. Visual Studio 솔루션 탐색기에서 참조를 마우스 오른쪽 버튼으로 클릭합니다. 찾아보기를 선택하고 "IronOCR.dll"을 선택합니다.

라이선스 가격은 749달러 부터 시작합니다.

Key in blue circle

무료 30일 체험 키를 즉시 받으세요.

Your trial license will be sent to your email address

제한 없음. 100% 무제한 이용. 신용카드 불필요.

bullet_checked신용카드나 계정 생성은 필요하지 않습니다.제한 없음. 100% 무제한 이용. 신용카드 불필요.
  • Logo Aetna
  • Logo NASA
  • Logo GE
  • Logo Porsche
  • Logo USDA
  • Logo Qatar
Join Millions of Engineers who’ve tried IronPDF
부담 없는 무료 상담을 받아보세요
아래 양식을 작성하시거나 sales@ironsoftware.com으로 이메일을 보내주세요.
고객님의 정보는 항상 비밀로 유지됩니다.
전 세계 수백만 엔지니어들이 신뢰하는 제품입니다.
Iron Software의 고객 로고
지금 바로 30일 무료 체험판 키를 받으세요.
신용카드나 계정 생성은 필요하지 않습니다.