IronOCR Kullanarak C# İle Taratılmış Belgeleri Okuma
IronOCR, C# geliştiricilerine OCR teknolojisini kullanarak taratılmış PDF'lerden ve görüntülerden metin çıkartma imkanı sunar, arama yapılamayan görüntü tabanlı belgeleri kodun sadece birkaç satırıyla aranabilir, erişilebilir içerik haline dönüştürür.
Birçok PDF, arama yapılamayan, görüntü tabanlı metin içerir. IronOCR bunu aranabilir içeriğe dönüştürerek, belirli bilgileri bulmayı kolaylaştırır ve özellikle görme engelliler için belge erişilebilirliğini artırır.
Metni ve görüntüleri elle kopyalamak veya yeniden yaratmak yerine, otomatik çıkarım doğruluğu ve verimliliği sağlar. Bu özellikle araştırma, yasal belgeler ve PDF'lerin belirli kısımlarını tekrar kullanmanın yaygın olduğu içerik oluşturma için kullanışlıdır.
İşletmeler, analiz veya sistem entegrasyonu için PDF'lerden kritik verileri çıkararak iş akışlarını düzenleyebilir. Tasarımcılar ve pazarlamacılar da projelerinde geliştirme ve yeniden kullanmak için görüntüleri çıkarabilir.
Bu eğitimde, çeşitli uygulamalar için IronOCR'un PDF metin ve görüntü çıkarımını nasıl basitleştirdiğini göstermek amacıyla kullanılabilir seçenekleri ve parametreleri kapsayan OcrPdfInput yöntemlerini inceleyeceğiz.
Bu fonksiyonu kullanmak için IronOcr.Extensions.AdvancedScan paketini de yüklemelisiniz.
Bir satır kodla taranmış PDF veya görüntünüzü IronOCR'un OcrInput.LoadPdf veya LoadImage kullanarak yükleyin ve anında metni ReadDocument üzerinden çıkarın—anında başlayın. OCR'yi hızla çalışır hale getirmek isteyen geliştiriciler için mükemmel.
-
1Install IronOCR with NuGet Package Manager
-
2Bu kod parçacığını kopyalayın ve çalıştırın.
var text = new IronOcr.IronTesseract().ReadDocument(new IronOcr.OcrInput().LoadPdf("scanned.pdf")).Text;C# -
3Canlı ortamınızda test için dağıtım yapın
Ücretsiz deneme ile bugün projenizde IronOCR kullanmaya başlayın
Asgari İş Akışı (5 adım)
- Taratılmış belgeleri okumak için C# kütüphanesini indirin
- Öğütme için taratılmış belgeyi import edin
- Resimler için
LoadImagemetodunu veya taratılmış PDF'ler içinLoadPdfmetodunu kullanın ReadDocumentmetodunu kullanarak metni çıkarın- Gerekli olduğunda çıkarılan metni daha fazla kullanım için kaydedin veya dışa aktarın
Taratılmış Belgelerden Metin Nasıl Çıkarırım?
Belge içindeki tüm görüntülerden metin çıkarmak için ReadDocument yöntemini kullanın. Bu yöntem belgeyi işler ve Text özelliği üzerinden erişilebilen, çıkarılan metni içeren bir nesne döner. Aşağıdaki örnek, bu yöntemin bir dosyası ile nasıl kullanılacağını gösterir.
IronOCR, tarama için geniş bir belge formatı çeşidini destekler. Görüntüler için JPG, PNG, GIF, TIFF ve BMP formatları ile çalışabilirken, PDF desteği hem tek ve çok sayfalı belgeleri içerir. Kütüphane, tüm desteklenen formatlarda yüksek doğruluk sağlamak için ileri Tesseract 5 teknolojisini kullanır.
- Metod şu anda yalnızca İngilizce, Çince, Japonca, Korece ve Latin Alfabeti için çalışıyor. Gelişmiş tarama işleminin .NET Framework üzerinde kullanımı için projenin x64 mimarisinde çalıştırılması gerekmektedir. )}]
Giriş Belgesi Nasıl Görünür?

OCR Kodunu Nasıl Uygularım?
using IronOcr;
using System;
// Instantiate OCR engine
var ocr = new IronTesseract();
// Configure OCR engine
using var input = new OcrInput();
input.LoadImage("potter.tiff");
// Perform OCR
OcrResult result = ocr.ReadDocument(input);
Console.WriteLine(result.Text);Imports IronOcr
Imports System
' Instantiate OCR engine
Dim ocr As New IronTesseract()
' Configure OCR engine
Using input As New OcrInput()
input.LoadImage("potter.tiff")
' Perform OCR
Dim result As OcrResult = ocr.ReadDocument(input)
Console.WriteLine(result.Text)
End UsingOCR İşlemesinden Ne Tür Sonuçlar Bekleyebilirim?

Bunun yerine bir PDF dosyasında OCR yapmak istiyorsanız, sadece LoadImage yöntemini LoadPdf ile değiştirin. Bu, IronOCR'un taranmış PDF'lerden metin işleme ve çıkarma işlemini aynı şekilde yapmasını sağlar.
Gelişmiş Belge İşleme Seçenekleri
Taratılmış belgelerle çalışırken, OCR süreci üzerinde daha fazla kontrol sahibi olmanız gerekir. IronOCR, metin çıkarım sonuçlarınızı artırmak için birkaç gelişmiş özellik sunar.
Çok Sayfalı Belgeleri İşleme
Birden fazla sayfaya sahip belgeler için, IronOCR parti işleme işlemini verimli şekilde yapar:
using IronOcr;
var ocr = new IronTesseract();
using var input = new OcrInput();
// Load a multi-page PDF
input.LoadPdf("multi-page-document.pdf");
// Process all pages
OcrResult result = ocr.ReadDocument(input);
// Access individual page results
foreach (var page in result.Pages)
{
Console.WriteLine($"Page {page.PageNumber}: {page.WordCount} words");
}
OCR Performansını Optimize Etmek
Taratılmış belgelerinizin kalitesi, OCR doğruluğunu doğrudan etkiler. IronOCR, metin tanıma işlemini geliştirmek için yerleşik görüntü optimizasyon filtreleri içerir:
using IronOcr;
var ocr = new IronTesseract();
using var input = new OcrInput();
// Load and enhance image quality
input.LoadImage("low-quality-scan.jpg");
input.Deskew(); // Correct image skew
input.DeNoise(); // Remove background noise
input.Binarize(); // Convert to black and white
OcrResult result = ocr.ReadDocument(input);Imports IronOcr
Dim ocr As New IronTesseract()
Using input As New OcrInput()
' Load and enhance image quality
input.LoadImage("low-quality-scan.jpg")
input.Deskew() ' Correct image skew
input.DeNoise() ' Remove background noise
input.Binarize() ' Convert to black and white
Dim result As OcrResult = ocr.ReadDocument(input)
End UsingAranabilir PDF'ler Oluşturma
Taratılmış belgeleri işlerken en değerli özelliklerden biri olarak, aranabilir PDF'ler oluşturmaktır. Bu, orijinal belge görünümünü korurken bir metin katmanı ekler:
using IronOcr;
var ocr = new IronTesseract();
using var input = new OcrInput();
input.LoadPdf("scanned-document.pdf");
// Process and save as searchable PDF
OcrResult result = ocr.ReadDocument(input);
result.SaveAsSearchablePdf("searchable-output.pdf");Imports IronOcr
Dim ocr As New IronTesseract()
Using input As New OcrInput()
input.LoadPdf("scanned-document.pdf")
' Process and save as searchable PDF
Dim result As OcrResult = ocr.ReadDocument(input)
result.SaveAsSearchablePdf("searchable-output.pdf")
End UsingFarklı Belge Türleriyle Çalışmak
IronOCR, iş ortamlarında yaygın olarak karşılaşılan çeşitli belge türlerini işlemekte ustadır. Faturalarla, sözleşmelerle veya tarihi belgelerle uğraşıyor olun, kütüphane farklı kaynaklardan veri çıkarmak için özel özellikler sunar.
Miras Belgelerin İşlenmesi
Birçok kuruluşun eski formatlarda taranmış belgelerden oluşan arşivleri vardır. IronOCR, doküman yönetim sistemlerinde yaygın olarak kullanılan çok sayfalı TIFF dosyaları dahil olmak üzere bunları verimli bir şekilde işler.
Dil Desteği
Bu örnek İngilizce metne odaklanırken, IronOCR 125'ten fazla uluslararası dili destekler. Bu, çok dilli belgeleri veya İngilizce olmayan dillerdeki belgeleri işlemek için idealdir.
Belge Tarama İçin En İyi Uygulamalar
Taranmış belgeleri işlerken en iyi sonuçları elde etmek için:
- Taramayı Kalitesi: En iyi sonuçlar için minimum 300 DPI çözünürlük kullanın
- Dosya Formatı: TIFF ve PNG formatları, metin belgeleri için JPEG'e göre daha iyi kaliteyi korur
- Ön İşleme: Belgenizin durumuna göre uygun filtreler uygulayın
- Performans: Büyük yüklerin işlenmesi için çoklu iş parçacığı yeteneklerini kullanmayı düşünün
Yaygın Sorunları Giderme
Taranmış belgelerle çalışırken çeşitli zorluklarla karşılaşabilirsiniz. İşte yaygın sorunlara çözümler:
- Düşük kalite taramalar: OCR işleminden önce geliştirme filtreleri uygulayın
- Eğilmiş belgeler: Yönlendirmeyi düzeltmek için
Deskew()yöntemini kullanın - Karma içerik: Belgeler hem metin hem de metin olmayan öğeler içeriyorsa belirli bölgeleri işleyin
Daha ayrıntılı rehberlik için kapsamlı C# OCR öğreticimizi keşfedin veya hızlı başlamanızı sağlamak için basit OCR örneklerine göz atın.
Sonraki Adımlar
Artık taranmış belgelerden nasıl metin çıkaracağınızı anladığınıza göre, herhangi bir PDF'yi aranabilir hale getirme veya web uygulamaları için PDF akışlarını işleme gibi daha ileri özellikleri keşfedebilirsiniz. IronOCR'un esnekliği, basit belge dijitalleştirmeden karmaşık kurumsal belge işleme iş akışlarına kadar her şey için uygundur.
Sıkça Sorulan Sorular
C#'ta taranmış bir PDF'den nasıl metin çıkartabilirim?
IronOCR, C#'ta taranmış PDF'lerden metin çıkartmayı basit hale getirir. Taradığınız PDF'i içe aktarmak için LoadPdf metodunu kullanın, ardından metni çıkarmak için ReadDocument'i çağırın. Örneğin: var text = new IronOcr.IronTesseract().ReadDocument(new IronOcr.OcrInput().LoadPdf("scanned.pdf")).Text; Bu tek satır kod, PDF'inizi yükler ve tüm metin içeriğini çıkartır.
Metin çıkartmak için OCR kütüphanesi hangi dosya formatlarını destekliyor?
IronOCR, OCR taraması için kapsamlı bir belge formatları yelpazesini destekler. Görüntüler için JPG, PNG, GIF, TIFF ve BMP formatlarında çalışır. PDF'ler için hem tek hem de çok sayfalı belgeleri işleyebilir. Kütüphane, tüm desteklenen formatlarda yüksek doğruluk sağlamak için gelişmiş Tesseract 5 teknolojisini kullanır.
OCR işlevselliği için ek paketler yüklemem gerekiyor mu?
Evet, IronOCR ile tam OCR işlevselliğini kullanmak için, ana IronOCR kütüphanesine ek olarak IronOcr.Extensions.AdvancedScan paketini yüklemeniz gereklidir. Bu ek paket, taranmış belgeleri işlemek için gelişmiş tarama yetenekleri sağlar.
Taranmış görüntülerden ve PDF'lerden metin çıkarabilir miyim?
Evet, IronOCR taranmış görüntüler ve PDF'leri eşit düzeyde iyi işler. Görüntü dosyaları (JPG, PNG, GIF, TIFF, BMP) için LoadImage veya PDF belgeleri için LoadPdf kullanın. ReadDocument metodu her iki giriş türüyle de metin içeriği çıkartmak için çalışır.
OCR, aranabilir olmayan PDF belgeleriyle nasıl yardımcı olur?
IronOCR aranabilir olmayan, görüntü tabanlı PDF'leri metni çıkararak aranabilir içeriğe dönüştürür. Bu dönüşüm, belgeler içinde belirli bilgilerin bulunmasını kolaylaştırır ve belgelerin erişilebilirliğini, özellikle görme engelli bireyler için, önemli ölçüde artırır.
OCR metin çıkarımının başlıca iş uygulamaları nelerdir?
IronOCR, PDF'lerden analiz ve sistem entegrasyonu için kritik veri çıkarmada işletmelere olanak tanır, iş akışlarını hızlandırır. Yasal belgelerin işlenmesi, araştırma makaleleri ve veri girişinin otomatikleştirilmesi de dahil olmak üzere özellikle faydalıdır. Tasarımcılar ve pazarlamacılar da, çeşitli projelerde geliştirme ve yeniden kullanım için görüntüleri çıkarabilir.
What does IronOCR offer for creating searchable PDFs?
With IronOCR, you can convert scanned documents into searchable PDFs by processing the document and saving it with the text layer intact, thereby maintaining its original appearance while adding search functionality.
What package is required for advanced OCR features in IronOCR?
To access advanced OCR features in IronOCR, you need to install the `IronOcr.Extensions.AdvancedScan` package, which adds additional capabilities for document processing.
What are the best practices for scanning documents for OCR processing?
For optimal OCR results, use a minimum resolution of 300 DPI, save documents in TIFF or PNG formats, apply pre-processing filters if needed, and utilize multithreading for processing large batches.
How does IronOCR handle poor quality scans?
IronOCR can improve OCR results for poor quality scans by using enhancement filters like `DeNoise` to clean up the image and `Deskew` to correct any orientation issues before processing.

Curtis Chau, Bilgisayar Bilimleri alanında Lisans Derecesine (Carleton Üniversitesi) sahip ve Node.js, TypeScript, JavaScript ve React konularında uzmanlaşmış ön uç geliştirmeyle ilgileniyor. Sezgisel ve estetik açıdan hoş kullanıcı arayüzleri oluşturma tutkunu, Curtis modern çerçevelerle çalışmayı ve iyi yapılandırılmış, görsel olarak çekici kılavuzlar oluşturmayı seviyor.