Altbilgi içeriğine atla
OCR ARAçLARı

PDF'den OCR (Ücretsiz Çevrimiçi Araçlar)

Optik Karakter Tanıma veya OCR, görüntülerdeki metni tanımak için kullanılan bir teknolojidir. Bu teknoloji, basılı metin veya bir görüntü dosyasını taramak ve onları bilgisayarlarda tanımak için oluşturulmuştur. Çünkü bugün birçok şey dijitaldir, örneğin e-postalar veya kitaplar. Ancak, OCR teknolojisi, birçok farklı yazı tipinde metni tanıyabilen özel algoritmalarla daha karmaşık bir şeye dönüşmüştür, hatta gürültü veya JPEG sıkıştırması gibi diğer yaygın bozulmalarla bozulmuş olsa bile. OCR kağıt üzerinde el yazısını %98 doğrulukla okuyabilir.

OCR kullanılarak taranan metin daha sonra düzenlenebilir, indekslenebilir, aranabilir, yazdırılabilir ve arşivlenebilir. OCR yazılımı, sağlık, ilaç, sigorta ve hukuk endüstrilerinde yaygın olarak kullanılmaktadır. Kağıt belgeleri dijital belgelere dönüştürmelerine yardımcı olur, böylece daha kolay yeniden kullanılabilir ve başkalarıyla paylaşılabilirler.

Farklı araçlarla PDF dosyalarının OCR'sini nasıl yapabileceğinizi görelim.

Adobe Acrobat Pro

PDF'yi ilk geliştiren şirket Adobe'dir. Atacağınız her PDF belgesini düzenleyebilen hızlı ve verimli bir OCR motoru sunuyorlar. Piyasadaki en güçlü OCR motorlarından biri ve düzenlemek için çok sayıda PDF'niz varsa Adobe Acrobat DC satın almanız gereken şeydir. Bu yazılım, herhangi bir metin tabanlı belgeyi PDF formatına mükemmel doğrulukla dönüştürebilecek şekilde tasarlanmıştır. Ayrıca, orijinal belgenin yazı tipini Özel Yazı Tipi üreticisini kullanarak korur.

Adobe Acrobat kullanarak PDF OCR'sini nasıl yapabileceğimizi görelim:

  • Adobe Acrobat Pro DC'de dosyayı açın.
  • Sağ paneldeki "PDF'yi Düzenle" seçeneğine tıklayın.

    OCR From PDF Free Online Tools - Figure 1

  • OCR yeteneklerini kullanarak bir PDF dosyasını düzenlenebilir bir PDF'ye dönüştürecektir.
  • Artık belgelerdeki herhangi bir metni düzenleyebilir ve görüntü dosyalarını değiştirebilirsiniz.

    OCR From PDF Free Online Tools - Figure 2

  • Dosyayı "Dosya > Farklı Kaydet" seçeneğini seçip yeni PDF belgesine uygun bir ad vererek kaydedin.

Aynı anda birden fazla taranmış PDF belgesinin OCR'sini kolayca yapabilirsiniz.

Sejda

Sejda, bulutta barındırılabilen veya macOS, Windows veya Linux'a masaüstü uygulaması olarak indirilebilen OCR destekli PDF düzenleme yazılımıdır. Sejda, kullanıcılara PDF dosyalarını sıkıştırma, düzenleme, dijital imzalama, birleştirme ve doldurma imkanı sunar. JPEG ve Excel dahil olmak üzere çeşitli formatlardaki dosyalar örneğin PDF dosyalarına dönüştürülebilir. PDF'ler benzer şekilde Word ve PowerPoint belgeleri gibi diğer formatlara dönüştürülebilir. Sejda OCR kullanarak PDF belgelerinin OCR'sini nasıl yapabileceğinizi görelim.

  • Sejda OCR web sitesine gidin.
  • Dosya yüklemek için "PDF dosyasını yükle" düğmesine tıklayın veya bilgisayarınızdan dosyaları sürükleyip bırakın.
  • Yükledikten sonra, yüklenen dosya adını göreceksiniz. Belgenin dilini seçin.

    OCR From PDF Free Online Tools - Figure 3

  • Dili seçtikten sonra, çıktı formatını seçmeniz gerekir. "PDF" veya "Metin" seçeneklerinden birini seçebilirsiniz. Çıktı formatını ayarladıktan sonra, "Tüm sayfalarda metni tanı" düğmesine tıklayın. Metin çıkarmaya başlayacaktır.

    OCR From PDF Free Online Tools - Figure 4

  • Process tamamlandığında, çıkarılan metni indirebilirsiniz.

    OCR From PDF Free Online Tools - Figure 5

SodaPDF

SodaPDF OCR, görüntülerden metin çıkarabilen ücretsiz çevrimiçi bir OCR yazılımıdır. Taranmış belgeleri, faksları ve diğer çıktıları düzenlenebilir metne, PDF'lere ve aranabilir PDF'lere dönüştüren bir PDF OCR dönüştürme aracıdır. SodaPDF OCR'nin en yaygın kullanım durumu, taranmış belgeleri veya faksları düzenlenebilir dosyalara dönüştürmektir. Ücretsiz çevrimiçi OCR yazılımıdır. Tüm yüklenen belgeler, belirli bir süre sonra sunucudan otomatik olarak silinir. PDF'nin Word'e dönüştürülmesi gibi özellikler içerir, bu da sonrasında Microsoft Word kullanılarak açılabilir.

SodaPDF kullanarak bir PDF üzerinde OCR yapmayı nasıl gerçekleştirebileceğimizi görelim:

  • SodaPDF web sitesini açın.
  • "Dosya Seç" düğmesine tıklayın ve yüklemek istediğiniz PDF belgelerini seçin.
  • Yükledikten sonra, size PDF metnini ve görüntülerini düzenlemek için bir kullanıcı arayüzü verecektir. Dosyayı, İndir düğmesini kullanarak indirebilirsiniz.

    OCR From PDF Free Online Tools - Figure 6

IronOCR: .NET OCR Kütüphanesi

IronOCR, .NET Framework'ta OCR için sağlam bir kütüphanedir. Metin ve görüntülerle çalışmak için güçlü bir API sağlar, gerçek zamanlı tanıma, alan algılama ve taranmış PDF dosyaları için optik karakter tanıma gibi özellikler sunar. IronPDF ayrıca taranmış belgeleri düzenleyebilir.

IronOCR, geliştiricilere uygulamalarında metin tanıma gücü verir. Taranmış belgeleri dijital formatlara dönüştürmek veya görüntüler üzerindeki başlıkları tanımak gibi çeşitli amaçlar için kullanılabilir. IronOCR .NET Kütüphanesi, IronOCR SDK'sına kolay bir kullanım sağlamak için düşük seviyeli bir arayüz sunar. Bunun üzerine, otomatik olarak düşük DPI'li görüntüleri işleyen ve PDF belgelerinden metin çıkaran bir görüntü işleme hattı içerir.

OCR aracı kullanarak bir PDF dosyasının OCR'sini nasıl yapabileceğimizi görelim:

Tam Bir PDF Dosyasının OCR'si

Aşağıdaki kod, tam bir PDF belgesi üzerinde OCR gerçekleştirebilir.

using IronOcr;

var Ocr = new IronTesseract();

using (var Input = new OcrInput())
{
    // Add the entire PDF document for OCR processing
    Input.AddPdf("example.pdf", "password");

    var Result = Ocr.Read(Input);
    // Print the extracted text to the console
    Console.WriteLine(Result.Text);
}
using IronOcr;

var Ocr = new IronTesseract();

using (var Input = new OcrInput())
{
    // Add the entire PDF document for OCR processing
    Input.AddPdf("example.pdf", "password");

    var Result = Ocr.Read(Input);
    // Print the extracted text to the console
    Console.WriteLine(Result.Text);
}
Imports IronOcr

Private Ocr = New IronTesseract()

Using Input = New OcrInput()
	' Add the entire PDF document for OCR processing
	Input.AddPdf("example.pdf", "password")

	Dim Result = Ocr.Read(Input)
	' Print the extracted text to the console
	Console.WriteLine(Result.Text)
End Using
$vbLabelText   $csharpLabel

Seçili PDF Sayfalarının OCR'si

Seçili PDF sayfalarında OCR yapmak için AddPdfPages fonksiyonunu kullanabilirsiniz.

using IronOcr;

var Ocr = new IronTesseract();

using (var Input = new OcrInput())
{
    // Add specific pages of the PDF document for OCR processing
    Input.AddPdfPages("example.pdf", new [] { 1, 2, 3 }, "password");

    var Result = Ocr.Read(Input);
    // Print the extracted text to the console
    Console.WriteLine(Result.Text);
}
using IronOcr;

var Ocr = new IronTesseract();

using (var Input = new OcrInput())
{
    // Add specific pages of the PDF document for OCR processing
    Input.AddPdfPages("example.pdf", new [] { 1, 2, 3 }, "password");

    var Result = Ocr.Read(Input);
    // Print the extracted text to the console
    Console.WriteLine(Result.Text);
}
Imports IronOcr

Private Ocr = New IronTesseract()

Using Input = New OcrInput()
	' Add specific pages of the PDF document for OCR processing
	Input.AddPdfPages("example.pdf", { 1, 2, 3 }, "password")

	Dim Result = Ocr.Read(Input)
	' Print the extracted text to the console
	Console.WriteLine(Result.Text)
End Using
$vbLabelText   $csharpLabel

PDF'yi Aranabilir PDF'ye Dönüştür

IronOCR kullanarak bir PDF dosyasını aranabilir bir PDF dosyasına dönüştürmek için SaveAsSearchablePdf fonksiyonunu kullanabilirsiniz.

using IronOcr;

var Ocr = new IronTesseract();

using (var Input = new OcrInput())
{
    // Add the PDF for processing and specify the password if any
    Input.AddPdf("scan.pdf", "password");

    // Correct twisted or skewed pages
    Input.Deskew();

    var Result = Ocr.Read(Input);
    // Save the processed result as a searchable PDF
    Result.SaveAsSearchablePdf("searchable.pdf");
}
using IronOcr;

var Ocr = new IronTesseract();

using (var Input = new OcrInput())
{
    // Add the PDF for processing and specify the password if any
    Input.AddPdf("scan.pdf", "password");

    // Correct twisted or skewed pages
    Input.Deskew();

    var Result = Ocr.Read(Input);
    // Save the processed result as a searchable PDF
    Result.SaveAsSearchablePdf("searchable.pdf");
}
Imports IronOcr

Private Ocr = New IronTesseract()

Using Input = New OcrInput()
	' Add the PDF for processing and specify the password if any
	Input.AddPdf("scan.pdf", "password")

	' Correct twisted or skewed pages
	Input.Deskew()

	Dim Result = Ocr.Read(Input)
	' Save the processed result as a searchable PDF
	Result.SaveAsSearchablePdf("searchable.pdf")
End Using
$vbLabelText   $csharpLabel

Sonuç

Optik karakter tanıma gerçekleştirilecek bazı harika yazılım araçlarını keşfettik. Bu araçlar, metni programlı olarak tanımanıza ve aranabilir ve düzenlenebilir PDF'ler oluşturmanıza olanak tanır.

.NET Framework'ta yazıyorsanız, IronOCR tavsiyemizdir. IronOCR, .NET Framework'ta kolayca OCR yapmanıza olanak tanır; güçlüdür ve orijinal belge su hasarı gibi bir şekilde zarar görmüş veya bozulmuş olsa bile kolayca kullanılabilir.

Başka bir kullanım durumu, fatura ve satış fişleri gibi el ile doldurulmuş eski kağıt formları dijital versiyonlara dönüştürmektir. Bu, bu belgelerin muhasebe yazılımı tarafından otomatik olarak işlenmesine olanak tanır, böylece doğruluk ve verimlilik artar.

Curtis Chau
Teknik Yazar

Curtis Chau, Bilgisayar Bilimleri alanında Lisans Derecesine (Carleton Üniversitesi) sahip ve Node.js, TypeScript, JavaScript ve React konularında uzmanlaşmış ön uç geliştirmeyle ilgileniyor. Sezgisel ve estetik açıdan hoş kullanıcı arayüzleri oluşturma tutkunu, Curtis modern çerçevelerle çalışmayı ve iyi yapı...

Daha Fazla Oku

Iron Destek Ekibi

Haftada 5 gün, 24 saat çevrimiçiyiz.
Sohbet
E-posta
Beni Ara