PDF'den OCR (Ücretsiz Çevrimiçi Araçlar)
Optik Karakter Tanıma veya OCR, görüntülerdeki metni tanımak için kullanılan bir teknolojidir. Bu teknoloji, basılı metin veya bir görüntü dosyasını taramak ve onları bilgisayarlarda tanımak için oluşturulmuştur. Çünkü bugün birçok şey dijitaldir, örneğin e-postalar veya kitaplar. Ancak, OCR teknolojisi, birçok farklı yazı tipinde metni tanıyabilen özel algoritmalarla daha karmaşık bir şeye dönüşmüştür, hatta gürültü veya JPEG sıkıştırması gibi diğer yaygın bozulmalarla bozulmuş olsa bile. OCR kağıt üzerinde el yazısını %98 doğrulukla okuyabilir.
OCR kullanılarak taranan metin daha sonra düzenlenebilir, indekslenebilir, aranabilir, yazdırılabilir ve arşivlenebilir. OCR yazılımı, sağlık, ilaç, sigorta ve hukuk endüstrilerinde yaygın olarak kullanılmaktadır. Kağıt belgeleri dijital belgelere dönüştürmelerine yardımcı olur, böylece daha kolay yeniden kullanılabilir ve başkalarıyla paylaşılabilirler.
Farklı araçlarla PDF dosyalarının OCR'sini nasıl yapabileceğinizi görelim.
Adobe Acrobat Pro
PDF'yi ilk geliştiren şirket Adobe'dir. Atacağınız her PDF belgesini düzenleyebilen hızlı ve verimli bir OCR motoru sunuyorlar. Piyasadaki en güçlü OCR motorlarından biri ve düzenlemek için çok sayıda PDF'niz varsa Adobe Acrobat DC satın almanız gereken şeydir. Bu yazılım, herhangi bir metin tabanlı belgeyi PDF formatına mükemmel doğrulukla dönüştürebilecek şekilde tasarlanmıştır. Ayrıca, orijinal belgenin yazı tipini Özel Yazı Tipi üreticisini kullanarak korur.
Adobe Acrobat kullanarak PDF OCR'sini nasıl yapabileceğimizi görelim:
- Adobe Acrobat Pro DC'de dosyayı açın.
-
Sağ paneldeki "PDF'yi Düzenle" seçeneğine tıklayın.
- OCR yeteneklerini kullanarak bir PDF dosyasını düzenlenebilir bir PDF'ye dönüştürecektir.
-
Artık belgelerdeki herhangi bir metni düzenleyebilir ve görüntü dosyalarını değiştirebilirsiniz.
- Dosyayı "Dosya > Farklı Kaydet" seçeneğini seçip yeni PDF belgesine uygun bir ad vererek kaydedin.
Aynı anda birden fazla taranmış PDF belgesinin OCR'sini kolayca yapabilirsiniz.
Sejda
Sejda, bulutta barındırılabilen veya macOS, Windows veya Linux'a masaüstü uygulaması olarak indirilebilen OCR destekli PDF düzenleme yazılımıdır. Sejda, kullanıcılara PDF dosyalarını sıkıştırma, düzenleme, dijital imzalama, birleştirme ve doldurma imkanı sunar. JPEG ve Excel dahil olmak üzere çeşitli formatlardaki dosyalar örneğin PDF dosyalarına dönüştürülebilir. PDF'ler benzer şekilde Word ve PowerPoint belgeleri gibi diğer formatlara dönüştürülebilir. Sejda OCR kullanarak PDF belgelerinin OCR'sini nasıl yapabileceğinizi görelim.
- Sejda OCR web sitesine gidin.
- Dosya yüklemek için "PDF dosyasını yükle" düğmesine tıklayın veya bilgisayarınızdan dosyaları sürükleyip bırakın.
-
Yükledikten sonra, yüklenen dosya adını göreceksiniz. Belgenin dilini seçin.
-
Dili seçtikten sonra, çıktı formatını seçmeniz gerekir. "PDF" veya "Metin" seçeneklerinden birini seçebilirsiniz. Çıktı formatını ayarladıktan sonra, "Tüm sayfalarda metni tanı" düğmesine tıklayın. Metin çıkarmaya başlayacaktır.
-
Process tamamlandığında, çıkarılan metni indirebilirsiniz.
SodaPDF
SodaPDF OCR, görüntülerden metin çıkarabilen ücretsiz çevrimiçi bir OCR yazılımıdır. Taranmış belgeleri, faksları ve diğer çıktıları düzenlenebilir metne, PDF'lere ve aranabilir PDF'lere dönüştüren bir PDF OCR dönüştürme aracıdır. SodaPDF OCR'nin en yaygın kullanım durumu, taranmış belgeleri veya faksları düzenlenebilir dosyalara dönüştürmektir. Ücretsiz çevrimiçi OCR yazılımıdır. Tüm yüklenen belgeler, belirli bir süre sonra sunucudan otomatik olarak silinir. PDF'nin Word'e dönüştürülmesi gibi özellikler içerir, bu da sonrasında Microsoft Word kullanılarak açılabilir.
SodaPDF kullanarak bir PDF üzerinde OCR yapmayı nasıl gerçekleştirebileceğimizi görelim:
- SodaPDF web sitesini açın.
- "Dosya Seç" düğmesine tıklayın ve yüklemek istediğiniz PDF belgelerini seçin.
-
Yükledikten sonra, size PDF metnini ve görüntülerini düzenlemek için bir kullanıcı arayüzü verecektir. Dosyayı, İndir düğmesini kullanarak indirebilirsiniz.
IronOCR: .NET OCR Kütüphanesi
IronOCR, .NET Framework'ta OCR için sağlam bir kütüphanedir. Metin ve görüntülerle çalışmak için güçlü bir API sağlar, gerçek zamanlı tanıma, alan algılama ve taranmış PDF dosyaları için optik karakter tanıma gibi özellikler sunar. IronPDF ayrıca taranmış belgeleri düzenleyebilir.
IronOCR, geliştiricilere uygulamalarında metin tanıma gücü verir. Taranmış belgeleri dijital formatlara dönüştürmek veya görüntüler üzerindeki başlıkları tanımak gibi çeşitli amaçlar için kullanılabilir. IronOCR .NET Kütüphanesi, IronOCR SDK'sına kolay bir kullanım sağlamak için düşük seviyeli bir arayüz sunar. Bunun üzerine, otomatik olarak düşük DPI'li görüntüleri işleyen ve PDF belgelerinden metin çıkaran bir görüntü işleme hattı içerir.
OCR aracı kullanarak bir PDF dosyasının OCR'sini nasıl yapabileceğimizi görelim:
Tam Bir PDF Dosyasının OCR'si
Aşağıdaki kod, tam bir PDF belgesi üzerinde OCR gerçekleştirebilir.
using IronOcr;
var Ocr = new IronTesseract();
using (var Input = new OcrInput())
{
// Add the entire PDF document for OCR processing
Input.AddPdf("example.pdf", "password");
var Result = Ocr.Read(Input);
// Print the extracted text to the console
Console.WriteLine(Result.Text);
}
using IronOcr;
var Ocr = new IronTesseract();
using (var Input = new OcrInput())
{
// Add the entire PDF document for OCR processing
Input.AddPdf("example.pdf", "password");
var Result = Ocr.Read(Input);
// Print the extracted text to the console
Console.WriteLine(Result.Text);
}
Imports IronOcr
Private Ocr = New IronTesseract()
Using Input = New OcrInput()
' Add the entire PDF document for OCR processing
Input.AddPdf("example.pdf", "password")
Dim Result = Ocr.Read(Input)
' Print the extracted text to the console
Console.WriteLine(Result.Text)
End Using
Seçili PDF Sayfalarının OCR'si
Seçili PDF sayfalarında OCR yapmak için AddPdfPages fonksiyonunu kullanabilirsiniz.
using IronOcr;
var Ocr = new IronTesseract();
using (var Input = new OcrInput())
{
// Add specific pages of the PDF document for OCR processing
Input.AddPdfPages("example.pdf", new [] { 1, 2, 3 }, "password");
var Result = Ocr.Read(Input);
// Print the extracted text to the console
Console.WriteLine(Result.Text);
}
using IronOcr;
var Ocr = new IronTesseract();
using (var Input = new OcrInput())
{
// Add specific pages of the PDF document for OCR processing
Input.AddPdfPages("example.pdf", new [] { 1, 2, 3 }, "password");
var Result = Ocr.Read(Input);
// Print the extracted text to the console
Console.WriteLine(Result.Text);
}
Imports IronOcr
Private Ocr = New IronTesseract()
Using Input = New OcrInput()
' Add specific pages of the PDF document for OCR processing
Input.AddPdfPages("example.pdf", { 1, 2, 3 }, "password")
Dim Result = Ocr.Read(Input)
' Print the extracted text to the console
Console.WriteLine(Result.Text)
End Using
PDF'yi Aranabilir PDF'ye Dönüştür
IronOCR kullanarak bir PDF dosyasını aranabilir bir PDF dosyasına dönüştürmek için SaveAsSearchablePdf fonksiyonunu kullanabilirsiniz.
using IronOcr;
var Ocr = new IronTesseract();
using (var Input = new OcrInput())
{
// Add the PDF for processing and specify the password if any
Input.AddPdf("scan.pdf", "password");
// Correct twisted or skewed pages
Input.Deskew();
var Result = Ocr.Read(Input);
// Save the processed result as a searchable PDF
Result.SaveAsSearchablePdf("searchable.pdf");
}
using IronOcr;
var Ocr = new IronTesseract();
using (var Input = new OcrInput())
{
// Add the PDF for processing and specify the password if any
Input.AddPdf("scan.pdf", "password");
// Correct twisted or skewed pages
Input.Deskew();
var Result = Ocr.Read(Input);
// Save the processed result as a searchable PDF
Result.SaveAsSearchablePdf("searchable.pdf");
}
Imports IronOcr
Private Ocr = New IronTesseract()
Using Input = New OcrInput()
' Add the PDF for processing and specify the password if any
Input.AddPdf("scan.pdf", "password")
' Correct twisted or skewed pages
Input.Deskew()
Dim Result = Ocr.Read(Input)
' Save the processed result as a searchable PDF
Result.SaveAsSearchablePdf("searchable.pdf")
End Using
Sonuç
Optik karakter tanıma gerçekleştirilecek bazı harika yazılım araçlarını keşfettik. Bu araçlar, metni programlı olarak tanımanıza ve aranabilir ve düzenlenebilir PDF'ler oluşturmanıza olanak tanır.
.NET Framework'ta yazıyorsanız, IronOCR tavsiyemizdir. IronOCR, .NET Framework'ta kolayca OCR yapmanıza olanak tanır; güçlüdür ve orijinal belge su hasarı gibi bir şekilde zarar görmüş veya bozulmuş olsa bile kolayca kullanılabilir.
Başka bir kullanım durumu, fatura ve satış fişleri gibi el ile doldurulmuş eski kağıt formları dijital versiyonlara dönüştürmektir. Bu, bu belgelerin muhasebe yazılımı tarafından otomatik olarak işlenmesine olanak tanır, böylece doğruluk ve verimlilik artar.




