跳至頁尾內容
OCR 工具

如何對 PDF 進行 OCR 教學(免費線上工具)

OCR或光學字元識別是一種將文字資訊轉換為數位形式的過程。 PDF OCR是一款流行的應用程式,可以用於改善業務流程。 PDF OCR 的一個好處是它可以用來提高資訊的可存取性。 這對於那些不是所有人都可以使用或閱讀格式的文件特別重要。 PDF OCR 可以用於生成一個每個人都可以使用的格式的文件副本。

PDF OCR 的另一個用途是在文件的跟蹤中。 當文件被歸檔、掃描或轉錄時,很難跟蹤哪個版本的文件與哪些文件相關聯。有了 PDF OCR,可以跟蹤文件的變更,並確定哪些版本與哪些文件相關聯。這對於管理文件檔案和防止重要資訊丟失很有用。

在本文中,您將學習如何使用 Adobe Acrobat Pro 軟體對任何 PDF 文件使用 OCR。 本文還將介紹 .NET OCR 程式庫 IronOCR,它是市場上最有效和功能豐富的程式庫之一。 讓我們從 Adobe Acrobat Pro 開始。

使用 Adobe Acrobat Pro DC 對 PDF 進行 OCR

How to OCR a PDF - Figure 1

Adobe Acrobat Pro DC 是 Adobe Acrobat Reader DC 的專業版。 它是最受歡迎且功能強大的 PDF 操作工具。 使用此軟體,您可以建立、編輯、簽署和審閱任何 PDF 文件。 此外,它還允許您將 PDF 轉換為 PowerPoint 演示文稿、Word 文件或 Excel 文件。 它還能編輯掃描的文件。

新的 Acrobat DC 版本也是一個文件掃描儀,可以使用 OCR 技術快速將掃描的文件轉換為數位文件。 它具有光學字元識別以及智能名片掃描功能,可以在幾秒鐘內自動檢測並儲存名片上的聯絡資訊。

除了能夠從 PDF 文件中提取文字外,Acrobat Pro DC 還有許多使其成為 PDF 轉錄寶貴工具的功能。

讓我們看看如何使用 Adobe Acrobat Pro 對掃描的文件進行 OCR。

  • 在 Adobe Acrobat 中開啟所需的 PDF 文件,在本例中是一個掃描的 PDF 文件。
  • 從文件的右側窗格中選擇"編輯 PDF"。
How to OCR a PDF - Figure 2

  • 這將開啟 Adobe Reader OCR PDF 工具的介面。
  • 點擊頂部功能區上的"編輯"按鈕。
  • 這將掃描的 PDF 文件轉換為完全可編輯的 PDF 文件。 您將能夠在 PDF 文件本身上編輯文字和圖像文件。
How to OCR a PDF - Figure 3

  • 您還可以更改文字塊位置、文字字體等。

進行任何更改後,儲存文件,您將看到這些更改反映在文件中。

IronOCR:一個 .NET OCR 程式庫

How to OCR a PDF - Figure 4

IronOCR 是一個 .NET OCR 程式庫和 OCR 工具,可以通過將文字文件和圖像轉換為機器可讀格式來讀取它們。

這個光學字元識別程式庫是基於以下考量進行開發的:

  • 需要一個強大且準確的 OCR 引擎,能夠無需任何外部軟體即能使用不同語言。
  • 需要一個易於使用的 API,可跨 Windows、Linux 和 macOS 等不同平台運作。
  • 需要一個可以輕鬆整合到各種 .NET 應用中且支持 WPF 與控制台應用程式的 OCR 引擎。

IronOCR 使開發者更容易建立支援掃描文件、提取文字和元資料、索引掃描圖像文件、將圖像轉換為可搜索 PDF、並將掃描的文件轉換為可讀文字的軟體。 IronOCR 在編碼、圖像格式轉換、文字識別和提取方面提供了很多選擇。 IronOCR 支持 125 種語言。

IronOCR 提供一個直觀、強大且準確的 OCR 過程,能夠識別掃描文件、照片和截圖中的文字,同時減少頁面分段和佈局分析等耗時的任務。 該程式庫是使用 C# 開發的,其 API 設計簡單明瞭,且可讀性良好。

讓我們探討一些使用 IronOCR 的程式碼範例:

程式碼範例

using IronOcr;

var Ocr = new IronTesseract();

// Initialize OCR input
using (var Input = new OcrInput())
{
    // OCR entire document
    Input.AddPdf("example.pdf", "password");

    // Alternatively, OCR selected page numbers
    Input.AddPdfPages("example.pdf", new[] { 1, 2, 3 }, "password");

    // Read the PDF and output the recognized text
    var Result = Ocr.Read(Input);
    Console.WriteLine(Result.Text);
}
using IronOcr;

var Ocr = new IronTesseract();

// Initialize OCR input
using (var Input = new OcrInput())
{
    // OCR entire document
    Input.AddPdf("example.pdf", "password");

    // Alternatively, OCR selected page numbers
    Input.AddPdfPages("example.pdf", new[] { 1, 2, 3 }, "password");

    // Read the PDF and output the recognized text
    var Result = Ocr.Read(Input);
    Console.WriteLine(Result.Text);
}
Imports IronOcr

Private Ocr = New IronTesseract()

' Initialize OCR input
Using Input = New OcrInput()
	' OCR entire document
	Input.AddPdf("example.pdf", "password")

	' Alternatively, OCR selected page numbers
	Input.AddPdfPages("example.pdf", { 1, 2, 3 }, "password")

	' Read the PDF and output the recognized text
	Dim Result = Ocr.Read(Input)
	Console.WriteLine(Result.Text)
End Using
$vbLabelText   $csharpLabel

此範例演示如何使用 IronOCR 處理整個 PDF 文件或該文件的特定頁面。

PDF 文件(輸入)

How to OCR a PDF - Figure 5

輸出至控制台

How to OCR a PDF - Figure 6

您可以使用 IronOCR 將 PDF 轉換為可選擇的 PDF。 這是非常簡單明了的。 請參閱下面的 PDF 轉換程式碼片段:

using IronOcr;

var Ocr = new IronTesseract();

// Initialize OCR input
using (var Input = new OcrInput())
{
    // Add PDF for processing
    Input.AddPdf("scan.pdf", "password");

    // Clean up twisted pages to improve OCR results
    Input.Deskew();

    // Run OCR and save as a searchable PDF
    var Result = Ocr.Read(Input);
    Result.SaveAsSearchablePdf("searchable.pdf");
}
using IronOcr;

var Ocr = new IronTesseract();

// Initialize OCR input
using (var Input = new OcrInput())
{
    // Add PDF for processing
    Input.AddPdf("scan.pdf", "password");

    // Clean up twisted pages to improve OCR results
    Input.Deskew();

    // Run OCR and save as a searchable PDF
    var Result = Ocr.Read(Input);
    Result.SaveAsSearchablePdf("searchable.pdf");
}
Imports IronOcr

Private Ocr = New IronTesseract()

' Initialize OCR input
Using Input = New OcrInput()
	' Add PDF for processing
	Input.AddPdf("scan.pdf", "password")

	' Clean up twisted pages to improve OCR results
	Input.Deskew()

	' Run OCR and save as a searchable PDF
	Dim Result = Ocr.Read(Input)
	Result.SaveAsSearchablePdf("searchable.pdf")
End Using
$vbLabelText   $csharpLabel

IronOCR 提供了許多其他工具和功能。 您可以通過存取以下連結來探索 IronOCR 的功能。

結論

IronOCR 程式庫相較市場上其他程式庫擁有幾個優勢。 您可以通過新增自己的模組並僅用幾行程式碼來修改和擴展其功能。 IronOCR 目前可以閱讀超過 125 種語言的文字。 與其他程式庫相比,它已被開發出能在消耗更少時間和記憶體資源的情況下產生更高質量、更多信賴的結果。

IronOCR 是開發免費的。 IronOCR 也提供了免費試用供在生產環境中測試。 有關 IronOCR 的價格和免費試用的更多詳情,請點擊連結

How to OCR a PDF - Figure 7

Kannaopat Udonpant
軟體工程師
在成為軟體工程師之前,Kannapat在日本北海道大學完成了環境資源博士學位。在攻讀學位期間,Kannapat還成為車輛機器人實驗室的一員,該實驗室隸屬於生產工程系。在2022年,他憑藉C#技能加入了Iron Software的工程團隊,專注於IronPDF。Kannapat珍視他的工作,因為他能直接向撰寫大部分IronPDF程式碼的開發者學習。除了同儕學習,Kannapat還喜歡在Iron Software工作的社交方面。不寫程式碼或文件時,Kannapat通常在他的PS5上玩遊戲或重看The Last of Us。

Iron 支援團隊

我們線上24小時,每週5天。
聊天
電子郵件
給我打電話