跳至頁尾內容
OCR 工具

Mac 上的最佳 OCR【免費線上工具】

1.0 介紹

在現代數位環境中,由於OCR(光學字元識別)技術的進步,掃描文件的使用發生了革命性變化。 這項技術使電腦能夠識別並提取來自各種來源的文字,包括掃描的PDF文件,使我們能夠快速編輯和互動PDF文件。 使用像Adobe Acrobat這樣的光學字元識別(OCR)軟體,可以快速簡單地從掃描文件中提取文字,並將其轉換為可編輯的PDF或可搜尋的圖像型PDF。

開發人員可以利用先進的算法,通過結合由像Tesseract和IronOCR這樣的OCR程式庫提供的強大工具和API 與機器學習技術,使他們能夠充分利用光學字元識別技術。 這些程式庫使得準確的文字識別更為簡單,從而更容易組織和提取新建立文件及已掃描文件中的有用資料。 利用OCR最大化掃描文件和頁面圖像的潛力,提供無縫的內容分析,幫助個人和企業生產力最大化。 OCR掃描將圖像轉換為可搜尋的PDF,使OCR成為現代科技中重要的工具。 它用於數位化紙本記錄,從發票中提取資料以及提高文件的可存取性。

2.0 OCR 工具

在這篇文章中,我們將討論一些為Mac使用者提供的最佳OCR軟體工具。 它們包括:

  1. Adobe Acrobat Pro DC
  2. ABBYY FineReader PDF
  3. Readiris 17
  4. IronOCR

2.1 Adobe Acrobat Pro DC

最初的文件掃描OCR程式及我們2023年Mac OCR軟體的首選是Adobe Acrobat Pro。 Adobe Acrobat Pro是唯一一款能在Mac上建立和編輯PDF文件以及將PDF文件轉換為可編輯或可搜尋格式的程式,這不足為奇。 PDF格式最初是由Adobe開發的。 儘管現在市場上有許多能處理廣泛PDF任務的產品,但Adobe Acrobat Pro DC仍然非常強大。雖然Adobe提供了在線使用Adobe Acrobat Pro DC的 Adobe Document Cloud平臺,但Mac桌面客戶端突顯其卓越性。 值得注意的是,Adobe Acrobat是唯一與最新的M1和M2 Mac相容的OCR程式,這提高了它的吸引力。

  1. 首先,啟動Acrobat並開啟一個PDF文件。
  2. 在右側視窗中,選擇"編輯PDF"工具。 Acrobat 在自動進行光學字元識別(OCR)掃描後迅速將您的文件轉換為PDF的完全可編輯副本。

Best OCR For Mac, Figure 1 - A PDF with Page 1 opened in Adobe Acrobat.

要編輯元素,請點擊它。 您提供的其他文字將匹配原始字體的風格。 要保存您新更改的文件,請選擇File > Save As。

您可以在Adobe Acrobat網站上了解有關Adobe Acrobat DC安裝的更多資訊。

2.2 ABBYY FineReader PDF For Mac

ABBYY FineReader PDF OCR軟體在Mac上已推出近20年,但在大部分時間裡,它被命名為ABBYY FineReader Pro。 ABBYY更新了FineReader產品線,隨macOS Big Sur的發佈而推出FineReader PDF。 不幸的是,它只能在Intel Mac上原生運行。 ABBYY FineReader PDF For Mac與M1和M2 Mac相容,但僅在與Rosetta一起使用時,這是macOS中的一個程式,將為Intel處理器設計的軟體轉換為在Apple Silicon芯片上運行。 目前沒有原生支持M1/M2芯片的FineReader PDF的Mac版本。 儘管如此,ABBYY FineReader PDF仍是Mac和PC上最好的桌面OCR程式之一。

儘管原件的質量影響準確率,FineReader PDF的OCR文字識別能力非常出色,無疑是市場上最好的。 掃描文件的原始格式,包括文字大小、字型風格、照片、表格和佈局均保留。 它也擅長迅速而準確地識別文字。 以下是進行OCR的步驟:

  1. 啟動ABBYY FineReader PDF。
  2. 選擇"可搜尋PDF"選項,允許您開啟PDF並轉換為可搜尋的PDF。 您還可以保存轉換的PDF文件。

Mac的最佳OCR,圖2 - ABBYY FineReader來源對話框。

要了解有關ABBYY FineReader的更多資訊,請存取其網站

2.3 Readiris 17

Mac使用者可以使用ReadIris 17作為OCR解決方案。 儘管其主要用於Windows,但ReadIris為Mac使用者開發了一個具有OCR功能的PDF閱讀器和編輯器。

使用ReadIris 17,使用者可以輕鬆合併、拆分、保護和簽署PDF。 離線Mac OCR軟體允許將PDF文件轉換為Word、Excel、可搜尋的PDF或PowerPoint,同時保留文件格式。 然而,免費版本對一次能掃描的頁數有一定限制。

Best OCR For Mac, Figure 3 - A PDF In ReadIris 17 with the text Hello world!.

我將一個圖像輸入軟體並嘗試從中提取文字。 此外,它還捕獲了螢幕上可見的元素。 可能需要一些後期處理。

了解更多資訊,請查看Iris網站

2.4 IronOCR

IronOCR在提升Tesseract與標準Tesseract程式庫的對比中,提供了一個具備改進準確性、性能和穩定性的原生C# OCR程式庫。 它允許使用.NET工具和網站從PDF和圖像中提取文字。 支援多種外語,IronOCR能輸出純文字或結構化資料。 它能讀取條碼和內嵌文字的圖像。 在.NET控制台、Web、MVC和桌面應用程式中開發的應用程式可以利用Iron Software OCR程式庫。 開發團隊提供商業部署的直接支援。 IronOCR與Visual Studio的最新版本相容。

IronOCR的優勢

  1. 使用現代Tesseract 5引擎,IronOCR能掃描紙本文件、條碼和QR碼,從各類圖像或PDF文件中提取資訊。 這個套件簡化了OCR整合到桌面、控制台和web應用程式中。
  2. 借助IronOCR的協助,我們可以執行OCR,將掃描的PDF轉換為可搜尋的PDF。
  3. IronOCR支持全球125種不同語言,以及自定義語言和詞表。
  4. 該軟體可讀取超過20種不同型別的條碼和QR碼。
  5. IronOCR提供條碼資料和純文字輸出。 開發人員可以通過替代的結構化資料物件範式存取所有內容,並直接輸入到系統中。 這包括在線應用程式中邏輯組織的標題、段落、行、單詞和字元。

要了解更多資訊,請參閱IronOCR網站

使用IronOCR進行OCR處理

IronOCR是一個強大的OCR程式庫,能夠將PDF文件和資料進行轉換和存取。 它促進了機器可讀文字的轉換,便於高效分析和處理而不會損害資料隱私。 以下是一個IronOCR的使用例子,這個例子中利用OCR從圖像中提取文字:

// Instantiate IronTesseract object to use IronOCR capabilities
var Ocr = new IronTesseract();

// Specify the language to use for OCR
Ocr.Language = OcrLanguage.EnglishBest;

// Define the Tesseract version to use
Ocr.Configuration.TesseractVersion = TesseractVersion.Tesseract5;

// Use an OcrInput object to add images for OCR processing
using (OcrInput ocrInput = new OcrInput("Demo.gif"))
{
    // Perform OCR and obtain the result containing extracted text
    OcrResult ocrResult = Ocr.Read(ocrInput);

    // Print the extracted text to the console
    Console.WriteLine(ocrResult.Text);
}
// Instantiate IronTesseract object to use IronOCR capabilities
var Ocr = new IronTesseract();

// Specify the language to use for OCR
Ocr.Language = OcrLanguage.EnglishBest;

// Define the Tesseract version to use
Ocr.Configuration.TesseractVersion = TesseractVersion.Tesseract5;

// Use an OcrInput object to add images for OCR processing
using (OcrInput ocrInput = new OcrInput("Demo.gif"))
{
    // Perform OCR and obtain the result containing extracted text
    OcrResult ocrResult = Ocr.Read(ocrInput);

    // Print the extracted text to the console
    Console.WriteLine(ocrResult.Text);
}
' Instantiate IronTesseract object to use IronOCR capabilities
Dim Ocr = New IronTesseract()

' Specify the language to use for OCR
Ocr.Language = OcrLanguage.EnglishBest

' Define the Tesseract version to use
Ocr.Configuration.TesseractVersion = TesseractVersion.Tesseract5

' Use an OcrInput object to add images for OCR processing
Using ocrInput As New OcrInput("Demo.gif")
	' Perform OCR and obtain the result containing extracted text
	Dim ocrResult As OcrResult = Ocr.Read(ocrInput)

	' Print the extracted text to the console
	Console.WriteLine(ocrResult.Text)
End Using
$vbLabelText   $csharpLabel

在提供的程式碼片段中,IronTesseract增強了OCR功能。 一個OcrInput物件建立了一個簡單介面用於新增圖像以提取文字。 指定的圖像路徑用於初始化OCR過程,IronOCR讀取圖像並將文字提取為字串格式。

Best OCR For Mac, Figure 4 - A PDF opened in Adobe Acrobat with the text Hello world!.

下面的輸出顯示從提供的圖像中提取的文字,確認已成功提取。 IronOCR還支持多種輸出格式以保存結果。

Best OCR For Mac, Figure 5 - The text Hello world! is displayed on the command line.

結論

市面上多種OCR工具可以進行發票的資料處理。 圖像的OCR處理允許從提供的圖像中翻譯文字資料。 前兩個OCR工具啟用自動掃描和資料驗證,通過處理發票資料而不需手動資料輸入。 這些工具往往價格昂貴,常常需要持續互聯網連接,限制其在特定環境中的可用性。

另一方面,IronOCR支持各類.NET項目,包括.NET Framework Standard 2, .NET Framework 4.5及.NET Core 2, 3和5。它還能與現代技術如Xamarin, Azure, MAC及Mono配合使用。IronOCR增強了Tesseract的輸出,並使用IronOCR方法來糾正誤掃描的單詞或圖像。 由NuGet Package管理的複雜的Tesseract字典系統。 IronOCR程式庫被用來建立一個OCR工具。 因此,IronOCR是自動化發票OCR和提取資料的理想工具,並且程式碼極少。

支持多種圖像格式、PDF文件及MultiFrame TIFF,IronOCR提供了無縫體驗,無需額外的設定。 它除了光學字元識別外,還提供條碼識別功能,能從含有條碼的圖像中提取資料。 IronOCR的經濟型開發版本的免費試用版是可用的,購買IronOCR套件包含終身許可。 IronOCR套件提供了很高的價值,因為它提供了一個單一價格覆蓋多個系統。 如需了解IronOCR的更多費用資訊,請存取IronOCR網站

Kannaopat Udonpant
軟體工程師
在成為軟體工程師之前,Kannapat在日本北海道大學完成了環境資源博士學位。在攻讀學位期間,Kannapat還成為車輛機器人實驗室的一員,該實驗室隸屬於生產工程系。在2022年,他憑藉C#技能加入了Iron Software的工程團隊,專注於IronPDF。Kannapat珍視他的工作,因為他能直接向撰寫大部分IronPDF程式碼的開發者學習。除了同儕學習,Kannapat還喜歡在Iron Software工作的社交方面。不寫程式碼或文件時,Kannapat通常在他的PS5上玩遊戲或重看The Last of Us。

Iron 支援團隊

我們線上24小時,每週5天。
聊天
電子郵件
給我打電話