PDF OCR 文字擷取
Iron Tesseract 可以讀取多種圖像格式和PDF文件。 這個功能在傳統的免費Tesseract引擎中是不可能的。
OcrInput 提供了自動修正PDF特性的選項,當掃描質量不佳時。
開發者可以指定讀取整個PDF,一個選定的頁面,或者一個單一的裁剪區域。
如何在C#中OCR PDF文件
- Download C# library to OCR PDF file
- 使用
AddPdf方法新增PDF文件 - 使用
AddPdfPages方法新增特定頁面的PDF文件 - 利用
Read方法對新增的PDF進行OCR - 在
Barcodes屬性中查看所有QR Code值。存取 Text 屬性以檢索OCR結果
C# PDF OCR
許多OCR工具在最佳條件下工作良好,但是當您需要在任何條件下都能提高穩定性和準確性的工具時,IronOCR文字提取解決方案即是您的所需。
IronOCR文字提取是從頭開始構建的,能夠將現實世界中的圖像轉換為99%的準確率。
IronTesseract,我們原生的C# OCR庫,可以從現實世界中不總是良好且有時候歪曲的圖像中識別字元,幾乎達到人眼般的表現。
我們的OCR允許PDF或圖像的特性在掃描質量不佳時自動修正。
隨著我為您介紹目前市場上最好的OCR解決方案,您將能夠親自體驗。
為何選擇IronOCR進行圖像或PDF的OCR文字提取?
選擇IronOCR作為Tesseract管理的解決方案是顯而易見的選擇,因為考量到它的以下獨特功能:
- IronOCR的PDF OCR文字提取引擎在純淨的.NET環境中即裝即用
- 它不需要在您的計算機上安裝Tesseract。
- 與最新的引擎效果出色:Tesseract 5(以及Tesseract 4和3)。
- 可應用於任何.NET項目:.NET Framework 4.5+、.NET Standard 2+ 和 .NET Core 2, 3 & 5!
- 比其他開源Tesseracts具有更高的準確性和速度。
- IronOCR支持Xamarin、Mono、Azure和Docker開發平台。
- 您可以使用NuGet包管理複雜的Tesseract字典系統。
- 可從PDF、MultiFrame Tiffs和所有主要的圖像文件中提取文字,無需額外調整。
- 它可以修正低質量和傾斜的圖像掃描,以獲得文字提取項目的最佳結果。
您有低質量的掃描件嗎? 沒問題!
在涉及到OCR任務時,IronOCR在更高層次上脫穎而出。 實際上,許多類似的產品旨在與機器印刷的、高解析度和完美的文字或圖像搭配使用,因此在現實應用中變得不准確或失效。 然而,這不適用於IronOCR。
IronOCR在修正不完美的文件時表現出色。 它可以拉直傾斜的掃描圖像並增強低質量的照片,使其成為可搜索的PDF文件或圖像。 這正是我們的產品與眾不同的原因。
調整IronOCR的性能以適合您的工作流程
使用Iron Software的OCR解決方案,您可以調整文字提取任務的性能,以獲得適合您的工作流程的正確平衡。 我們知道這對很多使用者和開發者都非常重要,因為此我們將我們的OCR解決方案設計得可調整性能和靈活。
例如,一個非常重要的因素影響著OCR工作速度就是輸入圖像的質量。 當背景噪音較少且圖像的dpi較高時(200 dpi為不錯的範圍),產出就越快,OCR結果也越准確。 但是,借助IronOCR的性能調整功能,即使是低質量圖像的任務也可以迅速完成。
此外,選擇輸入圖像或掃描的文字格式中噪音較少者,如PNG或TIFF,會比較低質量的圖像格式如JPEG帶來更快速的結果。
安裝IronOCR解決方案非常簡單
Iron Software套件很容易安裝和運行。 它適用於最受歡迎的開發平台。 我們的解決方案具有跨平台支持,包括Windows、Linux、macOS、Azure、AWS和Docker—C#使其成為開發者中最偏好使用的Tesseract OCR引擎是有原因的。
支持超過125種國際語言
對於OCR工作來說,當某軟體支持多語言時,它會變得更有用。 IronOCR解決方案讓自身變得不可或缺,因為它支持125種國際語言。 這些語言包可以安裝為DLL文件。 它們可以從本網站或是Visual Studio的NuGet Package Manager中下載。
如何安裝OCR語言包
一百二十種語言被支持。 您可以使用兩種方法下載任何額外的OCR語言包:
安裝NuGet包
在NuGet中搜尋 IronOCR 語言。
使用OCR資料方法
下載ocrdata文件並將其新增到您的.NET項目或程式文件中。
輕鬆地從您的掃描文件或圖像建立可搜索的文件
我們感到非常自豪的一個特點是,我們的Tesseract軟體能從輸入圖像或掃描PDF文件建立可搜索的PDF文件或可搜索的文字。您可以將OCR結果導出為PDF,它將成為C#和VB.NET中的可搜索PDF文件。 這能夠幫助企業和政府機構處理資料庫人口、SEO和PDF。
利用最佳OCR工具的力量
IronOCR是從圖片和文件中提取文字的最佳工具。 它配備了多種功能、操作性和解決方案,使您在完成OCR任務時擁有一個輕鬆及順暢的體驗。
我們的OCR Tesseract C# 庫可以幫助您在C# 和 .NET 應用程式等開發環境中提取圖像和掃描文件中的文字。
使用IronOCR,您甚至可以輕鬆打開受密碼保護的PDF文件,並順利提取文字。
它還具有以下特徵:
- 無需可執行文件或C++ 程式碼
- 完整的PDF OCR支持
- 與MVC、Web應用程式、桌面、控制台、和伺服器應用程式相容
- 完整支持.NET Core、Standard和Framework
- 使用
C#&VB.NET進行閱讀 - 讀取QR和條形碼
- 將OCR導出為XHTML或可搜索的PDF文件
- 支持多執行緒
- 提取圖像、坐標、統計資料、字體等等
勇敢邁向IronOCR
有鑑於這個不可思議的OCR解決方案的功能,若您選擇試用IronOCR絕對是不會出錯的。
使用我們的軟體只需幾次點擊即可。 從安裝IronOCR開始——這是一項非常簡單的任務。 此外,有著非常有幫助且詳細的分步指南教您如何使用我們的任何工具和How-Tos,更不必說我們的資源豐富的支援中心會在最短時間回應查詢(幾乎即時)。
不要猶豫——今天就選擇IronOCR。 這是學習如何在C#中讀取PDF文件的第一和最重要的一步。
如果您心中還有任何疑問,我們的免費試用授權金鑰對您來說是完美的選擇。 它可以幫助您在不需要任何財務條件的情況下探索IronOCR的最新版本的全部潛力。 它可以幫助您決定哪種授權是最適合您的。 如果您不確定,請毫不猶豫地聯絡我們的專家團隊,無論您的地點在哪都可以。

