IRONSOFTWAREHOME

如何在 C# 中使用 Tesseract 的多种语言

Kannaopat Udonpant
Kannapat Udonpant
Updated: 2026年6月29日

IronOCR 可使用 Tesseract 引擎从多种语言的文档中提取文本,只需一行代码即可配置主要语言和次要语言,支持超过 125 种语言包,实现无缝多语言 OCR 处理。

简介

IronOCR 使用Tesseract 引擎作为可靠的 OCR 工具,提供从各种语言和脚本中提取文本的功能。

本文将探讨 IronOCR 如何通过 Tesseract 处理多语言文本。 您将学习如何实施多语言OCR解决方案,并了解IronOCR及其Tesseract引擎集成的功能。

用多种语言处理文档对于现代应用程序至关重要。 国际商业文档、多语种网站和全球通信平台需要跨越语言障碍进行准确的文本提取。 IronOCR通过与Tesseract的广泛语言支持集成来满足这种需求,支持从包含多个脚本和字符集的文档中提取文本。

快速开始:使用 IronOCR 识别多种语言的文本

用主要语言配置 IronOCR,并在一行中添加辅助语言,即可从多语言文档或图像中提取文本。

  1. 1Install IronOCR with NuGet Package Manager

    PM > Install-Package IronOcr

  2. 2复制并运行这段代码。

    string text = new IronTesseract { Language = OcrLanguage.Spanish }.AddSecondaryLanguage(OcrLanguage.French).Read("doc_or_image_path").Text;
    C#
  3. 3部署到您的生产环境中进行测试

    通过免费试用立即在您的项目中开始使用IronOCR
    arrow pointer

如何使用 IronOCR 阅读多语言 PDF?

IronOCR提供大约125个语言包; 默认情况下仅安装英文版。 从 NuGet 下载其他语言。 查看所有可用的语言包。

包含多种语言的 PDF 需要特定的 OCR 引擎配置。 IronOCR 允许您在处理文档前指定主要语言和次要语言,确保不同脚本和字符集的最佳识别准确性。

哪些语言可用于 PDF 提取?

以下示例展示如何在IronOCR中使用多种语言从PDF文件中提取文本。

using IronOcr;
using System;

// Instantiate IronTesseract
IronTesseract ocrTesseract = new IronTesseract();

// Set secondary language to Russian
ocrTesseract.AddSecondaryLanguage(OcrLanguage.Russian);

// Add PDF
using var pdfInput = new OcrPdfInput(@"example.pdf");
// Perform OCR
OcrResult result = ocrTesseract.Read(pdfInput);

// Output extracted text to console
Console.WriteLine(result.Text);

如需了解复杂的 PDF 处理场景,请参阅我们的 PDF OCR 文本提取指南,其中涵盖了适用于各种 PDF 格式和结构的高级技术。

语言优先级如何影响 OCR 结果?

使用AddSecondaryLanguage方法添加任意数量的辅助语言。 请注意,其他语言可能会影响速度和性能。 语言优先级取决于添加的顺序,先添加的语言优先级更高。

在处理多语言文件时,理解语言优先级至关重要。 在文本提取过程中,主要语言的优先级最高——OCR引擎首先尝试将字符与主要语言的字符集匹配。 当遇到不匹配主要语言模式的字符时,将咨询辅助语言。

实现最佳性能:

  • 将文档中最常用的语言设置为主要语言
  • 在文件中添加按频率排序的辅助语言
  • 将辅助语言限制在使用案例所需的语言范围内

对于使用多种语言的高性能应用程序,请参阅我们的快速 OCR 配置指南,以优化处理速度。

如何使用 Tesseract 处理多语言图像?

英语是默认的主要语言。 要更改它,请将**Language**属性设置为您想要的语言,然后根据需要添加辅助语言。

包含多语言文本的图片需要仔细配置。 与PDF不同,图像可能包含不同的文本方向、不同的字体和混合脚本。IronOCR的Tesseract集成为这些场景提供全面的语言配置选项。

何时应更改默认语言设置?

在下列情况下更改默认语言

  • 文件大部分使用非英语语言
  • 处理来自特定地区或国家的文件
  • 您的应用程序面向使用非英语内容的用户
  • 优化特定字符集的识别准确性

下面是一个完整的多语言图像处理示例:

using IronOcr;
using System;

// Instantiate IronTesseract
IronTesseract ocrTesseract = new IronTesseract();

// Set primary language to Russian
ocrTesseract.Language = OcrLanguage.Russian;
ocrTesseract.AddSecondaryLanguage(OcrLanguage.Japanese);

// Add image
using var imageInput = new OcrImageInput(@"example.png");
// Perform OCR
OcrResult result = ocrTesseract.Read(imageInput);

// Output extracted text to console
Console.WriteLine(result.Text);

有关自定义语言或专用字体,请参阅我们的使用自定义语言文件教程。

多语言 OCR 可以带来哪些结果?

正确的配置会产生这样的结果:

多语言文本处理应用程序显示俄语和日语内容,控制台输出显示字符处理

多语言 OCR 结果的质量取决于多个因素:

1.图像质量:分辨率越高(300 DPI 以上)效果越好。 请参阅我们的 DPI 设置指南。 2. 文本清晰度:清晰、定义良好的文本无伪影可提供更准确的识别 3. 语言配置:正确的主要和辅助语言设置确保正确的字符识别模式 4.预处理:适当的过滤器可显著改善结果。 有关增强技术,请参阅我们的 图像校正过滤器指南。

多语言 OCR 的关键要点是什么?

IronOCR 使用 Tesseract 引擎,能有效地从多语言文档中提取文本。 它可以处理多种语言文本阅读的复杂性,提供了一个通用的解决方案。 无论是处理各种语言的 PDF 文件,还是处理多语言图像内容,IronOcr 都能简化跨语言文本的识别和提取。

IronOCR 用于多语言文本提取的主要优势:

  • 广泛的语言支持:通过NuGet包提供超过125种国际OCR语言
  • 灵活的配置:主要和辅助语言设置的简单API
  • 高准确性:使用Tesseract 5的高级识别算法
  • 性能优化:内置的多线程支持
  • 跨平台兼容性:可在 Windows、Linux 和 macOS 上运行

IronOCR 为多语言 OCR 的实现提供了一个将易用性与强大功能相结合的综合解决方案。 以成功所需的灵活性和可靠性构建文档管理系统、翻译工具或任何需要多语言文本提取的应用程序。

从 NuGet 下载 IronOCR 并浏览我们的文档和示例,开始您的多语言 OCR 项目。 对于特定的使用案例或高级场景,我们的故障排除指南可提供见解,以实现最佳效果。

常见问题解答

如何对包含多种语言的文档执行 OCR?

IronOCR 只需一行代码即可配置多语言 OCR。使用 Language 属性设置主要语言,并使用 AddSecondaryLanguage 方法添加辅助语言。这样,IronOCR 就能同时从包含多种脚本和字符集的文档中准确提取文本。

文本提取支持哪些语言?

IronOCR 通过其 Tesseract 引擎集成支持超过 125 种语言包。虽然默认安装的是英语,但您可以从 NuGet 下载其他语言包,以启用从西班牙语、法语到阿拉伯语、中文、日语等多种语言的 OCR 功能。

如何为 OCR 处理添加辅助语言?

using IronOCR 中的 AddSecondaryLanguage 方法启用其他语言。例如:new IronTesseract { Language = OcrLanguage.Spanish }.AddSecondaryLanguage(OcrLanguage.French).通过这种配置,IronOCR 可以识别同一文档中的西班牙语和法语文本。

我可以从多语言 PDF 中提取文本吗?

是的,IronOCR 可以处理包含多种语言的 PDF。只需在处理前将 OCR 引擎配置为主要语言和次要语言即可。IronOCR 会自动处理 PDF 中的不同脚本和字符集,确保准确提取文档中所有语言的文本。

我需要单独安装语言包吗?

是的,虽然 IronOCR 默认包含英语,但必须通过 NuGet 安装其他语言包。每个语言包都包含 IronOCR 的 Tesseract 引擎识别特定语言文本所需的数据。您可以从 IronOCR 语言页面查看并下载所有可用的语言包。

多语言 OCR 的最基本工作流程是什么?

最基本的工作流程包括 5 个步骤:1) 下载 IronOCR 库;2) 准备 PDF 或图像文档;3) 通过 NuGet 安装所需的语言包;4) 使用 AddSecondaryLanguage 方法启用其他语言;5) 为主要语言设置语言属性。这种设置可实现准确的多语言文本提取。

What are the benefits of using IronOCR for multi-language text extraction?

IronOCR offers extensive language support, flexible language configuration, high accuracy with Tesseract 5's algorithms, performance optimization with multithreading, and cross-platform compatibility, making it ideal for applications requiring multilingual text extraction.

准备开始了吗?

Nuget Downloads 6,236,385版本:2026.9刚刚发布

免费获取

30天试用密钥 即刻获取。

bullet_checked无需信用卡或创建账户
bullet_test在生产环境中测试
且无水印
bullet_calendar30天完全
功能性产品
bullet_support试用期间提供
24/5技术支持
立即获取您的免费30 天试用密钥
无需信用卡或创建账户
C# 用于 PDF 的 NuGet 库
通过 NuGet 安装

版本: 2026.9

PM > Install-Package IronOcr
nuget.org/packages/IronOcr/
  1. 在解决方案资源管理器中,右键点击引用,管理 NuGet 包
  2. 选择浏览并搜索"IronOCR"
  3. 选择包并安装
C# PDF DLL
下载 DLL

版本: 2026.9

或在这里下载Windows安装程序。

  1. 下载并解压IronOCR到你的解决方案目录中的~/Libs位置
  2. 在Visual Studio解决方案资源管理器中,右键点击引用。选择浏览,“IronOCR.dll”

许可证售价$999

Key in blue circle

立即获取免费的 30 天试用版密钥

Your trial license will be sent to your email address

无任何限制。100% 解锁。无需信用卡。

bullet_checked无需信用卡或创建账户无任何限制。100% 解锁。无需信用卡。
  • Logo Aetna
  • Logo NASA
  • Logo GE
  • Logo Porsche
  • Logo USDA
  • Logo Qatar
Join Millions of Engineers who’ve tried IronPDF
获取您的无义务咨询
填写下面的表格或通过sales@ironsoftware.com
您的资料将始终保密。
深受全球数百万工程师信赖
Iron Software 的客户徽标
立即获取您的免费30 天试用密钥
无需信用卡或创建账户