Przejdź do treści stopki
NARZęDZIA OCR
Jak zainstalować Tesseract OCR na Windows w C#

Zainstaluj Tesseract (samouczek krok po kroku z obrazkami)

Czym jest Tesseract OCR?

Tesseract to biblioteka oprogramowania open-source, wydana na podstawie umowy licencyjnej Apache. Początkowo został opracowany przez Hewlett Packard w latach 80. Jest narzędziem do rozpoznawania tekstu używanym głównie do identyfikacji i wydobywania tekstów z obrazów. Tesseract OCR udostępnia interfejs w wierszu poleceń do wykonywania tej funkcji.

Jak pobrać Tesseract OCR na Windows

  1. Pobierz Instalator Tesseract dla Windows
  2. Zainstaluj Tesseract OCR
  3. Dodaj ścieżkę instalacji do zmiennych środowiskowych
  4. Uruchom Tesseract OCR

1. Pobierz Instalator Tesseract dla Windows

Aby używać polecenia Tesseract na Windows, najpierw musimy pobrać pliki binarne Tesseract OCR .exe Instalator Windows.

Istnieje wiele miejsc, w których można pobrać najnowszą wersję Tesseract OCR. One such place is from UB Mannheim, which is forked from Tesseract-ocr/tesseract (Main Repository).

Install Tesseract, Figure 1: Wiki Tesseract

Wiki Tesseract

Download the Tesseract-ocr-w64-setup-5.3.0.20221222.exe (64 bit) Windows Installer.

Dla użytkowników macOS Tesseract można zainstalować w terminalu za pomocą jednego z poniższych poleceń:

brew install tesseract
brew install tesseract
SHELL
sudo port install tesseract
sudo port install tesseract
SHELL

2. Zainstaluj Tesseract OCR

Następnie zainstalujemy Tesseract za pomocą pliku .exe, który pobraliśmy w poprzednim kroku. Uruchom instalator .exe, aby rozpocząć instalację Tesseract.

Język instalatora

Po zakończeniu rozpakowywania setupu, pojawi się okno dialogowe języka danych instalatora. Można zainstalować Tesseract, używając wielu języków, wybierając dodatkowe pakiety językowe, ale tutaj zainstalujemy tylko dane językowe dla języka angielskiego.

Install Tesseract, Figure 2: Instalator Tesseract

Instalator Tesseract

Kliknij OK, a język instalatora dla Tesseract OCR zostaje ustawiony.

Konfiguracja Tesseract OCR

Następnie pojawi się kreator konfiguracji. Ten kreator instalacji poprowadzi cię przez instalację Tesseract na Windows.

Install Tesseract, Figure 3: Tesseract OCR

Kreator konfiguracji Tesseract OCR

Kliknij Dalej, aby kontynuować instalację.

Zaakceptuj umowę licencyjną

Tesseract OCR jest licencjonowany na podstawie Apache License Wersja 2.0. Jako oprogramowanie open-source i darmowe do użytku, możesz redystrybuować i modyfikować wersje Tesseract bez obaw o opłaty licencyjne.

Install Tesseract, Figure 4: Tesseract License

Tesseract OCR jest licencjonowany na podstawie Apache License v2.0. Proszę zaakceptować tę licencję, aby kontynuować instalację.

Kliknij Zgadzam się, aby przejść do instalacji.

Wybierz użytkowników

Możesz wybrać zainstalować Tesseract dla wielu użytkowników lub dla pojedynczego użytkownika.

Install Tesseract, Figure 5: Tesseract Choose Users

Wybierz, aby zainstalować Tesseract OCR dla obecnego użytkownika (ciebie) lub dla wszystkich kont użytkowników

Kliknij Dalej, aby wybrać komponenty do zainstalowania z Tesseract.

Wybierz komponenty

Z listy komponentów do zainstalowania domyślnie są wybrane ScrollView, Narzędzia szkoleniowe, Utworzenie skrótów i Dane językowe. Zachowamy wszystkie domyślnie wybrane opcje. Możesz wybrać dowolną lub pominąć dowolny komponent w zależności od potrzeb. Zazwyczaj wszystkie są potrzebne do zainstalowania.

Install Tesseract, Figure 6: Tesseract Components

Tutaj można wybrać włączenie lub wyłączenie komponentów Tesseract OCR. Dla najlepszych wyników kontynuuj instalację z domyślnie wybranymi komponentami.

Kliknij Dalej, aby wybrać lokalizację instalacji.

Wybierz lokalizację instalacji

Następnie wybierzemy lokalizację do zainstalowania Tesseract. Upewnij się, że skopiujesz ścieżkę folderu docelowego. Będziemy tego potrzebować później, aby dodać lokalizację instalacji do ścieżki zmiennej środowiskowej maszyny.

Install Tesseract, Figure 7: Tesseract Install Location

Wybierz lokalizację instalacji dla biblioteki Tesseract OCR i zapamiętaj tę lokalizację na później.

Kliknij Dalej, aby dalej skonfigurować instalację Tesseract.

Wybierz folder menu Start

To ostatni krok, w którym utworzymy skróty w menu Start. Możesz nazwać folder dowolnie, ale ja zostawiłem go jako domyślny.

Install Tesseract, Figure 8: Tesseract Start Menu

Wybierz nazwę folderu menu Start Tesseract OCR

Teraz kliknij Zainstaluj i poczekaj, aż instalacja się zakończy. Po zakończeniu instalacji pojawi się następujący ekran. Kliknij Zakończ, a zakończymy pomyślnie instalację Tesseract OCR na Windows.

Install Tesseract, Figure 9: Instalator Tesseract

Instalacja Tesseract OCR jest teraz zakończona.

3. Dodaj ścieżkę instalacji do zmiennych środowiskowych systemu

Teraz dodamy ścieżkę instalacji Tesseract do zmiennych środowiskowych systemu Windows.

W menu Start wpisz "zmienne środowiskowe" lub "ustawienia zaawansowane systemu"

Install Tesseract, Figure 10: System Path Variables

Okno dialogowe właściwości systemu Windows

Właściwości systemu

Gdy okno dialogowe Właściwości systemu się otworzy, kliknij kartę Zaawansowane, a następnie kliknij przycisk Zmienne środowiskowe, znajdujący się w dolnym prawym rogu ekranu.

Otrzymasz okno dialogowe Zmienne środowiskowe.

Zmienne środowiskowe

W sekcji Zmienne systemowe kliknij zmienną Path.

Install Tesseract, Figure 11: Environment Variables

Uzyskaj dostęp do zmiennych środowiskowych systemu Windows

Teraz kliknij Edytuj.

Dodaj katalog instalacji Tesseract OCR dla Windows do zmiennych środowiskowych

Z okna dialogowego Edytuj zmienną środowiskową kliknij Nowy. Wklej skopiowaną wcześniej ścieżkę lokalizacji instalacji i kliknij OK.

Install Tesseract, Figure 12: Edit Environment Variable

Edytuj ścieżkę systemową zmiennej środowiskowej Windows, dodając wpis zawierający pełną ścieżkę do instalacji Tesseract OCR

To wszystko! Pomyślnie pobraliśmy, zainstalowaliśmy i ustawiliśmy zmienną środowiskową dla Tesseract OCR na maszynie z Windows.

4. Uruchom Tesseract OCR

Aby sprawdzić, czy Tesseract OCR dla Windows został pomyślnie zainstalowany i dodany do zmiennych środowiskowych, otwórz Wiersz polecenia (cmd) na swoim komputerze z Windows, a następnie wprowadź polecenie "Tesseract". Jeśli wszystko działa poprawnie, powinien się wyświetlić krótki przewodnik użytkowania z opcjami OCR i innymi, takimi jak wersja Tesseract.

Install Tesseract, Figure 13: Edit Environment Variable

Uruchom polecenie tesseract w Wierszu polecenia Windows (lub Windows Powershell), aby upewnić się, że powyższe kroki instalacji zostały wykonane poprawnie. Wyjście konsoli powinno być oczekiwanym wynikiem udanej instalacji na Windows.

Gratulacje! Pomyślnie zainstalowaliśmy Tesseract OCR dla Windows.

Biblioteka IronOCR

IronOCR to biblioteka C# oparta na Tesseract, która pozwala programistom .NET na identyfikację i wydobywanie tekstu z obrazów oraz dokumentów PDF. Jest zbudowana w całości w .NET, używając najnowszego silnika Tesseract znanego wszędzie.

Zainstaluj za pomocą menedżera pakietów NuGet

Instalacja IronOCR w Visual Studio lub za pomocą wiersza poleceń z Menedżerem pakietów NuGet jest łatwa. W Visual Studio przejdź do opcji Menu:

Narzędzia > Menedżer pakietów NuGet > Konsola Menedżera pakietów

Następnie w wierszu poleceń wpisz następujące polecenie:

Install-Package IronOcr

To zainstaluje IronOCR z łatwością, a teraz możesz wykorzystać jego pełny potencjał.

Możesz również pobrać inne pakiety NuGet IronOCR dla różnych platform:

IronOCR with Tesseract 5

Poniższy przykład kodu pokazuje, jak łatwo jest korzystać z IronOCR Tesseract do odczytywania tekstu z obrazu i wykonywania OCR za pomocą C#.

// Import the IronOCR library
using IronOcr;

// Create an instance of IronTesseract
var Ocr = new IronTesseract();

string Text = Ocr.Read(@"test-files/redacted-employmentapp.png").Text;

// Output the extracted text to the console
Console.WriteLine(Text); // Printed text
// Import the IronOCR library
using IronOcr;

// Create an instance of IronTesseract
var Ocr = new IronTesseract();

string Text = Ocr.Read(@"test-files/redacted-employmentapp.png").Text;

// Output the extracted text to the console
Console.WriteLine(Text); // Printed text
' Import the IronOCR library
Imports IronOcr

' Create an instance of IronTesseract
Private Ocr = New IronTesseract()

Private Text As String = Ocr.Read("test-files/redacted-employmentapp.png").Text

' Output the extracted text to the console
Console.WriteLine(Text) ' Printed text
$vbLabelText   $csharpLabel

Jeśli chcesz bardziej elastycznego kodu, poniższy powinien pomóc ci osiągnąć to samo zadanie:

// Import the IronOCR library
using IronOcr;

// Create an instance of IronTesseract
var Ocr = new IronTesseract();

// Using the OcrInput class to handle multiple images
using (var Input = new OcrInput()){
    // Add an image to the input collection
    Input.AddImage("test-files/redacted-employmentapp.png");
    // You can add any number of images

    // Read the OCR text from the input
    var Result = Ocr.Read(Input);

    // Output the extracted text to the console
    Console.WriteLine(Result.Text);
}
// Import the IronOCR library
using IronOcr;

// Create an instance of IronTesseract
var Ocr = new IronTesseract();

// Using the OcrInput class to handle multiple images
using (var Input = new OcrInput()){
    // Add an image to the input collection
    Input.AddImage("test-files/redacted-employmentapp.png");
    // You can add any number of images

    // Read the OCR text from the input
    var Result = Ocr.Read(Input);

    // Output the extracted text to the console
    Console.WriteLine(Result.Text);
}
' Import the IronOCR library
Imports IronOcr

' Create an instance of IronTesseract
Private Ocr = New IronTesseract()

' Using the OcrInput class to handle multiple images
Using Input = New OcrInput()
	' Add an image to the input collection
	Input.AddImage("test-files/redacted-employmentapp.png")
	' You can add any number of images

	' Read the OCR text from the input
	Dim Result = Ocr.Read(Input)

	' Output the extracted text to the console
	Console.WriteLine(Result.Text)
End Using
$vbLabelText   $csharpLabel

Obraz wejściowy

Install Tesseract, Figure 14: Input Image

Przykładowy obraz wejściowy dla przetwarzania IronOCR

Obraz wyjściowy

Wynik jest drukowany na Konsoli jako:

Install Tesseract, Figure 15: Output Image

Konsola zwrócona z wykonania IronOCR na przykładowym obrazie.

Dlaczego wybrać IronOCR?

IronOCR jest bardzo łatwy do zainstalowania. Zapewnia kompletną i dobrze udokumentowaną bibliotekę oprogramowania .NET.

IronOCR osiąga 99,8% dokładności wykrywania tekstu bez potrzeby korzystania z innych bibliotek lub usług internetowych.

Zapewnia również wsparcie dla wielowątkowości. Co najważniejsze, IronOCR może pracować z przeszło 125 językami międzynarodowymi.

Wnioski

W tym samouczku dowiedzieliśmy się, jak pobrać i zainstalować Tesseract OCR na maszynie z Windows. Tesseract OCR to doskonałe oprogramowanie dla programistów C++, ale ma pewne ograniczenia. Nie jest w pełni rozwijany dla .NET. Skanowane pliki obrazów lub fotografie muszą być przetworzone i ustandaryzowane do wysokiej rozdzielczości, wolne od cyfrowego szumu. Dopiero wtedy Tesseract może na nich dokładnie pracować.

W przeciwieństwie do tego, IronOCR może pracować z dowolnym dostarczonym obrazem, niezależnie czy jest to skanowany obraz, czy zdjęcie, używając tylko jednej linii kodu. IronOCR również używa Tesseract jako wewnętrznego silnika OCR, ale jest precyzyjnie dostrojony, aby wydobyć z niego to, co najlepsze, specjalnie zbudowany dla C#, z wysoką wydajnością i ulepszonymi funkcjami.

Możesz pobrać produkt oprogramowania IronOCR z tego linka.

Kannaopat Udonpant
Inżynier oprogramowania
Zanim stał się inżynierem oprogramowania, Kannapat ukończył doktorat z zasobów środowiskowych na Uniwersytecie Hokkaido w Japonii. W czasie studiowania, Kannapat również został członkiem Laboratorium Robotyki Pojazdów, które jest częścią Wydziału Inżynierii Bioprodukcji. W 2022 roku wykorzystał swoje umiejętności w ...
Czytaj więcej

Zespół wsparcia Iron

Jesteśmy online 24 godziny, 5 dni w tygodniu.
Czat
E-mail
Zadzwoń do mnie