Zainstaluj Tesseract (samouczek krok po kroku z obrazkami)
Czym jest Tesseract OCR?
Tesseract to biblioteka oprogramowania open-source, wydana na podstawie umowy licencyjnej Apache. Początkowo został opracowany przez Hewlett Packard w latach 80. Jest narzędziem do rozpoznawania tekstu używanym głównie do identyfikacji i wydobywania tekstów z obrazów. Tesseract OCR udostępnia interfejs w wierszu poleceń do wykonywania tej funkcji.
Dowiedz się więcej o funkcjach IronOCR lub zarejestruj się na wersję próbną już dziś!
Jak pobrać Tesseract OCR na Windows
- Pobierz Instalator Tesseract dla Windows
- Zainstaluj Tesseract OCR
- Dodaj ścieżkę instalacji do zmiennych środowiskowych
- Uruchom Tesseract OCR
1. Pobierz Instalator Tesseract dla Windows
Aby używać polecenia Tesseract na Windows, najpierw musimy pobrać pliki binarne Tesseract OCR .exe Instalator Windows.
Istnieje wiele miejsc, w których można pobrać najnowszą wersję Tesseract OCR. One such place is from UB Mannheim, which is forked from Tesseract-ocr/tesseract (Main Repository).
Wiki Tesseract
Download the Tesseract-ocr-w64-setup-5.3.0.20221222.exe (64 bit) Windows Installer.
Dla użytkowników macOS Tesseract można zainstalować w terminalu za pomocą jednego z poniższych poleceń:
brew install tesseract
brew install tesseract
sudo port install tesseract
sudo port install tesseract
2. Zainstaluj Tesseract OCR
Następnie zainstalujemy Tesseract za pomocą pliku .exe, który pobraliśmy w poprzednim kroku. Uruchom instalator .exe, aby rozpocząć instalację Tesseract.
Język instalatora
Po zakończeniu rozpakowywania setupu, pojawi się okno dialogowe języka danych instalatora. Można zainstalować Tesseract, używając wielu języków, wybierając dodatkowe pakiety językowe, ale tutaj zainstalujemy tylko dane językowe dla języka angielskiego.
Instalator Tesseract
Kliknij OK, a język instalatora dla Tesseract OCR zostaje ustawiony.
Konfiguracja Tesseract OCR
Następnie pojawi się kreator konfiguracji. Ten kreator instalacji poprowadzi cię przez instalację Tesseract na Windows.
Kreator konfiguracji Tesseract OCR
Kliknij Dalej, aby kontynuować instalację.
Zaakceptuj umowę licencyjną
Tesseract OCR jest licencjonowany na podstawie Apache License Wersja 2.0. Jako oprogramowanie open-source i darmowe do użytku, możesz redystrybuować i modyfikować wersje Tesseract bez obaw o opłaty licencyjne.
Tesseract OCR jest licencjonowany na podstawie Apache License v2.0. Proszę zaakceptować tę licencję, aby kontynuować instalację.
Kliknij Zgadzam się, aby przejść do instalacji.
Wybierz użytkowników
Możesz wybrać zainstalować Tesseract dla wielu użytkowników lub dla pojedynczego użytkownika.
Wybierz, aby zainstalować Tesseract OCR dla obecnego użytkownika (ciebie) lub dla wszystkich kont użytkowników
Kliknij Dalej, aby wybrać komponenty do zainstalowania z Tesseract.
Wybierz komponenty
Z listy komponentów do zainstalowania domyślnie są wybrane ScrollView, Narzędzia szkoleniowe, Utworzenie skrótów i Dane językowe. Zachowamy wszystkie domyślnie wybrane opcje. Możesz wybrać dowolną lub pominąć dowolny komponent w zależności od potrzeb. Zazwyczaj wszystkie są potrzebne do zainstalowania.
Tutaj można wybrać włączenie lub wyłączenie komponentów Tesseract OCR. Dla najlepszych wyników kontynuuj instalację z domyślnie wybranymi komponentami.
Kliknij Dalej, aby wybrać lokalizację instalacji.
Wybierz lokalizację instalacji
Następnie wybierzemy lokalizację do zainstalowania Tesseract. Upewnij się, że skopiujesz ścieżkę folderu docelowego. Będziemy tego potrzebować później, aby dodać lokalizację instalacji do ścieżki zmiennej środowiskowej maszyny.
Wybierz lokalizację instalacji dla biblioteki Tesseract OCR i zapamiętaj tę lokalizację na później.
Kliknij Dalej, aby dalej skonfigurować instalację Tesseract.
Wybierz folder menu Start
To ostatni krok, w którym utworzymy skróty w menu Start. Możesz nazwać folder dowolnie, ale ja zostawiłem go jako domyślny.
Wybierz nazwę folderu menu Start Tesseract OCR
Teraz kliknij Zainstaluj i poczekaj, aż instalacja się zakończy. Po zakończeniu instalacji pojawi się następujący ekran. Kliknij Zakończ, a zakończymy pomyślnie instalację Tesseract OCR na Windows.
Instalacja Tesseract OCR jest teraz zakończona.
3. Dodaj ścieżkę instalacji do zmiennych środowiskowych systemu
Teraz dodamy ścieżkę instalacji Tesseract do zmiennych środowiskowych systemu Windows.
W menu Start wpisz "zmienne środowiskowe" lub "ustawienia zaawansowane systemu"
Okno dialogowe właściwości systemu Windows
Właściwości systemu
Gdy okno dialogowe Właściwości systemu się otworzy, kliknij kartę Zaawansowane, a następnie kliknij przycisk Zmienne środowiskowe, znajdujący się w dolnym prawym rogu ekranu.
Otrzymasz okno dialogowe Zmienne środowiskowe.
Zmienne środowiskowe
W sekcji Zmienne systemowe kliknij zmienną Path.
Uzyskaj dostęp do zmiennych środowiskowych systemu Windows
Teraz kliknij Edytuj.
Dodaj katalog instalacji Tesseract OCR dla Windows do zmiennych środowiskowych
Z okna dialogowego Edytuj zmienną środowiskową kliknij Nowy. Wklej skopiowaną wcześniej ścieżkę lokalizacji instalacji i kliknij OK.
Edytuj ścieżkę systemową zmiennej środowiskowej Windows, dodając wpis zawierający pełną ścieżkę do instalacji Tesseract OCR
To wszystko! Pomyślnie pobraliśmy, zainstalowaliśmy i ustawiliśmy zmienną środowiskową dla Tesseract OCR na maszynie z Windows.
4. Uruchom Tesseract OCR
Aby sprawdzić, czy Tesseract OCR dla Windows został pomyślnie zainstalowany i dodany do zmiennych środowiskowych, otwórz Wiersz polecenia (cmd) na swoim komputerze z Windows, a następnie wprowadź polecenie "Tesseract". Jeśli wszystko działa poprawnie, powinien się wyświetlić krótki przewodnik użytkowania z opcjami OCR i innymi, takimi jak wersja Tesseract.
Uruchom polecenie tesseract w Wierszu polecenia Windows (lub Windows Powershell), aby upewnić się, że powyższe kroki instalacji zostały wykonane poprawnie. Wyjście konsoli powinno być oczekiwanym wynikiem udanej instalacji na Windows.
Gratulacje! Pomyślnie zainstalowaliśmy Tesseract OCR dla Windows.
Biblioteka IronOCR
IronOCR to biblioteka C# oparta na Tesseract, która pozwala programistom .NET na identyfikację i wydobywanie tekstu z obrazów oraz dokumentów PDF. Jest zbudowana w całości w .NET, używając najnowszego silnika Tesseract znanego wszędzie.
Zainstaluj za pomocą menedżera pakietów NuGet
Instalacja IronOCR w Visual Studio lub za pomocą wiersza poleceń z Menedżerem pakietów NuGet jest łatwa. W Visual Studio przejdź do opcji Menu:
Narzędzia > Menedżer pakietów NuGet > Konsola Menedżera pakietów
Następnie w wierszu poleceń wpisz następujące polecenie:
Install-Package IronOcr
To zainstaluje IronOCR z łatwością, a teraz możesz wykorzystać jego pełny potencjał.
Możesz również pobrać inne pakiety NuGet IronOCR dla różnych platform:
IronOCR with Tesseract 5
Poniższy przykład kodu pokazuje, jak łatwo jest korzystać z IronOCR Tesseract do odczytywania tekstu z obrazu i wykonywania OCR za pomocą C#.
// Import the IronOCR library
using IronOcr;
// Create an instance of IronTesseract
var Ocr = new IronTesseract();
string Text = Ocr.Read(@"test-files/redacted-employmentapp.png").Text;
// Output the extracted text to the console
Console.WriteLine(Text); // Printed text
// Import the IronOCR library
using IronOcr;
// Create an instance of IronTesseract
var Ocr = new IronTesseract();
string Text = Ocr.Read(@"test-files/redacted-employmentapp.png").Text;
// Output the extracted text to the console
Console.WriteLine(Text); // Printed text
' Import the IronOCR library
Imports IronOcr
' Create an instance of IronTesseract
Private Ocr = New IronTesseract()
Private Text As String = Ocr.Read("test-files/redacted-employmentapp.png").Text
' Output the extracted text to the console
Console.WriteLine(Text) ' Printed text
Jeśli chcesz bardziej elastycznego kodu, poniższy powinien pomóc ci osiągnąć to samo zadanie:
// Import the IronOCR library
using IronOcr;
// Create an instance of IronTesseract
var Ocr = new IronTesseract();
// Using the OcrInput class to handle multiple images
using (var Input = new OcrInput()){
// Add an image to the input collection
Input.AddImage("test-files/redacted-employmentapp.png");
// You can add any number of images
// Read the OCR text from the input
var Result = Ocr.Read(Input);
// Output the extracted text to the console
Console.WriteLine(Result.Text);
}
// Import the IronOCR library
using IronOcr;
// Create an instance of IronTesseract
var Ocr = new IronTesseract();
// Using the OcrInput class to handle multiple images
using (var Input = new OcrInput()){
// Add an image to the input collection
Input.AddImage("test-files/redacted-employmentapp.png");
// You can add any number of images
// Read the OCR text from the input
var Result = Ocr.Read(Input);
// Output the extracted text to the console
Console.WriteLine(Result.Text);
}
' Import the IronOCR library
Imports IronOcr
' Create an instance of IronTesseract
Private Ocr = New IronTesseract()
' Using the OcrInput class to handle multiple images
Using Input = New OcrInput()
' Add an image to the input collection
Input.AddImage("test-files/redacted-employmentapp.png")
' You can add any number of images
' Read the OCR text from the input
Dim Result = Ocr.Read(Input)
' Output the extracted text to the console
Console.WriteLine(Result.Text)
End Using
Obraz wejściowy
Przykładowy obraz wejściowy dla przetwarzania IronOCR
Obraz wyjściowy
Wynik jest drukowany na Konsoli jako:
Konsola zwrócona z wykonania IronOCR na przykładowym obrazie.
Dlaczego wybrać IronOCR?
IronOCR jest bardzo łatwy do zainstalowania. Zapewnia kompletną i dobrze udokumentowaną bibliotekę oprogramowania .NET.
IronOCR osiąga 99,8% dokładności wykrywania tekstu bez potrzeby korzystania z innych bibliotek lub usług internetowych.
Zapewnia również wsparcie dla wielowątkowości. Co najważniejsze, IronOCR może pracować z przeszło 125 językami międzynarodowymi.
Wnioski
W tym samouczku dowiedzieliśmy się, jak pobrać i zainstalować Tesseract OCR na maszynie z Windows. Tesseract OCR to doskonałe oprogramowanie dla programistów C++, ale ma pewne ograniczenia. Nie jest w pełni rozwijany dla .NET. Skanowane pliki obrazów lub fotografie muszą być przetworzone i ustandaryzowane do wysokiej rozdzielczości, wolne od cyfrowego szumu. Dopiero wtedy Tesseract może na nich dokładnie pracować.
W przeciwieństwie do tego, IronOCR może pracować z dowolnym dostarczonym obrazem, niezależnie czy jest to skanowany obraz, czy zdjęcie, używając tylko jednej linii kodu. IronOCR również używa Tesseract jako wewnętrznego silnika OCR, ale jest precyzyjnie dostrojony, aby wydobyć z niego to, co najlepsze, specjalnie zbudowany dla C#, z wysoką wydajnością i ulepszonymi funkcjami.
Możesz pobrać produkt oprogramowania IronOCR z tego linka.




