Duże pliki TIFF powyżej 2 GB nie ładują się
IronOCR ładuje dane wejściowe obrazu do jednego bufora w pamięci za pomocą swojego wewnętrznego typu AnyBitmap. Ten bufor jest indeksowany przez 32-bitową liczbę całkowitą, więc ogranicza się do około 2 GB niezależnie od ilości dostępnej pamięci systemowej. TIFF większy niż 2 GB przekracza ten limit i nie ładuje się.
Loaded pages: 0
OcrInput.LoadImage(filePath) tworzy wewnętrznie AnyBitmap i materializuje cały obraz w jednym buforze. Ponieważ ten bufor jest indeksowany przez int, jest skutecznie ograniczony do około 2 GB niezależnie od dostępnej pamięci, dlatego TIFF nieco powyżej limitu nie może być przechowywany i ładowanie nie powodzi się. To ograniczenie runtime, nie specyficzne dla systemu operacyjnego, więc wpływa na każdą platformę .NET równomiernie.
LoadImage(filePath) obecnie zwraca zero załadowanych stron zamiast wyrzucania czytelnego wyjątku. To ciche niepowodzenie jest znanym problemem; planowany jest czytelniejszy wyjątek. Projekt jednobuforowy to ograniczenie architektoniczne, a natywne strumieniowanie TIFF na stronę nie jest jeszcze dostępne.Rozwiązanie
Rozwiązaniem jest podzielenie TIFF na fragmenty mniejsze niż 2 GB i przekazanie każdego fragmentu do IronOCR jako tablicy bajtów zamiast ścieżki do pliku.
1. Dodaj Magick.NET
Użyj Magick.NET do podzielenia TIFF przed przekazaniem do IronOCR. Wybierz wariant pasujący do twojego projektu (Q8/Q16, AnyCPU/x64).
dotnet add package Magick.NET-Q16-AnyCPU
dotnet add package Magick.NET-Q16-AnyCPU
2. Podziel TIFF i załaduj każdy fragment
Otwórz TIFF jako MagickImageCollection, podziel go na fragmenty o ilości stron, które każdy pozostanie poniżej 2 GB, konwertuj każdy fragment na tablicę bajtów i załaduj go za pomocą OcrInput.LoadImage(byte[]).
var inputPath = "input.tiff";
var pagesPerChunk = 100;
using var allPages = new MagickImageCollection(inputPath);
int chunkNumber = 1;
for (int i = 0; i < allPages.Count; i += pagesPerChunk)
{
using var chunk = new MagickImageCollection();
for (int j = i; j < Math.Min(i + pagesPerChunk, allPages.Count); j++)
{
chunk.Add(allPages[j].Clone());
}
foreach (var image in chunk)
{
image.SetCompression(CompressionMethod.LZW);
}
var chunkBytes = chunk.ToByteArray();
using (var ocrInput = new OcrInput())
{
ocrInput.LoadImage(chunkBytes);
var pages = ocrInput.GetPages().ToList();
Console.WriteLine($"Loaded pages: {pages.Count}");
var result = new IronTesseract().Read(ocrInput);
Console.WriteLine("OCR Text Length: " + (result.Text?.Length ?? 0));
}
Console.WriteLine($"Chunk {chunkNumber} processed");
chunkNumber++;
}
var inputPath = "input.tiff";
var pagesPerChunk = 100;
using var allPages = new MagickImageCollection(inputPath);
int chunkNumber = 1;
for (int i = 0; i < allPages.Count; i += pagesPerChunk)
{
using var chunk = new MagickImageCollection();
for (int j = i; j < Math.Min(i + pagesPerChunk, allPages.Count); j++)
{
chunk.Add(allPages[j].Clone());
}
foreach (var image in chunk)
{
image.SetCompression(CompressionMethod.LZW);
}
var chunkBytes = chunk.ToByteArray();
using (var ocrInput = new OcrInput())
{
ocrInput.LoadImage(chunkBytes);
var pages = ocrInput.GetPages().ToList();
Console.WriteLine($"Loaded pages: {pages.Count}");
var result = new IronTesseract().Read(ocrInput);
Console.WriteLine("OCR Text Length: " + (result.Text?.Length ?? 0));
}
Console.WriteLine($"Chunk {chunkNumber} processed");
chunkNumber++;
}
Imports System
Imports System.Linq
Imports ImageMagick
Dim inputPath As String = "input.tiff"
Dim pagesPerChunk As Integer = 100
Using allPages As New MagickImageCollection(inputPath)
Dim chunkNumber As Integer = 1
For i As Integer = 0 To allPages.Count - 1 Step pagesPerChunk
Using chunk As New MagickImageCollection()
For j As Integer = i To Math.Min(i + pagesPerChunk, allPages.Count) - 1
chunk.Add(allPages(j).Clone())
Next
For Each image In chunk
image.SetCompression(CompressionMethod.LZW)
Next
Dim chunkBytes = chunk.ToByteArray()
Using ocrInput As New OcrInput()
ocrInput.LoadImage(chunkBytes)
Dim pages = ocrInput.GetPages().ToList()
Console.WriteLine($"Loaded pages: {pages.Count}")
Dim result = New IronTesseract().Read(ocrInput)
Console.WriteLine("OCR Text Length: " & If(result.Text?.Length, 0))
End Using
End Using
Console.WriteLine($"Chunk {chunkNumber} processed")
chunkNumber += 1
Next
End Using
Każdy fragment przechodzi przez LoadImage(chunkBytes) jako surowe bajty, co utrzymuje każdy bufor poniżej granicy 2 GB. SetCompression(CompressionMethod.LZW) zmniejsza każdy fragment przed konwersją do tablicy bajtów.
3. Dostosuj rozmiar fragmentu
Dostosuj pagesPerChunk dla twoich danych. Obniż go, jeśli fragment zbliża się do 2 GB lub jeśli pamięć jest ograniczona; zwiększ go dla mniejszych stron, aby zmniejszyć narzuty.
4. Uwzględnij Magick.NET w wdrożeniu
Magick.NET dostarcza natywne pliki binarne ImageMagick. Weź pod uwagę zwiększony rozmiar pakietu i ślad natywnej zależności podczas wdrażania.

