Text extrahieren

Beim Extrahieren eines großen Textvolumens aus Dokumenten kann der Prozess ineffizient und zeitaufwendig sein, insbesondere bei der Bearbeitung von Tabellen und großen Mengen von Absätzen. Allerdings bietet die ExtractText-Methode von IronWord eine zeitsparende Lösung. Sie ermöglicht Entwicklern, alle Texte eines bestimmten Umfangs innerhalb des Dokuments einfach zu extrahieren, wodurch zusätzliche Schleifen entfallen und der Zugriff auf die Text-Eigenschaft vereinfacht wird. Diese Methode stellt sicher, dass Entwickler effizient arbeiten und wertvolle Zeit sparen können.

In diesem Beispiel zeigen wir Ihnen mehrere Möglichkeiten, die ExtractText-Methode zu verwenden und Ihre Effizienz beim Abrufen von Texten aus Dokumenten zu steigern.

Nützliche Wege, um Text aus einer Docx zu extrahieren

  • using IronWord;
  • WordDocument doc = new WordDocument("multi-paragraph.docx");
  • Console.WriteLine(doc.ExtractText());
  • Console.WriteLine(doc.Paragraphs[0].ExtractText());
  • Console.WriteLine(doc.Paragraphs.Last().ExtractText());

Text extrahieren

Mit der IronWord-Bibliothek ist das Extrahieren von Text aus einem Word-Dokument ein unkomplizierter Prozess. Wir beginnen mit dem Import der Bibliothek und der Initialisierung der WordDocument-Klasse. Dieser Schritt ermöglicht es uns, ein vorhandenes Dokument mit Absätzen zu laden. Anschließend rufen wir die ExtractText-Methode auf und drucken den gesamten Text des Dokuments auf die Konsole.

Spezifischen Text extrahieren

Das obige Beispiel extrahiert den gesamten Text des Dokuments, aber mit der IronWord-Bibliothek haben Sie die volle Kontrolle über den Extraktionsprozess. Wenn Sie nur bestimmte Teile oder Absätze wünschen, können Sie die Paragraphs-Eigenschaft im WordDocument verwenden, um ein Array von Paragraphs zurückzugeben. Als generische Liste kann dieses Array nach Ihren Anforderungen manipuliert werden, entweder indem der Index wie oben gezeigt mit doc.Paragraphs[0] aufgerufen wird oder indem die eingebauten Array-Methoden für C#-Sammlungen verwendet werden.

Beim Zugriff auf den Index der Paragraphs geben wir nur den Text des ersten Absatzes des Dokuments zurück und extrahieren ihn, um ihn auf die Konsole auszugeben. Anschließend rufen wir es auch Last auf dem Paragraphs-Array auf, um nur den Text des letzten Absatzes aus dem Dokument zurückzugeben und zu extrahieren.

Erkunden Sie die IronWord-API für die erweiterte Textextraktion

Bereit anzufangen?
Nuget Downloads 49,323 | Version: 2026.7 gerade veröffentlicht
Still Scrolling Icon

Scrollst du immer noch?

Sie brauchen schnell einen Beweis? PM > Install-Package IronWord
Führen Sie ein Beispiel aus und sehen Sie zu, wie aus Ihren Daten ein Word-Dokument wird.