IRONSOFTWAREHOME

Mit IronWord Text aus DOCX extrahieren

Ahmad Sohail
Ahmad Sohail
Updated: 4. Juni 2026

Die ExtractText() Methode von IronWord ermöglicht es Ihnen, Text aus DOCX-Dateien zu extrahieren, indem Sie auf gesamte Dokumente, spezifische Absätze oder Tabellenzellen zugreifen, und bietet eine einfache API für Dokumentenverarbeitung und Datenanalyseaufgaben in C#.

Schnellstart: Text aus DOCX extrahieren
  1. 1Install IronWord with NuGet Package Manager

    PM > Install-Package IronWord

  2. 2Kopieren Sie diesen Codeausschnitt und führen Sie ihn aus.

    using IronWord;
    
    // Quick example: Extract all text from DOCX
    WordDocument doc = new WordDocument("sample.docx");
    string allText = doc.ExtractText();
    Console.WriteLine(allText);
    C#
  3. 3Bereitstellen zum Testen in Ihrer Live-Umgebung

    Beginnen Sie noch heute, IronWord in Ihrem Projekt zu verwenden, mit einer kostenlosen Testversion
    arrow pointer

Wie kann ich den gesamten Text aus einem DOCX-Dokument extrahieren?

Die ExtractText() Methode ruft den Textinhalt eines gesamten Word-Dokuments ab. In diesem Beispiel erstellen wir ein neues Dokument, fügen Text hinzu, extrahieren den Text mithilfe von ExtractText() und zeigen ihn in der Konsole an. Dies veranschaulicht den primären Arbeitsablauf zur Textextraktion.

Der extrahierte Text muss die logische Lesereihenfolge des Dokuments beibehalten. Die Methode verarbeitet Kopfzeilen, Absätze, Listen und andere Textelemente nacheinander, was sie ideal für die Inhaltsanalyse und Suchindexierung macht.

using System;
using IronWord;

// Instantiate a new DOCX file
WordDocument doc = new WordDocument();

// Add text
doc.AddText("Hello, World!");

// Print extracted text from the document to the console
Console.WriteLine(doc.ExtractText());

Wie sieht der extrahierte Text aus?

Microsoft Word-Dokument, das den Text "Hello, World!" mit sichtbarem Formatierungsband anzeigt

Welche Ausgabe sollte ich in der Konsole erwarten?

Codebeispiel, das zeigt, wie Console.WriteLine den extrahierten Text ausgibt, wobei die Debug-Konsole die Ausgabe "Hello, World!" anzeigt

Wie kann ich Text aus bestimmten Absätzen extrahieren?

Für eine bessere Kontrolle können Sie Text aus bestimmten Absätzen anstatt aus dem gesamten Dokument extrahieren. Durch den Zugriff auf die Paragraphs Sammlung können Sie gezielt jeden benötigten Absatz verarbeiten. Dieser granulare Ansatz ist nützlich, wenn es sich um Dokumente mit strukturiertem Inhalt handelt oder wenn Sie bestimmte Abschnitte unabhängig voneinander bearbeiten müssen.

In diesem Beispiel extrahieren wir Text aus dem ersten und letzten Absatz, kombinieren sie und speichern das Ergebnis in einer .txt Datei. Diese Technik wird häufig in Dokumentenzusammenfassungstools verwendet, bei denen Sie die Einleitung und den Schluss eines Dokuments extrahieren möchten. Ähnlich wie Sie Lizenzschlüssel verwenden könnten, um Funktionen freizuschalten, gibt Ihnen die Paragraphs Sammlung Zugriff auf spezifische Dokumentenelemente.

using System.IO;
using System.Linq;
using IronWord;

// Load an existing DOCX file
WordDocument doc = new WordDocument("document.docx");

// Extract text and assign variables
string firstParagraph = doc.Paragraphs[0].ExtractText();
string lastParagraph = doc.Paragraphs.Last().ExtractText();

// Combine the texts
string newText = firstParagraph + " " + lastParagraph;

// Export the combined text as a new .txt file
File.WriteAllText("output.txt", newText);

Die Fähigkeit, bestimmte Absätze zu extrahieren, wird in Verbindung mit den Anforderungen an die Dokumentenanalyse zu einem wichtigen Faktor. Sie könnten zum Beispiel wichtige Absätze anhand ihrer Formatierung, Position oder inhaltlichen Muster extrahieren. Dieser selektive Extraktionsansatz trägt dazu bei, die Bearbeitungszeit zu verkürzen und sich auf die relevantesten Inhalte zu konzentrieren.

Welcher Inhalt wird aus dem ersten Absatz extrahiert?

Word-Dokument mit rot formatiertem Absatz über schwarzem Textabsatz zur Demonstration der Extraktion

Welcher Inhalt wird aus dem letzten Absatz extrahiert?

Microsoft Word-Dokument mit formatierten Absätzen und Lorem ipsum-Text in lila und blauer Farbe

Wie wird der kombinierte Text in der Ausgabedatei angezeigt?

Texteditor mit Absatzextraktionspunkten, die mit roten und blauen Pfeilen markiert sind, die die Absatzgrenzen anzeigen

Die Screenshots oben zeigen die Extraktion des ersten Absatzes, die Extraktion des letzten Absatzes und die kombinierte Ausgabe, die in einer Textdatei gespeichert wird. Beachten Sie, dass bei der Extraktion der Textinhalt erhalten bleibt, während die Formatierungsinformationen entfernt werden, so dass der Text für die reine Textverarbeitung geeignet ist.

Wie extrahiere ich Daten aus Tabellen in DOCX?

Tabellen enthalten oft strukturierte Daten, die zur Weiterverarbeitung oder Analyse extrahiert werden müssen. Mit IronWord können Sie auf Tabellendaten zugreifen, indem Sie durch Zeilen und Zellen navigieren. In diesem Beispiel laden wir ein Dokument, das eine API-Statistiktabelle enthält, und extrahieren einen bestimmten Zellenwert aus der 4. Spalte der 2. Zeile.

Die Extraktion von Tabellen ist für Datenmigrationsprojekte, die Erstellung von Berichten und automatisierte Datenerfassungsworkflows unerlässlich. Beim Arbeiten mit tabellarischen Daten ist das Verständnis des nullbasierten Indexierungssystems entscheidend - die erste Tabelle ist Tables[0], die erste Zeile ist Rows[0], und so weiter. Dieser systematische Ansatz, ähnlich den Lizenzierungsstrukturen, bietet vorhersehbare Zugriffsmuster.

using System;
using IronWord;
using IronWord.Models;

// Load the API statistics document
WordDocument apiStatsDoc = new WordDocument("api-statistics.docx");

// Extract text from the 1st table, 4th column and 3rd row
string extractedValue = ((TableCell)apiStatsDoc.Tables[0].Rows[2].Cells[3]).ExtractText();

// Print extracted value
Console.WriteLine($"Target success rate: {extractedValue}");
C#

Der Code demonstriert den Zugriff auf Tabellenzellen mithilfe der Sammlungseigenschaften Tables, Rows und Cells. Beachten Sie, dass die Cells Sammlung ITableCell Schnittstellenobjekte zurückgibt, die auf TableCell gecastet werden müssen, um die ExtractText Methode aufzurufen: ((TableCell)cell).ExtractText(). Dies erfordert das Hinzufügen von using IronWord.Models; zu Ihren Namensraumdeklarationen.

Wie sieht die Quelltabelle aus?

Tabelle mit API-Nutzungsstatistiken in Word, die 6 Endpunkte mit Anfragen, Latenz, Erfolgsraten und Bandbreitenmetriken zeigt

Welcher Wert wird aus der Tabellenzelle entnommen?

Die Konsolenausgabe zeigt den extrahierten Tabellenwert 'Target success rate: 99.8 %' in der Visual Studio-Debug-Konsole

Fortgeschrittene Text-Extraktions-Szenarien

Wenn Sie mit komplexen Dokumenten arbeiten, müssen Sie möglicherweise mehrere Extraktionstechniken kombinieren. Hier ist ein Beispiel, das zeigt, wie man Text aus mehreren Elementen extrahiert und sie unterschiedlich verarbeitet:

using IronWord;
using IronWord.Models;
using System.Text;
using System.Linq;

// Load a complex document
WordDocument complexDoc = new WordDocument("report.docx");

// Create a StringBuilder for efficient string concatenation
StringBuilder extractedContent = new StringBuilder();

// Extract and process headers (assuming they're in the first few paragraphs)
var headers = complexDoc.Paragraphs
    .Take(3)
    .Select(p => p.ExtractText())
    .Where(text => !string.IsNullOrWhiteSpace(text));

foreach (var header in headers)
{
    extractedContent.AppendLine($"HEADER: {header}");
}

// Extract table summaries
foreach (var table in complexDoc.Tables)
{
    // Get first cell as table header/identifier
    string tableIdentifier = ((TableCell)table.Rows[0].Cells[0]).ExtractText();
    extractedContent.AppendLine($"\nTABLE: {tableIdentifier}");
    
    // Extract key metrics (last row often contains totals)
    if (table.Rows.Count > 1)
    {
        var lastRow = table.Rows.Last();
        var totals = lastRow.Cells.Select(cell => ((TableCell)cell).ExtractText());
        extractedContent.AppendLine($"Totals: {string.Join(", ", totals)}");
    }
}

// Save the structured extraction
System.IO.File.WriteAllText("structured-extract.txt", extractedContent.ToString());
C#

Dieses fortgeschrittene Beispiel zeigt, wie strukturierte Extraktionen durch die Kombination verschiedener Dokumentelemente erstellt werden können. Dieser Ansatz ist nützlich für die Erstellung von Dokumentzusammenfassungen, die Erstellung von Indizes oder die Vorbereitung von Daten für die weitere Verarbeitung. Genauso wie Upgrades die Fähigkeiten von Software verbessern, verbessert die Kombination von Extraktionsmethoden Ihre Fähigkeiten zur Dokumentenverarbeitung.

Best Practices für die Textextraktion

Beachten Sie bei der Implementierung der Textextraktion in Produktionsanwendungen die folgenden Best Practices:

  1. Fehlerbehandlung: Verpacken Sie Extraktionscode immer in try-catch-Blöcke, um Dokumente zu behandeln, die beschädigt sein könnten oder unerwartete Strukturen aufweisen.

  2. Leistungsoptimierung: Bei großen Dokumenten oder bei der Stapelverarbeitung sollten Sie in Erwägung ziehen, nur die notwendigen Teile zu extrahieren und nicht den gesamten Dokumentinhalt.

  3. Zeichenkodierung: Achten Sie beim Speichern des extrahierten Textes auf die Zeichenkodierung, insbesondere bei Dokumenten, die Sonderzeichen oder mehrere Sprachen enthalten.

  4. Speicherverwaltung: Wenn Sie mit mehreren Dokumenten arbeiten, entsorgen Sie WordDocument Objekte ordnungsgemäß, um Speicherlecks zu verhindern.

Denken Sie daran, dass bei der Textextraktion die logische Lesereihenfolge erhalten bleibt, aber die Formatierung entfernt wird. Wenn Sie Formatierungsinformationen beibehalten müssen, ziehen Sie die Verwendung zusätzlicher IronWord Funktionen in Betracht oder speichern Sie Metadaten separat. Für den produktiven Einsatz sollten Sie das Changelog lesen, um über die neuesten Funktionen und Verbesserungen informiert zu sein.

Zusammenfassung

Die ExtractText() Methode von IronWord bietet eine leistungsstarke und flexible Möglichkeit, Text aus DOCX-Dateien zu extrahieren. Ganz gleich, ob Sie ganze Dokumente, bestimmte Absätze oder Tabellendaten extrahieren müssen, die API bietet unkomplizierte Methoden, um Ihre Ziele zu erreichen. Durch die Kombination dieser Techniken mit der richtigen Fehlerbehandlung und Optimierungsstrategien können Sie robuste Dokumentenverarbeitungsanwendungen erstellen, die verschiedene Textextraktionsszenarien effizient bewältigen.

Für fortgeschrittenere Szenarien und zur Erkundung zusätzlicher Funktionen finden Sie Erweiterungen und andere Dokumentationsressourcen zur Erweiterung Ihrer Dokumentverarbeitungsmöglichkeiten.

Häufig gestellte Fragen

Wie kann ich in C# den gesamten Text aus einem Word-Dokument extrahieren?

Verwenden Sie die ExtractText()-Methode von IronWord für ein WordDocument-Objekt. Laden Sie einfach Ihre DOCX-Datei mit WordDocument doc = new WordDocument("document.docx"); und rufen Sie dann string text = doc.ExtractText(); auf, um den gesamten Textinhalt aus dem Dokument zu erhalten.

Kann ich Text aus bestimmten Absätzen statt aus dem gesamten Dokument extrahieren?

Ja, IronWord ermöglicht es Ihnen, Text aus bestimmten Absätzen zu extrahieren, indem Sie auf die Paragraphs-Sammlung zugreifen. Verwenden Sie doc.Paragraphs[index].ExtractText(), um einzelne Absätze für eine detailliertere Textextraktion auszuwählen.

Wie kann ich Text aus Tabellen in DOCX-Dateien extrahieren?

IronWord ermöglicht die Extraktion von Tabellentext über die Tables-Sammlung. Greifen Sie auf bestimmte Zellen zu, indem Sie doc.Tables[0].Rows[0].Cells[0].ExtractText() verwenden, um Textinhalte aus jeder Tabellenzelle in Ihrem Dokument abzurufen.

Welcher Reihenfolge folgt der extrahierte Text bei der Verwendung von ExtractText()?

Die ExtractText()-Methode von IronWord behält die logische Lesereihenfolge des Dokuments bei und verarbeitet Kopfzeilen, Absätze, Listen und andere Textelemente der Reihe nach, was sie ideal für die Inhaltsanalyse und die Suchindexierung macht.

Was sind die grundlegenden Schritte, um mit der Extraktion von Text aus DOCX-Dateien zu beginnen?

Installieren Sie IronWord zunächst über NuGet (Install-Package IronWord), erstellen oder laden Sie dann ein WordDocument, und verwenden Sie schließlich die Methode ExtractText(), um Text aus dem gesamten Dokument, bestimmten Absätzen oder Tabellenzellen abzurufen.

Eignet sich die Textextraktion für den Aufbau von Dokumentenindizierungssystemen?

Ja, die Textextraktionsfunktionen von IronWord eignen sich perfekt für den Aufbau von Dokumentenindizierungssystemen, Content-Management-Lösungen und Datenextraktionspipelines, die einen effizienten programmatischen Zugriff auf den Inhalt von Word-Dokumenten ermöglichen.

How can I export extracted text to a file using IronWord?

Once you've extracted the text, you can use C# file handling methods like `File.WriteAllText` to save the text to a file, as demonstrated in the tutorial with paragraph extraction where combined text is saved to an output.txt file.

Is it possible to extract introduction and conclusion sections separately?

Yes, you can extract specific paragraphs such as the introduction and conclusion by targeting them within the `Paragraphs` collection. This method is effective for document summarization tools requiring distinct extraction of key sections.

What encoding considerations should be taken when saving extracted text?

IronWord users should be aware of character encoding, especially when dealing with documents containing special characters or multiple languages. Ensuring the correct encoding is crucial when saving extracted text to maintain text integrity.

How can IronWord's text extraction be optimized for large documents?

For large documents, optimize text extraction by targeting only the necessary portions instead of extracting the entire content. This ensures efficiency, reduces processing time, and leverages the full capabilities of IronWord.

Ahmad Sohail
Full-Stack-Entwickler

Ahmad ist ein Full-Stack-Entwickler mit einer soliden Grundlage in C#, Python und Webtechnologien. Er hat ein großes Interesse am Aufbau skalierbarer Softwarelösungen und genießt es, zu erkunden, wie Design und Funktionalität in realen Anwendungen aufeinandertreffen.

...
Weiterlesen

Bereit anzufangen?

Nuget Downloads 56,401Version:2026.9gerade veröffentlicht

Erhalten Sie sofort Ihren kostenlosen 30-Tage-Testschlüssel.
Ihr Testlizenzschlüssel wurde Ihnen per E-Mail gesendet.
C# NuGet-Bibliothek für PDF
Installation mit NuGet

Version: 2026.9

PM > Install-Package IronWord
nuget.org/packages/IronWord/
  1. Rechtsklick auf Referenzen, NuGet-Pakete verwalten
  2. Durchsuchen und nach 'IronWord' suchen
  3. Paket auswählen und installieren
C# PDF DLL
Download DLL

Version: 2026.9

  1. Laden Sie IronWord herunter und entpacken Sie es in ein Verzeichnis wie ~/Libs in Ihrem Projektverzeichnis
  2. Klicken Sie im Visual Studio-Lösungs-Explorer mit der rechten Maustaste auf Verweise. Wählen Sie Durchsuchen, "IronWord.dll"

Lizenzen ab $999

Key in blue circle

Holen Sie sich sofort Ihren kostenlosen 30-Tage-Testschlüssel.

Your trial license will be sent to your email address

Keine Einschränkungen. 100 % freigeschaltet. Keine Kreditkarte.

bullet_checkedIhr Testlizenzschlüssel wurde Ihnen per E-Mail gesendet.Keine Einschränkungen. 100 % freigeschaltet. Keine Kreditkarte.
  • Logo Aetna
  • Logo NASA
  • Logo GE
  • Logo Porsche
  • Logo USDA
  • Logo Qatar
Join Millions of Engineers who’ve tried IronPDF
AWS-Logo
Booking Badge

Von Millionen von Ingenieur*innen weltweit vertraut

Azure (WebApps, Funktionen v3)
Erhalten Sie Ihre unverbindliche Beratung
Füllen Sie das Formular unten aus oder senden Sie eine E-Mail an sales@ironsoftware.com
Ihre Daten werden immer vertraulich behandelt.
Von Millionen von Ingenieur*innen weltweit vertraut
Azure (WebApps, Funktionen v3)
Erhalten Sie sofort Ihren kostenlosen 30-Tage-Testschlüssel.
Ihr Testlizenzschlüssel wurde Ihnen per E-Mail gesendet.