IRONSOFTWAREHOME

Extraire du texte de DOCX avec IronWord

Ahmad Sohail
Ahmad Sohail
Updated: 4 juin 2026

La méthode ExtractText() d'IronWord vous permet d'extraire du texte à partir de fichiers DOCX en accédant à l'ensemble du document, à des paragraphes spécifiques ou à des cellules de tableau, offrant une API simple pour les tâches de traitement de documents et d'analyse de données en C#.

Démarrage rapide : Extraire du texte d'un fichier DOCX
  1. 1Install IronWord with NuGet Package Manager

    PM > Install-Package IronWord

  2. 2Copiez et exécutez cet extrait de code.

    using IronWord;
    
    // Quick example: Extract all text from DOCX
    WordDocument doc = new WordDocument("sample.docx");
    string allText = doc.ExtractText();
    Console.WriteLine(allText);
    C#
  3. 3Déployez pour tester sur votre environnement de production.

    Commencez à utiliser IronWord dans votre projet dès aujourd'hui avec un essai gratuit
    arrow pointer

Comment extraire tout le texte d'un document DOCX?

La méthode ExtractText() récupère le contenu textuel d'un document Word entier. Dans cet exemple, nous créons un nouveau document, y ajoutons du texte, extrayons le texte à l'aide de ExtractText(), et l'affichons dans la console. Ceci illustre le flux de travail principal d'extraction de texte.

Le texte extrait conserve l'ordre de lecture logique du document. La méthode traite les en-têtes, les paragraphes, les listes et d'autres éléments de texte en séquence, ce qui la rend idéale pour les applications d'analyse de contenu et d'indexation de recherche.

using System;
using IronWord;

// Instantiate a new DOCX file
WordDocument doc = new WordDocument();

// Add text
doc.AddText("Hello, World!");

// Print extracted text from the document to the console
Console.WriteLine(doc.ExtractText());

À quoi ressemble le texte extrait?

Document Microsoft Word affichant le texte "Hello, World !" avec le ruban de mise en forme visible

Quel résultat dois-je attendre de la console ?

Exemple de code montrant Console.WriteLine imprimant le texte extrait, avec la console de débogage affichant la sortie "Hello, World !

Comment puis-je extraire du texte de certains paragraphes ?

Pour plus de contrôle, vous pouvez extraire le texte de paragraphes spécifiques au lieu du document entier. En accédant à la collection Paragraphs, vous pouvez cibler et traiter n'importe quel paragraphe dont vous avez besoin. Cette approche granulaire est utile lorsqu'il s'agit de documents dont le contenu est structuré ou lorsque vous devez traiter des sections spécifiques de manière indépendante.

Dans cet exemple, nous extrayons le texte des premier et dernier paragraphes, les combinons et enregistrons le résultat dans un fichier .txt. Cette technique est couramment utilisée dans les outils de résumé de documents où vous pourriez vouloir extraire l'introduction et la conclusion d'un document. De la même manière que vous pourriez utiliser des clés de licence pour déverrouiller des fonctionnalités, la collection Paragraphs vous donne accès à des éléments spécifiques du document.

using System.IO;
using System.Linq;
using IronWord;

// Load an existing DOCX file
WordDocument doc = new WordDocument("document.docx");

// Extract text and assign variables
string firstParagraph = doc.Paragraphs[0].ExtractText();
string lastParagraph = doc.Paragraphs.Last().ExtractText();

// Combine the texts
string newText = firstParagraph + " " + lastParagraph;

// Export the combined text as a new .txt file
File.WriteAllText("output.txt", newText);

La capacité d'extraire des paragraphes spécifiques devient puissante lorsqu'elle est combinée à des exigences d'analyse de documents. Par exemple, vous pouvez extraire des paragraphes clés en fonction de leur formatage, de leur position ou de leur contenu. Cette approche d'extraction sélective permet de réduire le temps de traitement et de se concentrer sur le contenu le plus pertinent.

Quel contenu est extrait du premier paragraphe ?

Document Word montrant un paragraphe formaté en rouge au-dessus d'un paragraphe en noir pour la démonstration de l'extraction

Quel est le contenu extrait du dernier paragraphe ?

Document Microsoft Word montrant des paragraphes formatés avec du texte Lorem ipsum dans des couleurs violettes et bleues

Comment le texte combiné apparaît-il dans le fichier de sortie?

Éditeur de texte montrant les points d'extraction de paragraphes marqués par des flèches rouges et bleues indiquant les limites des paragraphes

Les captures d'écran ci-dessus montrent l'extraction du premier paragraphe, l'extraction du dernier paragraphe et le résultat combiné enregistré dans un fichier texte. Vous remarquerez que le processus d'extraction préserve le contenu du texte tout en supprimant les informations de mise en forme, ce qui le rend adapté au traitement de texte brut.

Comment extraire des données de tableaux dans DOCX?

Les tableaux contiennent souvent des données structurées qui doivent être extraites pour être traitées ou analysées. IronWord vous permet d'accéder aux données d'un tableau en naviguant à travers les lignes et les cellules. Dans cet exemple, nous chargeons un document contenant un tableau de statistiques d'API et extrayons une valeur de cellule spécifique de la 4e colonne de la 2e ligne.

L'extraction de tableaux est essentielle pour les projets de migration de données, la génération de rapports et les flux de travail de collecte automatisée de données. Lorsque vous travaillez avec des données tabulaires, comprendre le système d'indexation basé sur zéro est crucial - la première table est Tables[0], la première ligne est Rows[0], et ainsi de suite. Cette approche systématique, similaire aux structures de licence, fournit des modèles d'accès prévisibles.

using System;
using IronWord;
using IronWord.Models;

// Load the API statistics document
WordDocument apiStatsDoc = new WordDocument("api-statistics.docx");

// Extract text from the 1st table, 4th column and 3rd row
string extractedValue = ((TableCell)apiStatsDoc.Tables[0].Rows[2].Cells[3]).ExtractText();

// Print extracted value
Console.WriteLine($"Target success rate: {extractedValue}");
C#

Le code montre comment accéder aux cellules de tableau en utilisant les propriétés de collection Tables, Rows et Cells. Notez que la collection Cells retourne des objets d'interface ITableCell, qui doivent être convertis en TableCell pour accéder à la méthode ExtractText : ((TableCell)cell).ExtractText(). Cela nécessite d'ajouter using IronWord.Models; à vos déclarations de namespace.

À quoi ressemble le tableau source?

Tableau de statistiques d'utilisation de l'API dans Word montrant 6 points d'extrémité avec les requêtes, la latence, les taux de réussite et les mesures de la bande passante

Quelle valeur est extraite de la cellule du tableau ?

La console affiche la valeur de table extraite "Target success rate : 99.8%" dans la console de débogage de Visual Studio

Scénarios d'extraction de texte avancés

Lorsque vous travaillez sur des documents complexes, vous pouvez être amené à combiner plusieurs techniques d'extraction. Voici un exemple qui montre comment extraire du texte à partir de plusieurs éléments et les traiter différemment :

using IronWord;
using IronWord.Models;
using System.Text;
using System.Linq;

// Load a complex document
WordDocument complexDoc = new WordDocument("report.docx");

// Create a StringBuilder for efficient string concatenation
StringBuilder extractedContent = new StringBuilder();

// Extract and process headers (assuming they're in the first few paragraphs)
var headers = complexDoc.Paragraphs
    .Take(3)
    .Select(p => p.ExtractText())
    .Where(text => !string.IsNullOrWhiteSpace(text));

foreach (var header in headers)
{
    extractedContent.AppendLine($"HEADER: {header}");
}

// Extract table summaries
foreach (var table in complexDoc.Tables)
{
    // Get first cell as table header/identifier
    string tableIdentifier = ((TableCell)table.Rows[0].Cells[0]).ExtractText();
    extractedContent.AppendLine($"\nTABLE: {tableIdentifier}");
    
    // Extract key metrics (last row often contains totals)
    if (table.Rows.Count > 1)
    {
        var lastRow = table.Rows.Last();
        var totals = lastRow.Cells.Select(cell => ((TableCell)cell).ExtractText());
        extractedContent.AppendLine($"Totals: {string.Join(", ", totals)}");
    }
}

// Save the structured extraction
System.IO.File.WriteAllText("structured-extract.txt", extractedContent.ToString());
C#

Cet exemple avancé montre comment créer des extractions structurées en combinant différents éléments du document. Cette approche est utile pour générer des résumés de documents, créer des index ou préparer des données pour un traitement ultérieur. Tout comme les mises à jour améliorent les capacités des logiciels, la combinaison des méthodes d'extraction améliore vos capacités de traitement des documents.

Bonnes pratiques pour l'extraction de texte

Lorsque vous mettez en œuvre l'extraction de texte dans des applications de production, tenez compte des meilleures pratiques suivantes :

  1. Gestion des erreurs : Enveloppez toujours le code d'extraction dans des blocs try-catch pour gérer les documents qui pourraient être corrompus ou avoir des structures inattendues.

  2. Optimisation des performances : Pour les documents volumineux ou le traitement par lots, envisagez d'extraire uniquement les parties nécessaires plutôt que l'intégralité du contenu du document.

  3. Codage des caractères : il convient de tenir compte du codage des caractères lors de l'enregistrement du texte extrait, en particulier pour les documents contenant des caractères spéciaux ou plusieurs langues.

  4. Gestion de la mémoire : Lorsque vous traitez plusieurs documents, disposez correctement des objets WordDocument pour éviter les fuites de mémoire.

N'oubliez pas que l'extraction de texte préserve l'ordre logique de lecture mais supprime le formatage. Si vous avez besoin de conserver les informations de formatage, envisagez d'utiliser des fonctionnalités supplémentaires IronWord ou de stocker les métadonnées séparément. Pour les déploiements en production, consultez le changelog pour vous tenir au courant des dernières fonctionnalités et améliorations.

Résumé

La méthode ExtractText() d'IronWord fournit un moyen puissant et flexible d'extraire du texte à partir de fichiers DOCX. Que vous ayez besoin d'extraire des documents entiers, des paragraphes spécifiques ou des données de tableau, l'API offre des méthodes simples pour atteindre vos objectifs. En combinant ces techniques avec une gestion des erreurs et des stratégies d'optimisation appropriées, vous pouvez créer des applications de traitement de documents robustes qui gèrent efficacement divers scénarios d'extraction de texte.

Pour des scénarios plus avancés et pour explorer des fonctionnalités supplémentaires, consultez les extensions et d'autres ressources documentaires pour améliorer vos capacités de traitement des documents.

Questions Fréquemment Posées

Comment extraire tout le texte d'un document Word en C# ?

Utilisez la méthode ExtractText() d'IronWord sur un objet WordDocument. Chargez simplement votre fichier DOCX avec WordDocument doc = new WordDocument("document.docx") ; puis appelez string text = doc.ExtractText() ; pour récupérer tout le contenu textuel du document.

Puis-je extraire du texte à partir de paragraphes spécifiques plutôt que du document entier ?

Oui, IronWord vous permet d'extraire du texte à partir de paragraphes spécifiques en accédant à la collection Paragraphes. Utilisez doc.Paragraphs[index].ExtractText() pour cibler des paragraphes individuels pour une extraction de texte plus granulaire.

Comment extraire le texte des tableaux dans les fichiers DOCX ?

IronWord permet l'extraction du texte des tableaux grâce à la collection Tables. Accédez à des cellules spécifiques en utilisant doc.Tables[0].Rows[0].Cells[0].ExtractText() pour extraire le contenu textuel de n'importe quelle cellule de tableau dans votre document.

Quel est l'ordre du texte extrait lors de l'utilisation de ExtractText() ?

La méthode ExtractText() d'IronWord maintient l'ordre de lecture logique du document, en traitant les en-têtes, les paragraphes, les listes et autres éléments de texte dans l'ordre, ce qui la rend idéale pour l'analyse de contenu et l'indexation de recherche.

Quelles sont les étapes de base pour commencer à extraire du texte à partir de fichiers DOCX ?

Installez d'abord IronWord via NuGet (Install-Package IronWord), puis créez ou chargez un document WordDocument, et enfin utilisez la méthode ExtractText() pour récupérer le texte de l'ensemble du document, de paragraphes spécifiques ou de cellules de tableau, selon les besoins.

L'extraction de texte est-elle adaptée à la construction de systèmes d'indexation de documents ?

Oui, les capacités d'extraction de texte d'IronWord sont parfaites pour construire des systèmes d'indexation de documents, des solutions de gestion de contenu et des pipelines d'extraction de données, offrant un accès programmatique efficace au contenu des documents Word.

How can I export extracted text to a file using IronWord?

Once you've extracted the text, you can use C# file handling methods like `File.WriteAllText` to save the text to a file, as demonstrated in the tutorial with paragraph extraction where combined text is saved to an output.txt file.

Is it possible to extract introduction and conclusion sections separately?

Yes, you can extract specific paragraphs such as the introduction and conclusion by targeting them within the `Paragraphs` collection. This method is effective for document summarization tools requiring distinct extraction of key sections.

What encoding considerations should be taken when saving extracted text?

IronWord users should be aware of character encoding, especially when dealing with documents containing special characters or multiple languages. Ensuring the correct encoding is crucial when saving extracted text to maintain text integrity.

How can IronWord's text extraction be optimized for large documents?

For large documents, optimize text extraction by targeting only the necessary portions instead of extracting the entire content. This ensures efficiency, reduces processing time, and leverages the full capabilities of IronWord.

Ahmad Sohail
Développeur Full Stack

Ahmad est un développeur full-stack avec une solide fondation en C#, Python et technologies web. Il a un profond intérêt pour la construction de solutions logicielles évolutives et aime explorer comment le design et la fonctionnalité se rencontrent dans des applications du monde réel.

...
Lire la suite

Prêt à commencer?

Nuget Downloads 56,401Version :2026.9vient de sortir

Obtenez votre clé d'essai 30 jours gratuitement.
Aucune carte de crédit ou création de compte requise
Bibliothèque C# NuGet pour PDF
Installer avec NuGet

Version : 2026.9

PM > Install-Package IronWord
nuget.org/packages/IronWord/
  1. Dans l'explorateur de solutions, faites un clic droit sur Références, Gestion des packages NuGet
  2. Sélectionnez Parcourir et recherchez "IronWord"
  3. Sélectionnez le package et installez
C# PDF DLL
Télécharger DLL

Version : 2026.9

  1. Téléchargez et décompressez IronWord à un emplacement tel que ~/Libs dans votre répertoire Solution
  2. Dans l'Explorateur de Solution de Visual Studio, faites un clic droit sur Références. Sélectionnez Parcourir, "IronWord.dll"

Licences à partir de $999

Vous avez une question ? Contactez notre équipe de développement.

Key in blue circle

Obtenez votre clé d'essai de 30 jours instantanément.

Your trial license will be sent to your email address

Aucune restriction. 100 % débloqué. Pas de carte bancaire.

bullet_checkedAucune carte de crédit ou création de compte requiseAucune restriction. 100 % débloqué. Pas de carte bancaire.
  • Logo Aetna
  • Logo NASA
  • Logo GE
  • Logo Porsche
  • Logo USDA
  • Logo Qatar
Join Millions of Engineers who’ve tried IronPDF
Réservez votre Démonstration en direct gratuite
Booking Badge

De confiance par des millions d'ingénieurs dans le monde entier

Logos des clients d'Iron Software
Obtenez Votre Consultation sans Engagement
Remplissez le formulaire ci-dessous ou envoyez un email à sales@ironsoftware.com
Vos informations seront toujours gardées confidentielles.
De confiance par des millions d'ingénieurs dans le monde entier
Logos des clients d'Iron Software
Obtenez votre clé d'essai 30 jours gratuitement.
Aucune carte de crédit ou création de compte requise