IRONSOFTWAREHOME
IRONWORDの使用方法

How to Extract Text from Word in C#

Curtis Chau
Curtis Chau
Updated: 2026年6月28日

通常、ドキュメント処理アプリケーション、データ抽出、またはテキスト分析の主なタスクは、Word 文書ファイルからのテキスト抽出です。 C# アプリケーションを開発する場合、開発者は .docx 形式のファイルを操作し、ドキュメント インスタンス内のテキストにアクセスするのに役立つ IronWord などのライブラリを使用します。 これらのライブラリを使用すると、 Word 文書からコンテンツを取得する方法が自動化され、レポート作成、データ マイニング、さらにはドキュメント管理システムの生成が可能になります。

IronWord などのライブラリを使用すると、任意の Word 文書インスタンスからテキストを抽出できます。 ドキュメント オブジェクトを読み込み、段落またはセクションを開き、元のレイアウトを維持しながら目的のテキストを取得するだけです。 このような機能は、文書処理が通常ワークフローに不可欠な法務、医療、金融の分野で非常に有用であることが証明されます。 C# は、Word ファイルからテキストを抽出する、非常にスケーラブルで効率的なアプリケーションの開発に間違いなく使用されます。 開発者は、これをより広範なシステムやアプリケーションと組み合わせることができます。

How to Extract Text from Word in C#

  1. NuGet 経由で IronWord ライブラリを C# プロジェクトにインストールします。
  2. using IronWord; をC#ファイルの上部に追加して、Wordからテキストを抽出します。
  3. ライセンス キーを設定します。
  4. 既存の Word 文書を読み込みます。
  5. Paragraphs プロパティを使用して段落にアクセスします。
  6. foreach ループを使用して段落とテキスト要素をループします。
  7. Console を使用してテキストを抽出し、表示します。

IronWordとは何ですか?

IronWord はテキストを取得するための強力なツールであり、PDF、Word、TXT ファイルなど、あらゆる種類のファイルを簡単に取得できます。 ドキュメントの残りの元の形式を維持しながら、構造化テキストまたは非構造化テキストを必要なだけ素早く抽出できるように、精度と速度を考慮して設計されています。 IronWord は、ドキュメント分析、データ抽出、コンテンツの自動インデックス作成にも利用されます。

C#でWordからテキストを抽出する方法: 図1 - IronWord

このツールは、アプリケーションとのスムーズな統合を保証するために利用可能なほぼすべてのファイル タイプをサポートしており、ビジネスの自動化や大量のドキュメント処理に最適です。 このように設計されたライブラリのスケーラビリティにより、大量のドキュメントを簡単に処理できるようになります。これは、大量のデータ抽出を行う企業にとって非常に重要な資産です。

IronWord は C# やその他のプログラミング言語とも完全に互換性があり、ドキュメント ワークフローをスムーズに合理化したい開発者や組織のニーズを満たします。

IronWordの機能

複数のドキュメント形式のサポート

IronWordは、さまざまなドキュメント形式のファイルを受け入れます。

  • **PDF:**通常のテキストを含む PDF、埋め込みフォントを含む PDF、およびベクターに基づく PDF 上のテキストを解釈できます。
  • **Microsoft Word ファイル (DOCX):**文書の構造と書式を維持しながら、Word 文書からテキストを簡単に読み取ります。 ***テキスト ファイル (TXT):**さらに、IronWord はプレーン テキスト ファイルを処理し、単純なテキストからテキストを抽出して処理します。

正確なテキスト抽出

IronWord 抽出エンジンは、複雑なページ レイアウト、埋め込みフォント、画像と表などのコンテンツが混在する複雑なドキュメント内にテキスト コンテンツが埋め込まれている場合でも、テキスト コンテンツを抽出するのに優れています。 図書館では以下のものを保存しています:

***テキストの書式設定:**太字、斜体、下線などのスタイルや、テキストに適用されるその他のスタイル要素。 ***ドキュメント階層:**整理と読みやすさを維持するためのヘッダー、段落、リスト。

構造化データと非構造化データの処理

IronWord は構造化データと非構造化データの両方を処理します。 抽出できるもの:

***構造化データ:**フォームや契約書など、予測可能な書式パターンを持つドキュメント。 ***非構造化データ:**レポートや記事など、予測できないテキストレイアウトを持つドキュメント。

幅広いコンテンツを処理できるため、データマイニング、情報検索、分類などのタスクに役立つことが実証されています。

大容量データに対応するスケーラビリティ

IronWord は、大量のドキュメントを効率的に処理するように構築されており、エンタープライズ アプリケーションに優れたスケーラビリティを提供します。 例には以下が含まれます:

***ドキュメントのバッチ処理:**一度に多数のドキュメントを処理します。 ***大きなファイルの処理:**ドキュメント サイズが大きい場合でもパフォーマンスが低下しません。

プログラミング言語とのシームレスな統合

IronWordは、使いやすいAPIを通じて、特にPythonなどの開発環境にシームレスに統合されます。これにより、開発者は以下のことが可能になります。

  • IronWord を Python アプリケーションにインポート: Python スクリプト内で直接 IronWord 関数を使用します。
  • 言語間の相互運用性: Pythonを超えて、IronWordは他の言語でも効果的に利用でき、テックスタック間の相互運用性を促進します。

この統合の容易さにより、開発者はインフラストラクチャではなく機能に集中できます。

高いパフォーマンスとスピード

IronWord はパフォーマンスが最適化されており、大規模なドキュメントからでも高速なテキスト抽出が可能です。これは、迅速な実行を必要とするリアルタイム アプリケーションには不可欠です。 図書館では以下を提供しています:

***マルチスレッド サポート:**同時抽出プロセスの強化。 ***小さなメモリ フットプリント:**処理中にシステム リソースを最適に使用することで、大規模なデータセットのスケーラビリティを実現します。

オプションのOCRサポート

画像を含むドキュメントの場合、IronWord を OCR テクノロジーと併用すると次のことが可能になります。

***スキャンされたドキュメントの処理:**画像、スキャンされた PDF、またはその他の画像ベースの形式からテキストを抽出します。 ***多言語サポート:**サポートされている OCR 言語でテキストを認識し、抽出します。

メタデータの保存

テキスト抽出以外にも、IronWord は次のようなドキュメントのメタデータを保存します。

***ドキュメントのバージョン管理とコンプライアンス情報:**コンプライアンスまたはアーカイブの目的に役立ちます。 ***ドキュメント管理システム:**メタデータはコンテンツと同様に重要です。

Visual Studioで新しいプロジェクトを作成する

Visual Studio アプリケーションを起動するには、[ファイル] メニューから [ファイル] を選択し、[新しいプロジェクト] を選択してから [コンソール アプリ] を選択します。

C#でWordからテキストを抽出する方法: 図2 - コンソールアプリ

場所を選択した後、テキスト フィールドに .NET プロジェクトの名前を入力し、[作成] ボタンをクリックして、必要な .NET Framework を選択します。

C#でWordからテキストを抽出する方法: 図3 - プロジェクト設定

Visual Studio プロジェクトの構造は、選択したアプリケーションによって異なります。 アプリケーション コードを実装または実行するには、コンソール、ウィンドウ、またはオンライン アプリケーションに適用可能な Program.cs ファイルにアクセスしてください。

C#でWordからテキストを抽出する方法: 図4 - 対象フレームワーク

コードを入力すると、ライブラリをテストできます。

IronWordライブラリをインストールする

Visual Studio のツール メニューから、NuGet パッケージ マネージャーを選択します。 パッケージ管理コンソールにアクセスするには、パッケージ マネージャー インターフェイスに移動します。

PM > Install-Package IronWord

パッケージをダウンロードしてインストールすると、進行中のプロジェクトでのテキスト抽出に使用できるようになります。

C#でWordからテキストを抽出する方法: 図5 - IronWordのインストール

パッケージ マネージャー メソッドには別のオプションがあり、Visual Studio の NuGet パッケージ マネージャーを介してソリューションに直接インストールできます。 下の図は、パッケージ マネージャーにアクセスする方法を示しています。

C#でWordからテキストを抽出する方法: 図6 - NuGetパッケージマネージャー

NuGet Web サイトの検索フィールドを使用してパッケージを見つけます。 以下のスクリーンショットに示すように、パッケージ マネージャーで"IronWord"を検索します。

C#でWordからテキストを抽出する方法: 図7 - IronWordを検索

付随するグラフィックには関連する検索結果が表示されます。 ソフトウェアをコンピュータにインストールするには、次の調整を行ってください。

Word文書からテキストを抽出する

IronWord を使用してドキュメントからテキストを抽出するには、次の手順に従います。 以下のサンプル コードは、C# の IronWord ライブラリを使用して Word 文書 (.docx) からテキストを抽出する方法を示しています。

// Include necessary libraries
using IronWord;

// Set the license key for IronWord
IronWord.License.LicenseKey = "License key here";

// Load the Word document
var docx1 = new WordDocument("D:\\C# Projects\\ConsoleApp\\ConsoleApp\\File\\existing.docx");

// Access the collection of paragraphs in the document
var paragraphObj = docx1.Paragraphs;

// Loop through each paragraph and its text elements
for (int i = 0; i < paragraphObj.Count; i++)
{
    for (int j = 0; j < paragraphObj[i].Texts.Count; j++)
    {
        // Print each text element to the console
        Console.WriteLine(paragraphObj[i].Texts[j].Text.ToString());
    }
}

// Wait for user input before closing the console
Console.ReadKey();

このコードは、IronWord のライセンス キーを初期化し、指定されたパスから .docx ドキュメントを読み込んで、WordDocument オブジェクトを作成します。 ドキュメントが読み込まれた後、Paragraphs プロパティを介してすべての段落にアクセスします。

C#でWordからテキストを抽出する方法: 図8 - サンプルWordドキュメント

ネストされたループは段落とそのテキスト要素を反復処理します。 外側のループは各段落を走査し、内側のループは各段落のテキスト要素を処理します。 テキスト要素は文字列に変換された後、コンソールに出力されます。

C#でWordからテキストを抽出する方法: 図9 - コンソール出力

Console.ReadKey() はプログラムの実行を中断し、ユーザー入力が行われるまで出力を表示してアプリケーションウィンドウを閉じる前に待機します。 この方法では、Word 文書の内容を順番に抽出して印刷します。

結論

IronWord は、さまざまなドキュメント形式からテキストを抽出するための多用途で効率的なツールであり、特に Word ドキュメントに適しています。 ユーザーフレンドリーな API と構造化テキスト抽出機能により、ドキュメント コンテンツの自動取得を求める開発者にとって信頼できるソリューションとなります。 このツールは、複雑なドキュメントを処理しながら書式を維持するため、法務、エンタープライズ レベルのコンテンツ管理、その他のアプリケーションに役立ちます。 IronWord を実装すると、ドキュメント分析、データ抽出、処理タスクが強化され、大量のテキストを処理する際の生産性と精度が向上します。

IronWordの開始価格は599ドルです。ユーザーは年間サブスクリプション料金を1回支払うことで、テクニカルサポートとソフトウェアアップデートへのアクセスを得ることができます。 IronWord には無料配布を妨げるコストがかかります。 具体的な価格の詳細については、IronWord のライセンス ページを参照してください。 その他の Iron Software 製品については、製品ページをご覧ください。

Curtis Chau
テクニカルライター

Curtis Chauは、カールトン大学でコンピュータサイエンスの学士号を取得し、Node.js、TypeScript、JavaScript、およびReactに精通したフロントエンド開発を専門としています。直感的で美しいユーザーインターフェースを作成することに情熱を持ち、Curtisは現代のフレームワークを用いた開発や、構造の良い視覚的に魅力的なマニュアルの作成を楽しんでいます。

...
詳しく読む

関連する記事

Key in blue circle

無料の30日間トライアルキーをすぐに入手してください。

Your trial license will be sent to your email address

制限なし。100% ロック解除済み。クレジットカード不要。

bullet_checkedクレジットカードやアカウントの作成は不要です。制限なし。100% ロック解除済み。クレジットカード不要。
  • Logo Aetna
  • Logo NASA
  • Logo GE
  • Logo Porsche
  • Logo USDA
  • Logo Qatar
Join Millions of Engineers who’ve tried IronPDF
無料のライブデモを予約する
Booking Badge

世界中の数百万人のエンジニアから信頼されています。

ライセンスはより安く
義務のない相談を受ける
下記のフォームを記入するか、sales@ironsoftware.comにメールしてください。
あなたの詳細は常に守秘されます。
世界中の数百万人のエンジニアから信頼されています。
ライセンスはより安く
あなたの無料30日間の試用キーをすぐに入手。
クレジットカードやアカウントの作成は不要です。