Webページからデータを抽出する方法 Power Automateの手順とツールの選び方を解説

Webページからデータを抽出する方法 Power Automateの手順とツールの選び方を解説

競合の価格を毎週まとめる、公的機関のサイトから最新の数値を転記する、求人サイトの掲載状況を一覧にする。こうした作業を手作業のコピー&ペーストで続けていると、件数が増えるほど時間を取られ、写し間違いも起きます。

Webページからのデータ抽出は、プログラムを書かなくても実現できる手段がいくつも用意されています。Power Automate for desktopの専用アクション、ExcelやPower Queryの取り込み機能、ブラウザ拡張機能など、対象サイトの作りと必要な頻度によって適した道具が変わります。

本記事では、手段の全体像と選び方から、Power Automate for desktopでの具体的な設定手順、複数ページの扱い、うまく取れないときの対処、そして実施前に必ず確認しておきたい規約や法律の論点までを順番に整理します。

確認したいポイント結論詳細
Webページからデータを抽出するには?ノーコードのRPAでできるPower Automate for desktopの「Webページからデータを抽出する」なら、画面上で対象を選ぶだけで取得できます。
複数ページ分もまとめて取れる?ページャー設定で対応できる次ページへのリンクを「要素をページャーとして設定」しておくと、指定したページ数まで自動でたどります。
抽出したデータはどこに出せる?変数かExcelを選べるデータ保存モードで、フロー内の変数に格納するか、新しいExcelへ直接書き出すかを指定します。
実施前に確認することは?利用規約と著作権の扱いサイトの利用規約、robots.txt、著作権法上の位置づけ、サーバー負荷への配慮を事前に確認します。

この記事でわかること

  • Webページからデータを抽出する主な手段と、対象サイトに応じた選び分け
  • Power Automate for desktopの「Webページからデータを抽出する」の設定手順
  • ページャーを設定して複数ページ分をまとめて取得する方法
  • 思ったように抽出できないときに確認すべき箇所と回避策
  • 利用規約、著作権、サーバー負荷など実施前に押さえるべき注意点
▼ 手作業の情報収集をどこまで自動化できるか整理したい方へ
RPAや生成AIを使った業務自動化の進め方、支援内容、導入までの流れをまとめた資料をご用意しています。
検討の初期段階でも構いませんので、まずは全体像の把握にご活用ください。
> 資料請求はこちら
目次

Webページからデータを抽出する主な手段

一口にデータ抽出といっても、実現方法は1つではありません。対象ページの作り、必要な頻度、扱える人のスキルによって、適した道具は変わります。まずは代表的な5つの手段と、それぞれが向く場面を整理します。

RPAツールでブラウザを操作して取得する

最も汎用性が高いのが、Power Automate for desktop(以下PAD)などのRPAツールでブラウザを動かす方法です。人が画面を見て操作する手順をそのまま再現できるため、ログインが必要なページや、検索条件を指定してから結果を取る流れにも対応できます。

PADには「Webページからデータを抽出する」という専用アクションが用意されており、画面上で取りたい箇所をクリックしていくだけで抽出対象を指定できます。コードを書く必要がないため、現場の担当者でも扱いやすい手段です。

一方で、ブラウザを実際に起動して動かすぶん処理は遅く、PCが動いている必要があります。大量のページを高速に処理する用途には向きません。

ExcelやPower Queryで取り込む

ページ内のデータがきれいな表の形になっているなら、ExcelやPower BIの「Webから」という取り込み機能が最短です。URLを指定するだけで、ページ内のテーブルが自動検出されて候補として並びます。

表として認識されない場合でも、「例を使用してテーブルを追加」を選べば対応できます。抽出したい値をいくつか手入力すると、そのパターンに合うデータをまとめて取り出す仕組みです。取り込んだ後はそのまま加工や結合に進めます。

更新ボタンひとつで最新データを取り直せる点も利点です。定期的に同じページから同じ形式のデータを取るだけなら、この方法が最も手間がかかりません。

ブラウザ拡張機能を使う

一時的に数ページ分だけ取りたいのであれば、ブラウザの拡張機能でも足ります。画面上で範囲を選ぶだけで表形式に整えてくれるものが多く、導入も数分で済みます。

ただし、社内のセキュリティポリシーで拡張機能の追加が制限されている場合があります。また、閲覧しているページの内容が外部サービスへ送られる仕組みのものもあるため、業務データを扱う場面では事前確認が必要です。

APIやプログラムで取得する

対象サイトがAPIを公開しているなら、ページを解析するのではなくAPIから取るのが最も確実です。画面のデザインが変わっても壊れにくく、処理も高速です。公的機関のサイトでは、統計データをAPIやCSVで提供しているケースが少なくありません。

APIがない場合にプログラムで取得する選択肢もありますが、書ける人と保守できる人が社内に必要になります。まずはノーコードの手段で足りないかを検討し、それでも要件を満たせない場合に検討するのが現実的な順序です。

生成AIやAIエージェントに任せる

近年は、ブラウザを操作できるAIエージェントや、ページの内容を読み取って整形する生成AIを使う選択肢も出てきました。抽出ルールを細かく定義しなくても、「この表を項目ごとに整理して」といった指示で結果を得られる点が従来の手段との違いです。

ページの構造が少し変わっても対応できる柔軟さがある一方、同じ入力に対して毎回まったく同じ結果になるとは限りません。件数や桁が合っているかを確認する工程を必ず挟んでください。

現時点で相性がよいのは、毎日決まった形式で回す定型処理よりも、調査のたびに対象が変わる一時的な収集です。定型業務にはPADやPower Query、都度の調査にはAI、という使い分けが現実的なところです。

どれを選ぶかの判断基準

判断の軸は3つです。1つ目は対象ページの構造で、整った表になっているならPower Query、そうでないならPADやプログラムが候補になります。

2つ目は操作の必要性です。ログイン、検索条件の入力、ボタンのクリックが必要ならブラウザを動かせる手段が要ります。3つ目は実行頻度と件数で、毎日大量に処理するならAPIや専用の仕組み、週1回数十件ならPADで十分です。

迷ったときは、最も手間のかからない手段から試すのが鉄則です。まずExcelの「Webから」で取れないかを確認し、だめならPAD、それでも要件を満たせない場合に他の手段を検討する。この順で進めれば、無駄な作り込みを避けられます。

Power Automate for desktopでの抽出手順

ここからは、PADの「Webページからデータを抽出する」アクションを使った具体的な手順を追います。ブラウザの起動、抽出対象の指定、出力先の設定という3ステップで、最小構成の抽出フローができあがります。

事前準備:ブラウザ拡張機能を有効にする

PADからブラウザを操作するには、対象ブラウザ向けの拡張機能をインストールしておく必要があります。PADのメニューから該当ブラウザの拡張機能ページを開き、有効化してください。ここを飛ばすと、後の手順で要素が選択できません。

対応しているのはMicrosoft Edge、Google Chrome、Mozilla Firefoxなどです。社内で拡張機能の追加に承認が必要な場合は、先に申請を済ませておくとスムーズに進みます。

ブラウザを起動するアクションを追加する

フローの編集画面で、アクション一覧の「ブラウザー自動化」を開きます。「新しいMicrosoft Edgeを起動する」をドラッグアンドドロップし、初期URLに対象ページのアドレスを入力して保存します。

他の項目は既定のままで構いません。ここで生成されるブラウザーインスタンスの変数が、以降のブラウザー操作アクションで対象を特定する役割を持ちます。複数のページを扱う場合は、変数名を分かりやすく変更しておくと混乱を防げます。

抽出対象をライブWebヘルパーで指定する

続けて「Webデータ抽出」グループから「Webページからデータを抽出する」を追加します。パラメーター画面を開いたまま、起動済みのブラウザを前面に出すとライブWebヘルパーが立ち上がります。

ページ上で取りたい箇所にカーソルを合わせると赤い枠が表示されるので、右クリックして「要素の値を抽出」からテキストなどを選びます。1件目を指定した後に同じ列の2件目を指定すると、3件目以降もPADが自動で抽出対象として認識します。

複数の列を取りたい場合は、同じ操作を列ごとに繰り返します。ライブWebヘルパーには抽出結果のプレビューが表示されるので、意図した値が並んでいるかをここで確認してください。列名を設定することもできるので、後工程で扱いやすい名前を付けておきます。

出力先を決めて実行する

対象の指定が終わったらライブWebヘルパーを閉じ、アクションのパラメーターを設定します。データ保存モードでは、フロー内の変数に格納するか、新しいExcelスプレッドシートへ直接書き出すかを選べます。

変数に格納した場合はDataTable型として扱われるため、そのまま条件で絞り込んだり、既存のExcelファイルへ追記したりできます。とりあえず結果を眺めたいだけならExcel出力、後続の処理につなげたいなら変数、と使い分けます。

本番のページでいきなり試すのではなく、まずは数件だけ取得して結果を確認してください。抽出対象の指定が1つずれているだけで、まったく違う値が並ぶことがあります。プレビューで見えていた内容と、実行結果が一致しているかを突き合わせておくと安心です。

最後に「Webブラウザーを閉じる」アクションを置いて、処理の終わりにブラウザを終了させます。ここを入れておかないと、実行のたびにブラウザが残り続けます。公式の解説はMicrosoft Learn「Web ページの自動化」にまとまっています。

▼ 自社の情報収集業務に合う進め方を相談したい方へ
どの業務から自動化すべきか、どのツールで組むべきかは、対象サイトや運用体制によって答えが変わります。
現状をうかがったうえで、無理のない進め方をご提案します。
> 相談予約はこちら

複数ページ・大量データを扱うときの設定

1ページ分が取れたら、次は実務で必要な範囲へ広げます。ページャーの設定、抽出件数の指定、データ整形オプションの3点を押さえると、一覧サイトからのまとまった取得ができるようになります。

ページャーを設定して次ページをたどる

検索結果が複数ページに分かれている場合、初期設定のままでは1ページ目しか取得できません。ライブWebヘルパーで次ページへのリンクを選び、右クリックから「要素をページャーとして設定」を選ぶと、自動で次のページへ進みながら抽出を続けます。

設定後は、パラメーター側で「使用可能なすべてのページ」から取るか、「特定の数のページ」だけ取るかを選択します。件数が読めないサイトでは、まず数ページに限定して試し、想定どおり動くことを確認してから範囲を広げるほうが安全です。

ページ送りがボタンではなくスクロールで行われるサイトでは、この方法が使えません。その場合は、スクロール操作のアクションを組み合わせるか、別の手段を検討することになります。

抽出時のデータ整形オプション

アクションのパラメーターには、「抽出時にデータを処理する」というオプションがあります。有効にすると、余分な空白や不要な文字を取り除いた状態で値を受け取れます。

ただし、このオプションは大量のデータを扱う際の処理速度に影響します。件数が多いフローでは、抽出はそのまま行い、整形は後続の処理やExcel側で済ませるほうが全体としては速くなる場合があります。

金額や日付を数値として扱いたい場合は、抽出直後の値が文字列であることを前提に、明示的に変換する処理を入れておきます。カンマや単位が混ざったまま集計しようとして合計が合わない、というのはよくある落とし穴です。

取得したデータをExcelへ蓄積する

毎回新しいExcelに出力するのではなく、既存の台帳へ追記していきたい場合は、変数に格納したうえで、Excelアクションと組み合わせる構成にします。最終行を取得してから書き込む流れです。

取得日時の列を追加しておくと、後から推移を追えるようになります。同じデータを重複して追記しないよう、キーとなる項目で既存行の有無を確認する処理も入れておくと安心です。

PADでのExcel書き込みの具体的な手順は、アクションの組み合わせ方まで含めて別途整理が必要です。抽出と書き込みを分けて設計しておくと、どちらか一方が壊れたときの切り分けが楽になります。

うまく抽出できないときの対処

実際に試すと、思ったとおりに値が取れない場面に必ず出くわします。原因はページの作りに起因するものがほとんどで、症状ごとに対処法が決まっています。代表的なパターンを整理します。

要素が選択できない・枠が出ない

ライブWebヘルパーが起動しない、赤い枠が表示されないという場合、まず疑うのはブラウザ拡張機能の状態です。インストール済みでも無効化されていると動きません。ブラウザの拡張機能管理画面で有効になっているかを確認してください。

ページの読み込みが終わっていないタイミングで操作しようとしている可能性もあります。ブラウザ起動のアクションの後に待機を挟むか、特定の要素が表示されるまで待つアクションを入れると安定します。

1件目しか取れない・列がずれる

2件目を指定しても一覧として認識されない場合、リストの各行のHTML構造が揃っていないことが原因です。広告行が混ざっている、一部だけ装飾が違う、といったケースで起きます。

対処としては、指定する要素を1段階上や下の階層に変えて試す方法があります。それでも安定しないときは、ページ全体のテキストを取得してから必要な部分を切り出す構成に切り替えるほうが早い場合もあります。

画面に見えている値が取れない

表示はされているのに抽出できない場合、その部分が後から読み込まれる仕組みになっている可能性があります。スクロールに応じて追加表示される一覧や、操作後に書き換わる領域が該当します。

この場合は、スクロールやクリックのアクションを先に実行し、値が表示された状態にしてから抽出します。別の枠として埋め込まれている領域の場合は、その枠を対象として指定し直す必要があります。

文字化けや余計な記号が混ざる

取得した値に改行や連続した空白、通貨記号が混ざることはよくあります。「抽出時にデータを処理する」オプションである程度は整えられますが、それでも残る場合は取得後に置換処理を入れて対応します。

数値として扱いたい項目は、カンマや単位を取り除いてから変換します。日付も表記が揺れやすいため、取得直後に統一しておくと後工程が安定します。

しばらく動いていたのに突然止まった

最も多いのが、対象サイト側のデザイン変更で要素の位置が変わったケースです。Webページからのデータ抽出は、相手の作りに依存する以上、この種の停止は避けられないものと考えておく必要があります。

対策は、壊れることを前提に設計しておくことです。取得件数が0件だった場合に通知を飛ばす、前回との差が大きすぎたら警告する、といった仕組みを入れておけば、気づかないまま空のデータで集計していたという事態を防げます。

ログイン後のページを対象にしている場合は、認証情報の失効や二要素認証の追加でも止まります。認証まわりの変更予定は、情報システム部門と共有しておくと復旧が早くなります。

▼ 「このサイトから自動で取れるか」から相談できます
対象ページの作りによって、実現可能性も適したツールも変わります。
要件の整理段階からご相談いただけます。
> 相談予約はこちら

実施前に確認すべき規約と法律の論点

技術的に取得できることと、取得してよいことは別の問題です。業務で継続的に行うのであれば、着手前に確認しておくべき論点がいくつかあります。ここを飛ばすと、後から差し止めやトラブルにつながりかねません。

サイトの利用規約を確認する

最初に見るべきは対象サイトの利用規約です。自動化ツールによるアクセスやデータの複製を明示的に禁止しているサイトは珍しくありません。禁止されている場合、技術的に可能かどうかにかかわらず、契約上の問題になります。

あわせて、サイトのルート直下に置かれるrobots.txtも確認します。これは本来クローラー向けの案内ですが、サイト運営者がどこへの自動アクセスを想定していないかを示す手がかりになります。

法人向けのデータ提供メニューが用意されているサイトもあります。継続利用が前提なら、無理に抽出するより正規のルートで取得したほうが、安定性の面でも結果的に有利です。

著作権法上の位置づけ

日本の著作権法には、情報解析を目的とする利用について権利制限を定めた規定があります。著作権法第30条の4では、著作物に表現された思想や感情を享受することを目的としない利用について、必要と認められる限度で利用できるとされています(出典:e-Gov法令検索「著作権法」)。

ただし、この規定には但し書きがあり、著作物の種類や用途、利用の態様に照らして著作権者の利益を不当に害することとなる場合は適用されません。何でも自由に取得・利用してよいという意味ではない点に注意が必要です。

取得したデータをそのまま自社サイトに転載する、元サイトの代替となる形で公開する、といった使い方は別の問題を生みます。抽出そのものより、取得後の使い方のほうが論点になりやすいと考えておいてください。判断に迷う場合は、自社の法務部門や専門家に確認することをおすすめします。

サーバーへの負荷に配慮する

短時間に大量のアクセスを繰り返すと、相手方のサーバーに負荷をかけ、業務を妨げたと判断される可能性があります。1件ごとに数秒の待機を入れる、深夜など負荷の低い時間帯に実行する、といった配慮が必要です。

必要な範囲を超えて全ページを巡回していないかも見直します。本当に必要なのは新着分だけであれば、更新日時で絞り込むだけでアクセス数は大幅に減らせます。

個人情報を含む場合の扱い

氏名やメールアドレスなど、個人を識別できる情報を取得する場合は、個人情報保護法上の取り扱いが発生します。公開されている情報であっても、取得して自社で管理する時点で義務が生じる点は変わりません。

利用目的の特定、安全管理措置、第三者提供の制限といった要件を満たせるかを、着手前に確認してください。営業リストの作成を目的とする場合は特に、社内のルールと照らし合わせておく必要があります。

▼ 規約やリスクの確認も含めて相談できます
「この方法で進めて問題ないか」「社内ルールとどう整合させるか」といった判断も含めて、実務目線でご相談を承っています。
> 相談予約はこちら

実務での活用シーンと設計のコツ

手段と注意点が整理できたら、次は何に使うかです。効果が出やすいのは、頻度が高く、取得先が固定されていて、判断を伴わない収集業務です。代表的な場面を見ていきます。

公的機関の統計データを定期取得する

統計や公示情報を毎月転記している業務は、自動化の効果が分かりやすい領域です。多くの公的機関はCSVやAPIでのデータ提供も行っているため、まずはそちらが使えないかを確認してください。

提供形式が決まっていれば、ページの解析に頼るより格段に安定します。抽出はあくまで、正規の提供手段がない場合の選択肢と考えるのが健全です。

自社サイトや掲載情報の点検

自社が運営するサイトや、自社の情報が掲載されているページの状態を定期的に確認する使い方もあります。掲載内容が意図したとおりか、リンクが切れていないかを機械的にチェックできれば、目視での巡回が不要になります。

自社サイトが対象であれば規約上の懸念も小さく、最初の一本として取り組みやすい題材です。

競合や市場情報の定期チェック

競合の価格改定や新商品の掲載、業界サイトの新着情報を定期的に確認する使い方も一般的です。毎回ゼロから見に行くのではなく、前回との差分だけを通知する構成にすると、確認する側の負担が大きく減ります。

ただし、この用途は対象サイトの利用規約に抵触しやすい領域でもあります。取得の可否を確認したうえで、アクセス頻度を必要最小限に抑える設計にしてください。

取得したデータをどう使うかまで設計する

抽出そのものが目的化してしまい、溜めたデータを誰も見ていないという状態はよく起きます。取得した後に誰が何を判断するのかを先に決めてから、収集の仕組みを作ってください。

必要な項目だけに絞れば、フローもシンプルになり、壊れにくくなります。念のために全部取っておく、という発想は保守コストを押し上げるだけです。業務全体の見直し方は業務効率化アイデア55選の記事でも整理しています。

継続して運用するための体制

Webページからのデータ抽出は、相手方の都合で壊れることが前提の仕組みです。作って終わりにせず、止まったときに直せる状態をどう保つかが運用の要になります。

壊れたことに気づける仕組みを入れる

エラーが出て止まるならまだ発見できますが、件数が0件のまま正常終了してしまうケースが最も危険です。取得件数をチェックし、想定を大きく下回ったら通知を飛ばす処理を入れておいてください。

実行のたびに日時と件数をログに残しておくと、いつから異常が始まったかを後から追えます。数行の記録を足すだけで、復旧にかかる時間は大きく変わります。

仕様と判断の根拠を残す

どのサイトのどのページから、どの項目を、どの頻度で取得しているのか。そして、なぜその取得が許容されると判断したのかを1枚のメモにまとめておきます。担当が変わったときに、判断からやり直さずに済みます。

利用規約を確認した日付も記録しておいてください。規約は改定されるため、一度確認したから永久に問題ないとは限りません。定期的な見直しの機会を運用に組み込んでおくと安全です。

作れる人と直せる人を分けない

内製した仕組みで最も多い失敗は、作成者の異動とともに誰も触れなくなることです。部署内に最低2人は中身が分かる人を置き、レビューを通じて設計意図を共有しておくことが、結果的に最も確実な対策になります。

外部への丸投げを続けると、サイト側の小さな変更のたびに費用と時間がかかる構造になります。最初の数本を伴走しながら一緒に作り、社内に作れる人を育てる進め方が現実的です。育て方の考え方はAI研修の目的と選び方をまとめた記事も参考にしてください。

まとめ

Webページからデータを抽出する手段は、RPAツールでブラウザを操作する方法、ExcelやPower Queryで取り込む方法、ブラウザ拡張機能、APIやプログラム、生成AIやAIエージェントの5つに整理できます。対象ページの構造、操作の必要性、実行頻度の3点で選び分けてください。

Power Automate for desktopを使う場合は、ブラウザ拡張機能を有効にしたうえで、ブラウザを起動し、ライブWebヘルパーで抽出対象を指定します。複数ページに分かれている一覧は、次ページのリンクをページャーとして設定すれば自動でたどれます。

一方で、ページの作りに依存する以上、相手側の変更で止まることは避けられません。取得件数のチェックと通知を最初から組み込み、壊れたときに気づける状態を作っておくことが前提になります。

そして、技術的に取得できることと取得してよいことは別です。利用規約、著作権法上の位置づけ、サーバーへの負荷、個人情報の扱い。この4点を着手前に確認し、判断の根拠を記録として残しておけば、安心して運用を続けられます。

AIコンサル・AX伴走支援サービスご紹介資料

社外AI役員サービスご紹介資料
  • サービス資料のページ例:社外AI役員とは
  • サービス資料のページ例:AI活用による企業変革の支援内容

この資料でこんなことがわかります!

  • 社外AI役員とは
  • 支援内容
  • 導入の進め方
  • 導入実績・効果

\3ステップで簡単入力/

▼ 情報収集の自動化を、社内に定着する形で進めませんか
株式会社ネクストスケールでは、業務の棚卸しから自動化の設計、社内への定着支援までを一貫してご支援しています。
何から手をつけるべきか整理したい段階でも構いません。まずはお気軽にご相談ください。
> 相談予約はこちら

この記事の監修者

石丸真平

石丸真平

株式会社ネクストスケール 代表取締役

株式会社ネクストスケールの代表。「AI時代に勝てる企業組織を共に創る」を掲げ、法人向けの生成AI研修とAX(AIによる企業変革)の伴走支援を手がける。経営課題の整理からAI活用領域の設計、ツール選定、業務への組み込み、社内定着、ROI測定までを一気通貫で支援。単なる効率化ではなく、経営戦略としてAIを活かす視点での支援を得意とする。Xでは「本当に仕事で使えるAI」をテーマに、実務で使えるノウハウを発信している。
この記事をシェアする
  • URLをコピーしました!

関連事例

他の成功事例を見る
目次

AI活用を経営成果につなげる
実践ヒントがわかる資料

社外AI役員の支援内容や導入の進め方を、わかりやすくご紹介します。

  1. 資料表紙

必要事項をご入力ください

フォームを読み込んでいます…