オープンソースプロジェクト
webrecorder/browsertrix-crawler avatar
webrecorder/browsertrix-crawler

Browsertrix Crawler:単一のDockerコンテナで動作するブラウザアーカイブクローラー

単一の Docker コンテナーで、忠実度の高いブラウザーベースの Web アーカイブ クローラーを実行します。

スター 1,136フォーク 151TypeScriptAGPL-3.0

ひと目でわかる

これは何?
Browsertrix Crawler は、単一のDockerコンテナ内でカスタマイズ可能なブラウザベースのクロールを実行し、Puppeteer を使用して Brave ブラウザを制御し、Chrome DevTools Protocol を介してデータをキャプチャします。
誰に向いている?
このプロジェクトはAGPLv3以降のライセンスで提供され、ドキュメントは別のサイトにあります。README は概要と歴史を説明し、セットアップや使用方法の詳細はドキュメントに委ねられています。
商用利用できる?
厳しい条件付きでできます。AGPL-3.0 はネットワーク型コピーレフトのライセンスで、改変版をホスティングサービスなどとしてネットワーク越しに利用させる場合、その利用者にソースコードを同じライセンスで提供する必要があります。
今もメンテナンスされている?
されています。最後のコミットは 4 日前です。
何の言語で書かれている?
主に TypeScript です(GitHub の言語統計による)。

回答はプロジェクトの GitHub データ(最終同期:2026年9月14日)と当サイトの分析に基づくもので、法的助言ではありません。

オープンソース詳細解説

Browsertrix Crawler:ブラウザ駆動のアーカイブクローラー

Browsertrix Crawler は、単一のDockerコンテナ内で複雑でカスタマイズ可能なクロールを実行するように設計された、スタンドアロンのブラウザベースのクロールシステムです。README はこれを高忠実度クローラーと説明しており、静的HTTPフェッチに頼るのではなく、実際のブラウザがレンダリングする方法でページを保存することを目的としています。このプロジェクトはTypeScriptで書かれており、Webrecorder のコアコンポーネントとして保守され、Zimit プロジェクトから分離されました。README には、コマンド例や出力形式のリストはなく、システムの目的を説明し、使用方法についてはドキュメントを参照しています。単一コンテナ設計は明示されており、これはデプロイメントモデルの重要な部分です。README は、Docker 以外の特定のオペレーティングシステム要件についても言及しておらず、ソースからイメージをビルドする方法も説明していません。これらの詳細はドキュメントに委ねられています。、README にはパフォーマンスベンチマークやセキュリティ保証は記載されておらず、ユーザーはドキュメントやソースコードを参照する必要があります。

Browsertrix Crawler:クローラーがページをキャプチャする方法

クローラーは Puppeteer を使用して、1つ以上の Brave ブラウザウィンドウを並行して制御します。ページのレンダリング中に Chrome DevTools Protocol (CDP) を介してデータをキャプチャします。この組み合わせにより、JavaScript や動的な動作に依存するコンテンツを記録できます。ブラウザが実際にページを実行するため、クローラーは生のHTMLだけでなくレンダリングされた状態をキャプチャできます。README は、クローラーが1つ以上のブラウザウィンドウを制御できると述べており、並列実行を示唆していますが、ワークロードがどのように分散されるかは説明していません。また、具体的なクロール設定オプション、コマンドライン引数、出力形式もリストされておらず、これらは別のドキュメントサイトに記載されています。README は、認証、セッション処理、その他の一般的なWebアーカイブ機能をサポートするかどうかについては述べておらず、ユーザーはこれらの機能についてドキュメントを参照する必要があります。

Browsertrix Crawler:サポートの歴史とプロジェクトの系譜

0.x バージョンの初期サポートは Kiwix から提供され、Portico は 0.4.x の開発を含む追加サポートを提供しました。元の機能は、Webrecorder と Kiwix の協力により Zimit プロジェクトのために構築され、その後 Browsertrix Crawler は Zimit から分離されて独立したコンポーネントになりました。README には、これらの歴史的な貢献以外の現在のスポンサーやメンテナンス体制は記載されておらず、最新の安定版がどれかも指定されていません。ただし、このプロジェクトが Webrecorder のコアコンポーネントであると述べており、これは組織のより広範なアーカイブ作業の中に位置づけられています。README には貢献ガイドラインや行動規範もなく、開発情報についてはドキュメントを参照するだけです。、README にはバージョン履歴や変更ログの詳細は記載されていません。

Browsertrix Crawler:ライセンスと再配布条件

このリポジトリは、README と添付の LICENSE ファイルに記載されているように、AGPLv3 以降のライセンスの下で提供されています。README は明示的に「AGPLv3 以降」と述べており、そのバージョンまたはそれ以降のライセンスバージョンでの使用を許可しています。AGPLv3 はコピーレフトライセンスであり、特に、変更版を実行するネットワークサーバーの運用者は、そのサーバーのユーザーに対応するソースコードを提供する必要があります。ライセンス文は、ソフトウェアが保証なしで提供されることを述べており、ライセンスに定められた条件の下で複製、配布、変更する権利を付与します。ライセンスはサポートやメンテナンスの義務を提供するものではなく、コードの配布と変更のみを管理します。README には、商用サポート製品やエンタープライズ機能については記載されていません。

Browsertrix Crawler:ドキュメントとリポジトリの状態

README は、使用法と開発手順についてホストされている Browsertrix Crawler ドキュメントを参照し、ドキュメントをローカルで構築する方法を説明する別のリンクを含んでいます。リポジトリのメタデータは、提供されたスナップショット時点で 1100 スター、147 フォーク、143 のオープンイシューを示し、デフォルトブランチは main です。README 自体にはインストールやクイックスタートのコマンドは含まれておらず、その情報についてはドキュメントサイトを参照するように読者を誘導しています。リポジトリのメタデータに記載されているホームページ URL はドキュメントサイトであり、これはクローラーを実行するための主要な参照です。このリポジトリはアーカイブされておらず、メタデータによるとプロジェクトは積極的に保守されていますが、README にはリリースの頻度や変更ログは記載されていません。README には、コードへの貢献方法や問題の報告方法も説明されていません。これらの情報はドキュメントサイトにある可能性があります。

編集部の結論

このプロジェクトはAGPLv3以降のライセンスで提供され、ドキュメントは別のサイトにあります。README は概要と歴史を説明し、セットアップや使用方法の詳細はドキュメントに委ねられています。 Browsertrix Crawler を選ぶ対象は、README に明記された機能と依存環境が一致するチームです。導入前に、Browsertrix Crawler の README にある具体的なインストール入口と設定例を実行し、想定する入力、出力、権限、保存先が手元の運用条件で一致するかを確認してください。

公式情報源

  1. Official documentation
  2. Official README
  3. Project repository
  4. Release notes
コミュニティノート

コミュニティノート