- Wayback Machine は、Alexa Internet と共同で開発され、複数の期間のウェブページをアーカイブし、ユーザーが閲覧できるようにする三次元インデックスを作成することで、デジタルタイムカプセルとして機能します。
- Internet Archive は、公開されているウェブページに焦点を当て、パスワードで保護されたページやフォームからしかアクセスできないページを除外し、ロボットを尊重しています。
- Internet Archive は書籍もデジタル化し、文学作品やその他の資料の膨大なコレクションへの無料アクセスを提供することで、情報への普遍的なアクセスという使命を追求しています。
Wayback Machine は、Internet Archive と Alexa Internet によって開発され、公開ウェブページのスナップショットをキャプチャして保存するためにクローラーを使用してウェブを保存します。すべてのページをキャプチャできるわけではありませんが、3,300 億以上のウェブページとその他数百万のデジタルアイテムからなる膨大なリポジトリは、世界中の書籍デジタル化センターによって支えられ、研究や保存にとって重要なリソースを提供しています。
ウェブのためのタイムカプセル
Wayback Machine は、Alexa Internet と共同で開発された Internet Archive の中心的な機能です。これは、ユーザーが複数の期間にわたってウェブ文書を閲覧できるようにする三次元インデックスを作成することで機能します。このユニークな能力により、Wayback Machine はデジタルタイムカプセルとなり、時間の経過とともにウェブページの状態をキャプチャして保存します。ユーザーが Wayback Machine にアクセスすると、URLを入力し、そのページのアーカイブされたバージョンを表示することで、歴史のさまざまな時点での外観を見ることができます。
プロセスは、インターネットを巡回し、公開ウェブページのスナップショットを撮るクローラーから始まります。
こちらもお読みください:このデータサイエンティストは、インターネット測定の歴史に関するアーカイブを構築したいと考えています
こちらもお読みください:インターネットが利用可能にしたリソースとは?
ウェブアーカイブの範囲と限界
Internet Archive はすべてのウェブサイトをキャプチャするわけではなく、公開アクセス可能なページに焦点を当てています。パスワードが必要なページ、フォーム経由でのみアクセス可能なページ、または安全なサーバー上にあるページは、通常アーカイブに含まれません。さらに、 robots.txt ファイルによってクローラーにアーカイブしないよう指示されているために除外されるページや、所有者からの要請により除外されるサイトもあります。
これらの制限にもかかわらず、Internet Archive は自動化されたクローラーを使用して、可能な限り多くの公開ウェブコンテンツを収集するよう努めています。これらのクローラーは継続的にデータを収集し、ウェブページのスナップショットの膨大なリポジトリを作成します。Internet Archive の使命は、すべての知識への普遍的なアクセスを提供することであり、それがデジタル世界を記録し保存するための多大な努力を導いています。
ウェブページを超えて – 書籍のデジタル化など
ウェブアーカイブの取り組みに加えて、Internet Archive は書籍のデジタル化プロジェクトにも深く関わっています。同団体は、世界最大級の書籍デジタル化事業を運営しており、大量の印刷資料を保存し、アクセスを提供することを目指しています。これらのプロジェクトは、図書館やその他の情報源から書籍をデジタル化し、誰もがオンラインでアクセスできるデジタル形式に変換することを含みます。
デジタル化された書籍は、Internet Archive のプラットフォームを通じて利用可能になり、ユーザーは無料でそれらを読んだりダウンロードしたりできます。この取り組みは、文学作品を保存するだけでなく、知識へのアクセスを民主化し、すべての情報への普遍的なアクセスを提供するというアーカイブの使命と一致しています。

