• Wayback Machine, созданная совместно с Alexa Internet, работает как цифровая капсула времени: она формирует трёхмерный индекс, который архивирует веб-страницы и позволяет просматривать их состояния за разные периоды времени.
  • Internet Archive сосредоточен на общедоступных веб-страницах, не включая страницы, скрытые за паролями или формами, и соблюдая требования robots.txt.
  • Internet Archive также оцифровывает книги, предоставляя свободный доступ к обширной коллекции литературных произведений и других материалов — это продолжает его миссию по обеспечению всеобщего доступа к информации.

Wayback Machine, разработанная Internet Archive и Alexa Internet, сохраняет веб-контент с помощью веб-краулеров, которые фиксируют и хранят снимки общедоступных веб-страниц. Она не может сохранить каждую страницу, но её обширный архив, насчитывающий более 330 миллиардов веб-страниц и миллионы других цифровых материалов, предоставляет широкие возможности для исследований и сохранения; его работа поддерживается центрами оцифровки книг по всему миру.

Капсула времени для веб-страниц

Wayback Machine, разработанная совместно с Alexa Internet, — ключевая функция Internet Archive. Она формирует трёхмерный индекс, позволяющий просматривать веб-документы за разные периоды времени. Эта уникальная возможность превращает Wayback Machine в цифровую капсулу времени, которая фиксирует и сохраняет состояние веб-страниц с течением времени. Пользователь может ввести в Wayback MachineURLи увидеть архивные версии страницы — так можно проследить, как она выглядела в разные моменты истории.

Процесс начинается свеб-краулеров, которые обходят интернет и делают снимки общедоступных веб-страниц.

Читайте также:Этот специалист по данным хочет создать архив об истории измерений интернета

Читайте также:Какие ресурсы предоставил интернет?

Охват и ограничения веб-архивирования

Internet Archive сохраняет не все сайты в интернете: его внимание сосредоточено на общедоступных страницах. Страницы, требующие пароля, доступные только после отправки формы или находящиеся на защищённых серверах, как правило, в архив не включаются. Кроме того, некоторые страницы исключаются из-за файла robots.txt, который запрещает веб-краулерам архивировать их, а отдельные сайты исключаются по просьбе владельцев.

Несмотря на эти ограничения, Internet Archive стремится собрать как можно больше публичного веб-контента с помощью автоматических веб-краулеров. Эти краулеры непрерывно собирают данные, формируя обширный архив снимков веб-страниц. Миссия Internet Archive — обеспечить всеобщий доступ ко всем знаниям, и именно она определяет масштабные усилия по документированию и сохранению цифрового мира.

Больше, чем веб-страницы: оцифровка книг и другие проекты

Помимо веб-архивирования, Internet Archive активно занимается оцифровкой книг. Он реализует один из крупнейших в мире проектов по оцифровке книг, стремясь сохранить огромные объёмы печатных материалов и обеспечить к ним доступ. В рамках этих проектов книги сканируются в библиотеках и других источниках и переводятся в цифровые форматы, доступные любому пользователю онлайн.

Оцифрованные книги публикуются на платформе Internet Archive, где их можно бесплатно читать и скачивать. Эта инициатива не только сохраняет литературные произведения, но и демократизирует доступ к знаниям, что соответствует миссии Архива — обеспечить всеобщий доступ ко всей информации.