Web ARChive

Web ARChive
Dateiendung: .warc
MIME-Type: application/warc[1]
Standard(s): ISO 28500:2017[2]
https://github.com/iipc/awesome-web-archiving

Das Archivformat Web ARChive (WARC) spezifiziert ein Verfahren zum Kombinieren mehrerer digitaler Ressourcen in einer aggregierten Archivdatei mit zugehörigen Metadaten. Das WARC-Format ist eine Überarbeitung des ARC-Dateiformats des Internet Archive, das traditionell zum Speichern von „Webcrawls“ als Sequenzen von Inhaltsblöcken aus dem World Wide Web verwendet wird. Das WARC-Format verallgemeinert das ältere Format, um die Anforderungen von Archivierungsunternehmen für die Erfassung, den Zugriff und den Austausch besser zu unterstützen. Neben dem aktuell aufgezeichneten Primärinhalt berücksichtigt die Revision auch verwandte Sekundärinhalte, wie zugewiesene Metadaten.

Die Library of Congress verzeichnet das Format in ihrem Projekt „Sustainability of Digital Formats“.[3]

WARC wird heute von den meisten nationalen Bibliothekssystemen als Standard für die Webarchivierung anerkannt. So nutzt es beispielsweise die Bayerische Staatsbibliothek in ihren Archivierungsprojekten,[4] und es wird als Standard für die Langzeitarchivierung empfohlen.[5]

Aufbau

Eine WARC-Datei besteht aus einem oder mehreren Records. Ein Record besteht dabei aus:

  • Kopfzeile bzw. Header, in dem verpflichtende Metadatenfelder (unter anderem die URL, das Datum, Typ und Länge des Records) eingetragen werden.
  • dem Content-Block, in dem der eigentliche Inhalt steht. Hier liegt im sogenannten "WARC record payload" die gespeicherte Ressource vor.

Im Standard werden acht verschiedene Record-Typen vordefiniert:

  1. warcinfo – Befindet sich in der Regel am Anfang der WARC-Datei. Der Record enthält allgemeine Informationen über die darauffolgenden Records, normalerweise also über die Datei selbst. Zu den Metadaten gehören u. a. Name und E-Mail-Adresse des Erstellers, außerdem Useragent, IP-Adresse, HTTP-Header und Software, die bei der Archivierung der Daten verwendet wurden.
  2. response – Enthält die vollständige Antwort (Response nach Client-Server-Modell) eines Webservers inklusiver ausführlicher Netzwerk- und Protokollinformationen. Folglich befinden sich in dessen Content-Blocks meist die zu speichernde Ressource.
  3. resource – Falls es nicht möglich oder nicht erwünscht ist, sämtliche Protokollinformationen mit zu speichern, ist ein Ressource-Record für die einfache Speicherung einer Ressource optimal.
  4. request – Gegenstück zum Response-Record. Enthält Anfrage und zugehörige Informationen, die zur Zeit des Crawls an den Webserver gesendet wurden.
  5. metadata – Beliebige Metadaten werden hier abgelegt. Fast immer beziehen sich diese auf einen anderen Record, welcher über die Felder WARC-Concurrent-To oder WARC-Refers-To.
  6. revisit – Wird typischerweise verwendet, falls ein schon archivierter Inhalt nochmals besucht wird. Dabei wird relativ zur schon archivierten Ressource nur ein gekürzter Content-Block gespeichert. Dadurch kann unnötige Redundanz vermieden und Speicherplatz gespart werden.
  7. conversion – Zweck eines Conversion-Records ist es, die Inhalte eines vorhandenen Records in einem anderen Format zu speichern.
  8. continuation – Der Continuation-Record (englisch für Fortsetzung) ermöglicht es, große Datenmengen über mehrere WARC-Dateien zu verteilen.

Zwar spezifiziert der WARC-Standard keine Kompression, jedoch kann diese ohne Probleme zur Reduzierung der Speichermenge verwendet werden. Empfohlen wird dabei vom IIPC das GZIP-Format. Deshalb findet man WARC-Dateien öfters mit der Dateiendung ".warc.gz" vor.

Software

Onlinedienste

Einzelnachweise

  1. application/warc. Abgerufen am 17. März 2018 (englisch).
  2. Information and documentation -- WARC file format. Abgerufen am 16. März 2018 (englisch).
  3. Format Description Categories - Sustainability of Digital Formats | Library of Congress. Abgerufen am 6. Juni 2023.
  4. Tobias Beinert: Webarchivierung an der Bayerischen Staatsbibliothek. In: Bibliotheksdienst. Band 51, Nr. 6, 1. Juni 2017, ISSN 2194-9646, S. 490–499, doi:10.1515/bd-2017-0052 (degruyter.com [abgerufen am 6. Juni 2023]).
  5. Konstanze Weimer, Astrid Schoger: Das Dateiformat WARC für die Webarchivierung. Hrsg.: Bayerische Staatsbibliothek. 26. April 2021 (dnb.de [PDF]).
  6. Giuseppe Scrivano: GNU wget 1.14 released. In: GNU wget 1.14 released. Free Software Foundation, Inc., 6. August 2012, abgerufen am 25. Februar 2016 (englisch).
  7. ArchiveBox. Abgerufen am 22. April 2026 (amerikanisches Englisch).
  8. WebsiteArchiver - Speichern & Organisieren. Abgerufen am 22. April 2026.

Content Disclaimer

Informasi ini disarikan dari Wikipedia dan disajikan kembali untuk tujuan edukasi. Konten tersedia di bawah lisensi CC BY-SA 3.0. Kami tidak bertanggung jawab atas ketidakakuratan data yang bersumber dari kontribusi publik tersebut.

  1. The information displayed on this website is sourced in part or in whole from Wikipedia and has been adapted for the purpose of restating it. We strive to provide accurate and relevant information, however:
  2. There is no guarantee of absolute accuracy. Wikipedia is an open, collaborative project that can be edited by anyone, so information is subject to change.
  3. It is not intended to constitute professional advice. The content displayed is for informational and educational purposes only. For important decisions (e.g., medical, legal, or financial), please consult a professional.
  4. Content copyright. Wikipedia is licensed under the Creative Commons Attribution-ShareAlike License (CC BY-SA). This means that content may be reused with appropriate attribution and shared under a similar license.
  5. Responsible use. Any risk arising from the use of information from this website is entirely the responsibility of the user.