web_archive

Common-Crawl- und Wayback-Machine-Webarchiv-CDX-APIs direkt aus SQL abfragen

Maintainer: onnimonni

Installation und Laden

INSTALL web_archive FROM community;
LOAD web_archive;

Beispiel

-- Find archived pages from Wayback Machine
SELECT url, timestamp, statuscode
FROM wayback_machine()
WHERE url LIKE 'example.com/%'
AND statuscode = 200
LIMIT 10;
-- One snapshot per year using DISTINCT ON pushdown
SELECT DISTINCT ON(year) url, timestamp
FROM wayback_machine()
WHERE url = 'github.com/duckdb/duckdb'
AND statuscode = 200
LIMIT 5;
-- Query Common Crawl index
SELECT url, timestamp, mimetype
FROM common_crawl_index()
WHERE url LIKE '%.example.com/%'
AND statuscode = 200
LIMIT 10;

Über web_archive

Diese Erweiterung stellt zwei Tabellenfunktionen zum Abfragen von Webarchiv-CDX-APIs bereit:

  • wayback_machine(): Internet Archive Wayback Machine abfragen (1996 bis heute)
  • common_crawl_index(): Common-Crawl-Archiv abfragen (2008 bis heute, monatliche Snapshots)

Funktionen:

  • DISTINCT-ON-Pushdown: DISTINCT ON(year) wird zu &collapse=timestamp:4
  • Filter-Pushdown: WHERE-Klauseln für statuscode/mimetype werden an die CDX-API durchgereicht
  • LIMIT-Pushdown: es werden nur die angeforderten Datensätze abgerufen
  • SELECT-Pushdown: über den Parameter &fl= werden nur benötigte Spalten abgerufen
  • Antwortabruf: archivierte Seiteninhalte über response.body herunterladen
  • Virtuelle Spalten: year und month aus dem Zeitstempel extrahiert

Die vollständige Dokumentation finden Sie im Erweiterungs-Repository.

Hinzugefügte Funktionen

function_name function_type description comment examples
common_crawl_index table NULL NULL
wayback_machine table NULL NULL

Überladene Funktionen

Diese Erweiterung fügt keine Funktionsüberladungen hinzu.

Hinzugefügte Typen

Diese Erweiterung fügt keine Typen hinzu.

Hinzugefügte Einstellungen

Diese Erweiterung fügt keine Einstellungen hinzu.