Practical Spreadsheet Parsing with SheetReader

Paper Practical Spreadsheet Parsing with SheetReader (PDF)
Konferenz EDBT 2026

Zusammenfassung

Tabellenkalkulationen bleiben ein allgegenwärtiges Werkzeug für Datenverwaltung und Analyse. Da Systeme wie Excel nur begrenzte analytische Fähigkeiten bieten, laden Nutzerinnen und Nutzer Tabellenkalkulationen routinemäßig in reichhaltigere Ökosysteme wie Python, R und DBMSe. Bestehende Spreadsheet-Loader stützen sich jedoch auf Allzweck-XML-Parser, die für das XLSX-Format ungeeignet sind und zu schweren CPU- und Speicherengpässen führen. In früherer Arbeit haben wir SheetReader vorgestellt, einen spezialisierten Spreadsheet-Parser, der die Struktur von XLSX-Dateien nutzt und Parallelität einsetzt, um Ingestionskosten deutlich zu senken – mit bis zu einer Größenordnung Beschleunigung und mehreren Gigabyte weniger Speicherverbrauch gegenüber dem Stand der Technik. Diese Demonstration bietet eine interaktive Werkbank, in der Besuchende XLSX-Interna visualisieren, SheetReader gegen Baseline-Parser mit Live-Ressourcenüberwachung vergleichen und Integrationen für Python, R, PostgreSQL und DuckDB erkunden können, einschließlich SQL direkt über Tabellenkalkulationen.

Implementierung

SheetReader ist als DuckDB-Community-Extension verfügbar.