Practical Spreadsheet Parsing with SheetReader
| Paper | Practical Spreadsheet Parsing with SheetReader (PDF) |
| Konferenz | EDBT 2026 |
Zusammenfassung
Tabellenkalkulationen bleiben ein allgegenwärtiges Werkzeug für Datenverwaltung und Analyse. Da Systeme wie Excel nur begrenzte analytische Fähigkeiten bieten, laden Nutzerinnen und Nutzer Tabellenkalkulationen routinemäßig in reichhaltigere Ökosysteme wie Python, R und DBMSe. Bestehende Spreadsheet-Loader stützen sich jedoch auf Allzweck-XML-Parser, die für das XLSX-Format ungeeignet sind und zu schweren CPU- und Speicherengpässen führen. In früherer Arbeit haben wir SheetReader vorgestellt, einen spezialisierten Spreadsheet-Parser, der die Struktur von XLSX-Dateien nutzt und Parallelität einsetzt, um Ingestionskosten deutlich zu senken – mit bis zu einer Größenordnung Beschleunigung und mehreren Gigabyte weniger Speicherverbrauch gegenüber dem Stand der Technik. Diese Demonstration bietet eine interaktive Werkbank, in der Besuchende XLSX-Interna visualisieren, SheetReader gegen Baseline-Parser mit Live-Ressourcenüberwachung vergleichen und Integrationen für Python, R, PostgreSQL und DuckDB erkunden können, einschließlich SQL direkt über Tabellenkalkulationen.
Implementierung
SheetReader ist als DuckDB-Community-Extension verfügbar.