DuckDB in Research S01E05: Haralampos Gavriilidis

|—––|—––| | Podcast | DuckDB in Research | | Episode | S01E05 | | Thema | SheetReader: Effizientes Parsen von Tabellenkalkulationen | | Apple Podcasts | Anhören | | Spotify | Anhören |

Beschreibung

In dieser Folge der Reihe DuckDB in Research spricht Harry Gavriilidis (Promovierender an der TU Berlin) über Sheet Reader – einen hochperformanten Spreadsheet-Parser, der herkömmliche Werkzeuge bei Geschwindigkeit und Speichereffizienz deutlich übertrifft. Indem er die standardisierte Struktur von Spreadsheet-Dateien nutzt und generische XML-Parser umgeht, liefert Sheet Reader schnelles, leichtgewichtiges Parsen, auch bei großen Dateien. Als DuckDB-Extension verfügbar, können Nutzerinnen und Nutzer Spreadsheets direkt per SQL abfragen und nahtlos in größere analytische Workflows einbinden.

Harry berichtet vom Entwicklungsprozess, Leistungsbenchmarks und der überraschend komplexen Welt des Spreadsheet-Parsings. Er spricht außerdem über Community-Rückmeldungen, Feature-Wünsche (etwa das Erkennen mehrerer Tabellen oder das Parsen farbiger Zeilen) und Pläne für die Zukunft – darunter eine engere Integration mit DuckDB und Unterstützung für Arrow. Das Gespräch schließt mit einem Blick auf Harrys weitere Forschung zu komponierbaren Datenbanksystemen und Dateninteroperabilität und darauf, wie Werkzeuge wie DuckDB die moderne Datenanalyse verändern.