DuckDB, Apache Arrow und die Zukunft des Data Engineering mit Rusty Conover
|—––|—––| | Podcast | The Hedgineer Podcast by Michael Watson | | Gast | Rusty Conover |
Beschreibung
In dieser Folge von The Hedgineer Podcast spricht Gastgeber Michael Watson mit Rusty Conover, dem weltweit produktivsten Entwickler von DuckDB-Extensions, über den Aufbau der nächsten Generation von Echtzeit-Datensystemen im großen Maßstab.
Rusty, der eine umfangreiche Karriere im Data Engineering vorweisen kann, unter anderem bei Multi-Manager-Hedgefonds, erklärt, was DuckDB für Entwicklerinnen, Entwickler und Data Engineers so revolutionär macht. Sie beleuchten, wie die blitzschnelle, in-process und in C++ umgesetzte Architektur den Status quo von Big Data herausfordert. Das Gespräch führt tief in das wachsende Ökosystem rund um DuckDB: vom spaltenorientierten Format Apache Arrow bis zur sich wandelnden Landschaft offener Tabellenformate wie Iceberg, Delta Lake und dem neuen DuckLake.
Begleiten Sie die beiden bei einer detaillierten Diskussion über die Feinheiten moderner Dateninfrastruktur – egal, ob Sie Unternehmensdatenplattformen aufbauen oder die effizientesten Werkzeuge für Ihre Analyse-Workloads suchen.
In dieser Folge erfahren Sie mehr über:
- Die DuckDB-Revolution: Was diese „blitzschnelle“ In-Process-Datenbank zu einem Wendepunkt macht, der ganze ETL-Stacks vereinfachen und ersetzen kann.
- Ein Rundgang durch DuckDB-Extensions: Ein Blick in einige der 15 Extensions, die Rusty gebaut hat – von Airport für die Integration mit Apache Arrow über Crypto, ShellFS und TextPlot.
- Apache Arrow im Detail: Eine Erklärung des spaltenorientierten In-Memory-Datenformats, von Zero-Copy-Operationen und dem Arrow-Flight-RPC-Mechanismus für effizienten Datentransfer.
- Der Wettbewerb offener Tabellenformate: Ein Vergleich von Iceberg, Delta Lake und dem neuen datenbankzentrierten Ansatz von DuckLake.
- DuckDB im Vergleich: Wie DuckDB gegenüber KDB für Finanzdaten und ClickHouse für Analysen abschneidet und welche Rolle es neben Compute-Engines wie Apache Spark spielt.
- Parquet im Detail: Die wichtigsten Unterschiede zwischen Parquet V1 und V2 sowie die Bedeutung moderner Kompressionsstrategien und Kodierungen.
- Die Zukunft von DuckDB: Ein Ausblick auf kommende Funktionen wie Time Travel und die Anweisung
MERGE INTOzur Vereinfachung von Change-Data-Capture-Pipelines (CDC).
The Hedgineer Podcast wird von Michael Watson moderiert und behandelt KI-Technologie und Daten im Umfeld von Hedgefonds, Asset Management und Proprietary Trading.