The Science Data Lake: A Unified Open Infrastructure Integrating 293 Million Papers Across Eight Scholarly Sources with Embedding-Based Ontology Alignment
|—––|—––| | Paper | The Science Data Lake: A Unified Open Infrastructure Integrating 293 Million Papers Across Eight Scholarly Sources with Embedding-Based Ontology Alignment (Preprint-PDF) | | Implementierung | GitHub | | Datensatz | HuggingFace | | Veröffentlicht | arXiv, 2026 |
Zusammenfassung
Wissenschaftliche Daten sind weitgehend über isolierte Datenbanken fragmentiert, mit abweichenden Metadaten und fehlenden Verknüpfungen. Wir stellen den Science Data Lake vor, eine lokal einsetzbare Infrastruktur auf Basis von DuckDB und einfachen Parquet-Dateien, die acht offene Quellen – Semantic Scholar, OpenAlex, SciSciNet, Papers with Code, Retraction Watch, Reliance on Science, ein Mapping von Preprint zu Veröffentlichung sowie Crossref – über DOI-Normalisierung vereint und dabei die Quellschemata bewahrt. Die entstehende Ressource umfasst rund 960 GB Parquet-Dateien mit 293 Millionen eindeutig identifizierbaren Papers sowie SQL-Views, die quellenübergreifende Joins ohne redundante Datenkopien bereitstellen. Um die heterogenen Fachtaxonomien dieser Quellen zu überbrücken, führen wir ein embeddingbasiertes Verfahren zur Ontologieangleichung ein, das über 4.500 OpenAlex-Themen auf dreizehn etablierte wissenschaftliche Ontologien abbildet und bei empfohlenen Schwellenwerten einen F1-Wert von 0,77 erreicht. Wir prüfen die Integrationsqualität durch automatisierte Checks, quellenübergreifende Zitationsanalysen und manuelle Annotation und zeigen mehrere Analysen, die mit keiner einzelnen Datenbank möglich wären. Sämtlicher Code, alle Daten und die Dokumentation werden als Open-Source-Ressource veröffentlicht, die lokal betrieben werden kann, Remote-Abfragen unterstützt und LLM-taugliche Dokumentation mitliefert.