Episode

Episode 226 : Starlake.AI avec Hayssam Saleh

Podcast
Big Data Hebdo
Published
Feb 20, 2026
Duration seconds
3340
Processing state
not_requested
Canonical source
https://www.spreaker.com/episode/episode-226-starlake-ai-avec-hayssam-saleh--70174382
Audio
https://api.spreaker.com/download/episode/70174382/riverside_hayssam_heuschling_feb_16_2026_001_bigdata_hebdo.mp3
JSON
/v1/public/podcasts/big-data-hebdo-828834/episodes/episode-226-starlake-ai-avec-hayssam-saleh
Markdown
/podcast/big-data-hebdo-828834/episode-226-starlake-ai-avec-hayssam-saleh.md

Actions

  • POST https://stenobird.com/v1/public/podcasts/big-data-hebdo-828834/episodes/episode-226-starlake-ai-avec-hayssam-saleh/transcription-requests
    Idempotently request low-priority transcript generation for this episode.
  • GET https://stenobird.com/podcast/big-data-hebdo-828834/episode-226-starlake-ai-avec-hayssam-saleh.md
    Read the agent-friendly Markdown representation of this episode resource.

Summary

Vincent Heuschling reçoit Hayssam Saleh, créateur de **Starlake**, une plateforme data open source française née de la factorisation de projets clients depuis 2017-2018. L'épisode intervient dans un contexte de consolidation du marché (rachat de DBT et de SQLMesh par Fivetran), qui invite à challenger les solutions établies. Starlake se distingue par une approche **entièrement déclarative** (YAML + SQL natif, sans Jinja) couvrant toute la chaîne data engineering : ingestion, transformation, orchestration et qualité des données. L'outil s'appuie sur les moteurs sous-jacents des plateformes cibles (Snowflake, BigQuery, Spark) et génère automatiquement les DAGs pour les orchestrateurs du marché (Airflow, Dagster, Snowflake Tasks). Parmi les fonctionnalités marquantes : le **data branching** (branches de données à la manière de Git), l'inférence automatique de schémas YAML à partir de fichiers sources, un **transpiler SQL** multi-plateformes, et l'extraction du lineage depuis du SQL brut sans annotation. L'intégration récente de **DuckLake** ouvre la voie à des architectures on-premise souveraines à coût maîtrisé (sous 300 €/mois sur OVH, Scaleway, Clever Cloud). Le modèle économique repose sur le support, la formation, et le consulting : Starlake s'installe dans le cloud du client, avec mise à jour automatique gérée par l'équipe, sans accès aux données. **Chapitres** **00:00:27** – Introduction : consolidation du marché data (rachat de DBT et SQLMesh par Fivetran) et présentation de l'épisode **00:03:13** – Hayssam et la genèse de Starlake : parcours Spark/Scala, POC à 4 000 formats de fichiers (2017-2018) **00:09:51** – Architecture et philosophie : load, transform, orchestration unifiés en déclaratif (YAML + SQL natif, pas de Jinja) **00:00:18:18** – Starlake vs DBT : d…