# Episode 226 : Starlake.AI avec Hayssam Saleh Page: https://stenobird.com/podcast/big-data-hebdo-828834/episode-226-starlake-ai-avec-hayssam-saleh Text version: https://stenobird.com/podcast/big-data-hebdo-828834/episode-226-starlake-ai-avec-hayssam-saleh.md Podcast: [Big Data Hebdo](https://stenobird.com/podcast/big-data-hebdo-828834) Published: 2026-02-20T10:43:57+00:00 Episode link: https://www.spreaker.com/episode/episode-226-starlake-ai-avec-hayssam-saleh--70174382 Audio file: https://api.spreaker.com/download/episode/70174382/riverside_hayssam_heuschling_feb_16_2026_001_bigdata_hebdo.mp3 Processing state: not_requested JSON: https://stenobird.com/v1/public/podcasts/big-data-hebdo-828834/episodes/episode-226-starlake-ai-avec-hayssam-saleh Duration seconds: 3340 ## Resource Vincent Heuschling reçoit Hayssam Saleh, créateur de **Starlake**, une plateforme data open source française née de la factorisation de projets clients depuis 2017-2018. L'épisode intervient dans un contexte de consolidation du marché (rachat de DBT et de SQLMesh par Fivetran), qui invite à challenger les solutions établies. Starlake se distingue par une approche **entièrement déclarative** (YAML + SQL natif, sans Jinja) couvrant toute la chaîne data engineering : ingestion, transformation, orchestration et qualité des données. L'outil s'appuie sur les moteurs sous-jacents des plateformes cibles (Snowflake, BigQuery, Spark) et génère automatiquement les DAGs pour les orchestrateurs du marché (Airflow, Dagster, Snowflake Tasks). Parmi les fonctionnalités marquantes : le **data branching** (branches de données à la manière de Git), l'inférence automatique de schémas YAML à partir de fichiers sources, un **transpiler SQL** multi-plateformes, et l'extraction du lineage depuis du SQL brut sans annotation. L'intégration récente de **DuckLake** ouvre la voie à des architectures on-premise souveraines à coût maîtrisé (sous 300 €/mois sur OVH, Scaleway, Clever Cloud). Le modèle économique repose sur le support, la formation, et le consulting : Starlake s'installe dans le cloud du client, avec mise à jour automatique gérée par l'équipe, sans accès aux données. **Chapitres** **00:00:27** – Introduction : consolidation du marché data (rachat de DBT et SQLMesh par Fivetran) et présentation de l'épisode **00:03:13** – Hayssam et la genèse de Starlake : parcours Spark/Scala, POC à 4 000 formats de fichiers (2017-2018) **00:09:51** – Architecture et philosophie : load, transform, orchestration unifiés en déclaratif (YAML + SQL natif, pas de Jinja) **00:00:18:18** – Starlake vs DBT : d… ## Actions - request_transcript: `POST https://stenobird.com/v1/public/podcasts/big-data-hebdo-828834/episodes/episode-226-starlake-ai-avec-hayssam-saleh/transcription-requests` — Idempotently request low-priority transcript generation for this episode. - read_markdown: `GET https://stenobird.com/podcast/big-data-hebdo-828834/episode-226-starlake-ai-avec-hayssam-saleh.md` — Read the agent-friendly Markdown representation of this episode resource. A page view does not enqueue transcription. Agents should invoke `request_transcript` explicitly when they need this episode processed. ## Transcript Full transcripts are not published on public pages unless there is a clear rights basis.