{"podcast":{"title":"Big Data Hebdo","slug":"big-data-hebdo-828834","podcast_index_feed_id":828834,"rss_url":"https://www.spreaker.com/show/1952874/episodes/feed","website_url":"https://www.spreaker.com/show/bigdata-hebdo","image_url":"https://d3wo5wojvuv7l.cloudfront.net/t_rss_itunes_square_1400/images.spreaker.com/original/745a2c3f4dd8d3b6f75a2a33c841d999.jpg","author":"Vincent Heuschling","episode_count":230,"summary":"Toute l'actualité du Bigdata et surtout de sa communauté francophone dans un podcast.","last_synced_at":null,"page_url":"https://stenobird.com/podcast/big-data-hebdo-828834"},"episode":{"title":"Episode 226 : Starlake.AI avec Hayssam Saleh","slug":"episode-226-starlake-ai-avec-hayssam-saleh","published_at":"2026-02-20T10:43:57+00:00","page_url":"https://stenobird.com/podcast/big-data-hebdo-828834/episode-226-starlake-ai-avec-hayssam-saleh","show_page_url":"https://stenobird.com/podcast/big-data-hebdo-828834","url":"https://www.spreaker.com/episode/episode-226-starlake-ai-avec-hayssam-saleh--70174382","audio_url":"https://api.spreaker.com/download/episode/70174382/riverside_hayssam_heuschling_feb_16_2026_001_bigdata_hebdo.mp3","summary":"Vincent Heuschling reçoit Hayssam Saleh, créateur de **Starlake**, une plateforme data open source française née de la factorisation de projets clients depuis 2017-2018. L'épisode intervient dans un contexte de consolidation du marché (rachat de DBT et de SQLMesh par Fivetran), qui invite à challenger les solutions établies. Starlake se distingue par une approche **entièrement déclarative** (YAML + SQL natif, sans Jinja) couvrant toute la chaîne data engineering : ingestion, transformation, orchestration et qualité des données. L'outil s'appuie sur les moteurs sous-jacents des plateformes cibles (Snowflake, BigQuery, Spark) et génère automatiquement les DAGs pour les orchestrateurs du marché (Airflow, Dagster, Snowflake Tasks). Parmi les fonctionnalités marquantes : le **data branching** (branches de données à la manière de Git), l'inférence automatique de schémas YAML à partir de fichiers sources, un **transpiler SQL** multi-plateformes, et l'extraction du lineage depuis du SQL brut sans annotation. L'intégration récente de **DuckLake** ouvre la voie à des architectures on-premise souveraines à coût maîtrisé (sous 300 €/mois sur OVH, Scaleway, Clever Cloud). Le modèle économique repose sur le support, la formation, et le consulting : Starlake s'installe dans le cloud du client, avec mise à jour automatique gérée par l'équipe, sans accès aux données. **Chapitres** **00:00:27** – Introduction : consolidation du marché data (rachat de DBT et SQLMesh par Fivetran) et présentation de l'épisode **00:03:13** – Hayssam et la genèse de Starlake : parcours Spark/Scala, POC à 4 000 formats de fichiers (2017-2018) **00:09:51** – Architecture et philosophie : load, transform, orchestration unifiés en déclaratif (YAML + SQL natif, pas de Jinja) **00:00:18:18** – Starlake vs DBT : d…","meta_description":"Vincent Heuschling reçoit Hayssam Saleh, créateur de **Starlake**, une plateforme data open source française née de la factorisation de projets clients de…","key_points":[],"chapters":[],"topics":[],"duration_seconds":3340,"processing_state":"not_requested","actions":[{"name":"request_transcript","method":"POST","url":"https://stenobird.com/v1/public/podcasts/big-data-hebdo-828834/episodes/episode-226-starlake-ai-avec-hayssam-saleh/transcription-requests","description":"Idempotently request low-priority transcript generation for this episode."},{"name":"read_markdown","method":"GET","url":"https://stenobird.com/podcast/big-data-hebdo-828834/episode-226-starlake-ai-avec-hayssam-saleh.md","description":"Read the agent-friendly Markdown representation of this episode resource."}]}}