Episode

Episode 224 : Données non structurées et modern OCR

Podcast
Big Data Hebdo
Published
Oct 28, 2025
Duration seconds
3084
Processing state
not_requested
Canonical source
https://www.spreaker.com/episode/episode-224-donnees-non-structurees-et-modern-ocr--68318805
Audio
https://api.spreaker.com/download/episode/68318805/episode_224_donne_es_non_structure_es_et_modern_ocr.mp3
JSON
/v1/public/podcasts/big-data-hebdo-828834/episodes/episode-224-donne-es-non-structure-es-et-modern-ocr
Markdown
/podcast/big-data-hebdo-828834/episode-224-donne-es-non-structure-es-et-modern-ocr.md

Actions

  • POST https://stenobird.com/v1/public/podcasts/big-data-hebdo-828834/episodes/episode-224-donne-es-non-structure-es-et-modern-ocr/transcription-requests
    Idempotently request low-priority transcript generation for this episode.
  • GET https://stenobird.com/podcast/big-data-hebdo-828834/episode-224-donne-es-non-structure-es-et-modern-ocr.md
    Read the agent-friendly Markdown representation of this episode resource.

Summary

Dans cet épisode on explore les défis et les évolutions du RAG (Retrieval-Augmented Generation) dans le contexte de l'IA. L'équipe du Bigdata Hebdo discute des promesses des éditeurs, des difficultés rencontrées par les utilisateurs, et des mécanismes d'IA nécessaires pour traiter efficacement les documents. On parle des enjeux liés à l'OCR, au chunking, et à l'importance des modèles d'embeddings. 00:00 Introduction 03:06 La promesse des éditeurs 08:05 Comprendre le RAG et son fonctionnement 11:06 Difficultés liées à l'OCR et à l'extraction de données 19:05 Recommandations pour l'optimisation des documents 28:46 Mistral Document AI et ses fonctionnalités 33:49 Chunking et gestion des documents 40:55 Fine-tuning des modèles d'embeddings 43:00 Formats de documents et leur pérennité 47:23 Conclusion et perspectives Notes et ressources https://bigdatahebdo.com/podcast/episode-224-donnees-non-structurees-et-modern-ocr