Episode

Choses à Savoir TECH - Une IA traduit 32 000 manuscrits médiévaux en Français ?

Podcast
Moins de 30 minutes : les meilleurs podcasts courts
Published
Jul 7, 2026
Duration seconds
160
Processing state
not_requested
Canonical source
https://shows.acast.com/choses-a-savoir-technologie/episodes/une-ia-traduit-32-000-manuscrits-medievaux-en-francais
Audio
https://sphinx.acast.com/p/open/s/660681b953b2df00165f1c32/a/podcasts-courts/e/6a4d2523ad78abcff1c21832/media.mp3
JSON
/v1/public/podcasts/moins-de-30-minutes-les-meilleurs-podcasts-courts-6972873/episodes/choses-savoir-tech-une-ia-traduit-32-000-manuscrits-m-di-vaux-en-fran-ais
Markdown
/podcast/moins-de-30-minutes-les-meilleurs-podcasts-courts-6972873/choses-savoir-tech-une-ia-traduit-32-000-manuscrits-m-di-vaux-en-fran-ais.md

Actions

  • POST https://stenobird.com/v1/public/podcasts/moins-de-30-minutes-les-meilleurs-podcasts-courts-6972873/episodes/choses-savoir-tech-une-ia-traduit-32-000-manuscrits-m-di-vaux-en-fran-ais/transcription-requests
    Idempotently request low-priority transcript generation for this episode.
  • GET https://stenobird.com/podcast/moins-de-30-minutes-les-meilleurs-podcasts-courts-6972873/choses-savoir-tech-une-ia-traduit-32-000-manuscrits-m-di-vaux-en-fran-ais.md
    Read the agent-friendly Markdown representation of this episode resource.

Summary

La numérisation a ouvert les portes de milliers d’archives médiévales. Mais jusqu’ici, une difficulté persistait : photographier un manuscrit ne suffit pas à le rendre lisible par un ordinateur. Les chercheurs disposaient donc d’immenses collections d’images, sans avoir le temps de retranscrire chaque page. Une équipe de l’Inria vient de faire sauter ce verrou grâce à une intelligence artificielle spécialisée dans les écritures anciennes. Le projet s’appelle CoMMa, pour *Corpus of Multilingual Medieval Archives*. Piloté par Thibault Clérice, chercheur en humanités computationnelles au Centre Inria de Paris, il a permis de constituer un corpus de plus de trois milliards de mots. Les documents sont principalement rédigés en latin, du IXe au XVIe siècle, et en ancien français, du XIIe au XVIe siècle. Pour ce dernier, le volume de textes disponibles a été multiplié par quarante. Pourquoi ne pas simplement utiliser ChatGPT ou Mistral ? Parce que les manuscrits médiévaux échappent aux règles modernes. L’orthographe de l’ancien français n’est pas stabilisée : deux scribes peuvent écrire jusqu’à la moitié des mots différemment. En latin, au XIVe siècle, 35 à 40 % des termes sont abrégés. Dans certains traités médicaux, seule la moitié des lettres apparaît. Les grands modèles de langage risqueraient alors d’inventer les passages manquants. L’équipe a préféré une reconnaissance visuelle caractère par caractère, avec les outils libres Kraken et eScriptorium. L’algorithme peut confondre deux signes, mais il ne reconstitue pas arbitrairement un mot. Pour les historiens, cette erreur reste moins grave qu’une hallucination crédible mais fausse. Avant CoMMa, les chercheurs ont créé CATMuS, une base d’entraînement constituée depuis 2022. Philologues et spécialistes ont retranscrit manu…