Episode

Deep Dive 205 – AI Evals mit Martin Seeler

Podcast
programmier.bar – der Podcast für App- und Webentwicklung
Published
Apr 14, 2026
Duration seconds
3781
Processing state
not_requested
Canonical source
https://www.programmier.bar/podcast/deep-dive-205-ai-evals-mit-martin-seeler
Audio
https://www.podtrac.com/pts/redirect.mp3/https://op3.dev/e/www.buzzsprout.com/176239/episodes/19006232-deep-dive-205-ai-evals-mit-martin-seeler.mp3
JSON
/v1/public/podcasts/programmier-bar-der-podcast-f-r-app-und-webentwicklung-1052362/episodes/deep-dive-205-ai-evals-mit-martin-seeler
Markdown
/podcast/programmier-bar-der-podcast-f-r-app-und-webentwicklung-1052362/deep-dive-205-ai-evals-mit-martin-seeler.md

Actions

  • POST https://stenobird.com/v1/public/podcasts/programmier-bar-der-podcast-f-r-app-und-webentwicklung-1052362/episodes/deep-dive-205-ai-evals-mit-martin-seeler/transcription-requests
    Idempotently request low-priority transcript generation for this episode.
  • GET https://stenobird.com/podcast/programmier-bar-der-podcast-f-r-app-und-webentwicklung-1052362/deep-dive-205-ai-evals-mit-martin-seeler.md
    Read the agent-friendly Markdown representation of this episode resource.

Summary

Wie hat dir die Folge gefallen? Gut 👍 Schlecht 👎 (Keine Anmeldung erforderlich) Ein Modell-Update bei OpenAI oder Anthropic ist schnell gemacht. Aber wie stellt ihr sicher, dass eure Anwendung danach noch genau das tut, was sie soll? In dieser Folge, aufgenommen auf der DecompileD in Dresden, sprechen wir mit Martin Seeler, Senior Staff AI Engineer bei Blue Yonder, über die Welt der AI Evals und den Unterschied zwischen einem reinen „Vibe-Check“ und belastbarer Teststrategie für GenAI-Prod...