Episode
Deep Dive 205 – AI Evals mit Martin Seeler
- Published
- Apr 14, 2026
- Duration seconds
- 3781
- Processing state
not_requested
Actions
POST https://stenobird.com/v1/public/podcasts/programmier-bar-der-podcast-f-r-app-und-webentwicklung-1052362/episodes/deep-dive-205-ai-evals-mit-martin-seeler/transcription-requests
Idempotently request low-priority transcript generation for this episode.GET https://stenobird.com/podcast/programmier-bar-der-podcast-f-r-app-und-webentwicklung-1052362/deep-dive-205-ai-evals-mit-martin-seeler.md
Read the agent-friendly Markdown representation of this episode resource.
Summary
Wie hat dir die Folge gefallen? Gut 👍 Schlecht 👎 (Keine Anmeldung erforderlich) Ein Modell-Update bei OpenAI oder Anthropic ist schnell gemacht. Aber wie stellt ihr sicher, dass eure Anwendung danach noch genau das tut, was sie soll? In dieser Folge, aufgenommen auf der DecompileD in Dresden, sprechen wir mit Martin Seeler, Senior Staff AI Engineer bei Blue Yonder, über die Welt der AI Evals und den Unterschied zwischen einem reinen „Vibe-Check“ und belastbarer Teststrategie für GenAI-Prod...