{"podcast":{"title":"Knowledge Science - Alles über KI, ML und NLP","slug":"knowledge-science-alles-ber-ki-ml-und-nlp-1383759","podcast_index_feed_id":1383759,"rss_url":"https://rss.buzzsprout.com/1687822.rss","website_url":"https://www.knowledgescience.ai","image_url":"https://storage.buzzsprout.com/dxagebqcvdyuiye02hsr6a1ualp8?.jpg","author":"Sigurd Schacht, Carsten Lanquillon","episode_count":264,"summary":"Knowledge Science - Der Podcast über Künstliche Intelligenz im Allgemeinen und Natural Language Processing im Speziellen. Mittels KI Wissen entdecken, aufbereiten und nutzbar machen, dass ist die Idee hinter Knowledge Science. Durch Entmystifizierung der Künstlichen Intelligenz und vielen praktischen Interviews machen wir dieses Thema wöchentlich greifbar.","last_synced_at":"2026-07-17T06:19:37.459126+00:00","page_url":"https://stenobird.com/podcast/knowledge-science-alles-ber-ki-ml-und-nlp-1383759"},"episode":{"title":"Episode 230 - Wenn KI lügt, obwohl sie es besser weiß – der MASK-Benchmark und warum Ehrlichkeit ≠ Genauigkeit ist","slug":"episode-230-wenn-ki-l-gt-obwohl-sie-es-besser-wei-der-mask-benchmark-und-warum-ehrlichkeit-genauigkeit-ist","published_at":"2026-05-02T18:00:00+00:00","page_url":"https://stenobird.com/podcast/knowledge-science-alles-ber-ki-ml-und-nlp-1383759/episode-230-wenn-ki-l-gt-obwohl-sie-es-besser-wei-der-mask-benchmark-und-warum-ehrlichkeit-genauigkeit-ist","show_page_url":"https://stenobird.com/podcast/knowledge-science-alles-ber-ki-ml-und-nlp-1383759","url":"https://www.buzzsprout.com/1687822/episodes/19113006-episode-230-wenn-ki-lugt-obwohl-sie-es-besser-weiss-der-mask-benchmark-und-warum-ehrlichkeit-genauigkeit-ist.mp3","audio_url":"https://www.buzzsprout.com/1687822/episodes/19113006-episode-230-wenn-ki-lugt-obwohl-sie-es-besser-weiss-der-mask-benchmark-und-warum-ehrlichkeit-genauigkeit-ist.mp3","summary":"Send us Fan Mail Sprachmodelle werden immer leistungsfähiger – aber werden sie auch ehrlicher? Der neue MASK-Benchmark zeigt: Je mächtiger ein Modell, desto eher weicht es unter Druck von seinem eigenen Faktenwissen ab. Sigurd und Carsten diskutieren, warum klassische Benchmarks an ihre Grenzen stoßen, was das für agentische Systeme bedeutet und wie dynamische Evaluierungsframeworks aussehen müssten, die nicht innerhalb weniger Jahre saturieren. Support the show","meta_description":"Send us Fan Mail Sprachmodelle werden immer leistungsfähiger – aber werden sie auch ehrlicher? Der neue MASK-Benchmark zeigt: Je mächtiger ein Modell, des…","key_points":[],"chapters":[],"topics":[],"duration_seconds":2455,"processing_state":"not_requested","actions":[{"name":"request_transcript","method":"POST","url":"https://stenobird.com/v1/public/podcasts/knowledge-science-alles-ber-ki-ml-und-nlp-1383759/episodes/episode-230-wenn-ki-l-gt-obwohl-sie-es-besser-wei-der-mask-benchmark-und-warum-ehrlichkeit-genauigkeit-ist/transcription-requests","description":"Idempotently request low-priority transcript generation for this episode."},{"name":"read_markdown","method":"GET","url":"https://stenobird.com/podcast/knowledge-science-alles-ber-ki-ml-und-nlp-1383759/episode-230-wenn-ki-l-gt-obwohl-sie-es-besser-wei-der-mask-benchmark-und-warum-ehrlichkeit-genauigkeit-ist.md","description":"Read the agent-friendly Markdown representation of this episode resource."}]}}