# AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing Page: https://stenobird.com/podcast/daily-paper-cast-7079649/auk-technical-report-an-open-source-foundational-model-for-speech-generation-and-editing Text version: https://stenobird.com/podcast/daily-paper-cast-7079649/auk-technical-report-an-open-source-foundational-model-for-speech-generation-and-editing.md Podcast: [Daily Paper Cast](https://stenobird.com/podcast/daily-paper-cast-7079649) Published: 2026-09-09T08:20:51+00:00 Episode link: https://share.transistor.fm/s/9fd46524 Audio file: https://media.transistor.fm/9fd46524/17ae860e.mp3 Processing state: not_requested JSON: https://stenobird.com/v1/public/podcasts/daily-paper-cast-7079649/episodes/auk-technical-report-an-open-source-foundational-model-for-speech-generation-and-editing Duration seconds: 1171 ## Resource 🤗 Upvotes: 30 | cs.SD, cs.CL, cs.MM Authors: Ziyang Ma, Zhikang Niu, Wenming Tu, Tianrui Wang, Ruiqi Yan, Junxi Liu, Yanru Huo, Nickk Huang, Yang Liu, Qicong Xie, Zeyu Xie, Hui Wang, Haitao Li, Zixuan Jiang, Yalin Li, Jie Fang, Yifan Duan, Zeyue Tian, Guangzheng Li, Haina Zhu, Shuyi Wang, Jinwen Wang, Mingyu Cui, Tian Tan, Auden, Sen Liang, Steve Yves, Shan Yang, Liefeng Bo, Zilong Zheng, Kai Yu, Eng-Siong Chng, Xie Chen Title: AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing Arxiv: http://arxiv.org/abs/2609.08936v1 Abstract: We introduce AuK, an open-source foundational model that unifies speech generation and editing through a common interface of natural-language instructions and audio context. To support this broad capability set, we construct approximately 3.03 billion instruction--audio instances and 1.95 million hours of effective supervision across five task families: speech generation, content editing, enhancement and separation, paralinguistic editing, and acoustic editing. AuK combines a multimodal large language model for semantic conditioning, an VAE jointly trained on speech, general audio, and music for acoustic conditioning, and a hybrid rectified-flow Transformer that performs dual-stream MMDiT blocks followed by unified single-stream DiT blocks for generation. Training begins with generation-only warm-up and proceeds to joint generation--editing pre-training. We then apply complementary post-training strategies: human-feedback preference optimization for open-ended editing and reward-based reinforcement learning for speech generation. To reduce inference cost, we further distill the model with consistency initialization and task-routed Decoupled DMD. The resulting AuK-Flash performs 4-step inference without clas… ## Actions - request_transcript: `POST https://stenobird.com/v1/public/podcasts/daily-paper-cast-7079649/episodes/auk-technical-report-an-open-source-foundational-model-for-speech-generation-and-editing/transcription-requests` — Idempotently request low-priority transcript generation for this episode. - read_markdown: `GET https://stenobird.com/podcast/daily-paper-cast-7079649/auk-technical-report-an-open-source-foundational-model-for-speech-generation-and-editing.md` — Read the agent-friendly Markdown representation of this episode resource. A page view does not enqueue transcription. Agents should invoke `request_transcript` explicitly when they need this episode processed. ## Transcript Full transcripts are not published on public pages unless there is a clear rights basis.