# OrbitQuant: Data-Agnostic Quantization for Image and Video Diffusion Transformers Page: https://stenobird.com/podcast/daily-paper-cast-7079649/orbitquant-data-agnostic-quantization-for-image-and-video-diffusion-transformers Text version: https://stenobird.com/podcast/daily-paper-cast-7079649/orbitquant-data-agnostic-quantization-for-image-and-video-diffusion-transformers.md Podcast: [Daily Paper Cast](https://stenobird.com/podcast/daily-paper-cast-7079649) Published: 2026-07-07T03:35:58+00:00 Episode link: https://share.transistor.fm/s/f03d2d1c Audio file: https://media.transistor.fm/f03d2d1c/de25e750.mp3 Processing state: not_requested JSON: https://stenobird.com/v1/public/podcasts/daily-paper-cast-7079649/episodes/orbitquant-data-agnostic-quantization-for-image-and-video-diffusion-transformers Duration seconds: 1387 ## Resource 🤗 Upvotes: 28 | cs.CV, cs.AI, cs.LG Authors: Donghyun Lee, Jitesh Chavan, Duy Nguyen, Sam Huang, Liming Jiang, Priyadarshini Panda, Timo Mertens, Saurabh Shukla Title: OrbitQuant: Data-Agnostic Quantization for Image and Video Diffusion Transformers Arxiv: http://arxiv.org/abs/2607.02461v1 Abstract: Diffusion transformers (DiTs) achieve state-of-the-art image and video generation, but their multi-step sampling and growing parameter count make inference expensive. Post-training quantization (PTQ) is the natural remedy, yet DiT activations shift across timesteps, prompts, and guidance branches, forcing prior methods to re-fit calibration data for every new checkpoint or modality. We present OrbitQuant, a data-agnostic weight-activation quantizer that bypasses range estimation by quantizing in a normalized, rotated basis. In this basis, a randomized permuted block-Hadamard (RPBH) rotation concentrates each coordinate around one fixed, known marginal regardless of the input, so a single Lloyd-Max codebook serves all timesteps, prompts, and layers of a given input dimension. We extend the same quantizer to weight rows offline, absorbing the rotation into the weights so that it cancels inside each linear layer and only a forward rotation on the activations remains at runtime. The same recipe transfers from image to video with no per-modality tuning. Across FLUX.1, Z-Image-Turbo, Wan 2.1, and CogVideoX, it sets the state of the art for PTQ at several low-bit settings. It also pushes PTQ of image diffusion transformers to W2A4 with usable generation quality. ## Actions - request_transcript: `POST https://stenobird.com/v1/public/podcasts/daily-paper-cast-7079649/episodes/orbitquant-data-agnostic-quantization-for-image-and-video-diffusion-transformers/transcription-requests` — Idempotently request low-priority transcript generation for this episode. - read_markdown: `GET https://stenobird.com/podcast/daily-paper-cast-7079649/orbitquant-data-agnostic-quantization-for-image-and-video-diffusion-transformers.md` — Read the agent-friendly Markdown representation of this episode resource. A page view does not enqueue transcription. Agents should invoke `request_transcript` explicitly when they need this episode processed. ## Transcript Full transcripts are not published on public pages unless there is a clear rights basis.