KVAE: Family of Tokenizers for Multimodal Generative Models Paper • 2608.05798 • Published 10 days ago • 28
Kandinsky WM 1.0 Collection Image-to-Video models for Physical AI: autonomous driving, robotics, general physics. • 3 items • Updated 12 days ago • 3
SGMD: Score Gradient Matching Distillation for Few-Step Video Diffusion Distillation Paper • 2605.30116 • Published May 28 • 4
SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation Paper • 2607.21553 • Published 24 days ago • 39
Xiaomi-Robotics-U0 Collection Unified embodied synthesis model that bridges foundation image generation and embodied world modeling • 2 items • Updated Jul 13 • 10
Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget Paper • 2607.13125 • Published 29 days ago • 139
Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence Paper • 2607.07675 • Published Jul 8 • 64
KVAE 2.0 Collection KVAE 2.0 is a family of image and video tokenizers with a time compression ratio of 4 and spacial compression ratio of 8 and 16 • 3 items • Updated 9 days ago • 5
KVAE-Audio Collection KVAE-Audio is a continuous full-band audio waveform autoencoder • 2 items • Updated 5 days ago • 7
LTX-2.3 Creative Lab Collection LoRAs and IC-LoRAs, trained on the LTX-2.3 model • 26 items • Updated 18 days ago • 88
AAD-1: Asymmetric Adversarial Distillation for One-Step Autoregressive Video Generation Paper • 2606.03972 • Published Jun 2 • 14
From Pixels to Words -- Towards Native One-Vision Models at Scale Paper • 2605.28820 • Published May 27 • 76