Moshi: a speech-text foundation model for real-time dialogue Paper • 2410.00037 • Published Sep 17, 2024 • 20
deepseek-ai/DeepSeek-V4-Flash-0731 Text Generation • 304B • Updated about 1 month ago • 4.58M • • 3.83k
Multi-Faceted Interactivity Alignment in Full-Duplex Speech Models Paper • 2606.11167 • Published Jun 9 • 6
Multiplayer Interactive World Models with Representation Autoencoders Paper • 2607.05352 • Published Jul 6 • 29