arXiv · 2503.18579
Unsupervised Variational Acoustic Clustering
Abstract
We propose an unsupervised variational acoustic clustering model for clustering audio data in the time-frequency domain. The model leverages variational inference, extended to an autoencoder framework, with a Gaussian mixture model as a prior for the latent space. Specifically designed for audio applications, we introduce a convolutional-recurrent variational autoencoder optimized for efficient time-frequency processing. Our experimental results considering a spoken digits dataset demonstrate a significant improvement in accuracy and clustering performance compared to traditional methods, showcasing the model's enhanced ability to capture complex audio patterns.
Explore related subjects
Keep this discovery
Luan Vinícius Fiorio, Bruno Defraene, Johan David, Frans Widdershoven, Wim van Houtum, Ronald M. Aarts. 2025-03-24. Unsupervised Variational Acoustic Clustering. https://arxiv.org/abs/2503.18579
Cite the original work for its findings. Save a collection to share your selection of sources.