doi: 10.21437/Odyssey.2026
ISSN: 2312-2846
Rigorous Forensic Automatic Speaker Recognition: Bayesian Decision Theory, Probabilistic Calibration and Case-Specific Validation
Daniel Ramos
Genetic Information in Human Voice: How Much Do We Know Today and How Much More Will Technology Uncover?
Rita Singh
Every breath you take: From Vocal Chords to Health Scores
Björn Schuller
From Single-Channel Foundations to Multi-Speaker and Multi-Modal Understanding
Lukáš Burget
An Intervention-Based Framework for Shortcut Diagnosis in Spoofing Countermeasures
Santiago Rubio, Pilar Bello, Dayana Ribas, Antonio Miguel, Eduardo Lleida, Alfonso Ortega
Domain Adaptation for Deepfake Audio Detection under Degraded Channel Conditions
Ayuto Tsutsumi, Akira Gotoh, Yuko Saito, Hiroki Matsuura, Sayaka Shiota
Speaker-Invariant Representation Learning for Spoofing Detection via Gradient Reversal and A Variational Information Bottleneck
Anh-Tuan Dao, Driss Matrouf, Mickael Rouvier, Nicholas Evans
Large-Kernel 1D CNN for Raw Waveform Spoofing Countermeasures
Guy Perets, Yehuda Ben-Shimol, Itshak Lapidot
Analysis of embedding-based emotional preservation metrics for voice conversion models
Théo Nguyen, Tom Bäckström, Rainer Martin
Latent Secret Spin: Keyed Orthogonal Rotations for Blind Speech Watermarking in Anisotropic Latent Spaces
Emma Coletta, Massimiliano Todisco, Michele Panariello, Antonio Faonio, Nicholas Evans
Sensitive Speaker Attribute Leakage in Speech–LLM Pipelines
Siavosh Sepanta, Alessio Brutti
Kiwano: A Cutting-Edge Open-Source Toolkit for Speaker Verification
Mickael Rouvier, Pierre Michel Bousquet
Beyond CosFace: Analysing Sparsity-Inducing Losses in Speaker Verification
Ladislav Mošner, Dimitrios Koutsianos, Themos Stafylakis
FM-SEE: Flow Matching-based Generative Model For Speaker Embedding Enhancement
Sergey Novoselov, Vladimir Volokhov, Nikita Khmelev, Anikin Alexandr, Anastasia Zorkina, Anastasia Korenevskaya
Scaling self-supervised pretraining for speaker diarization
Antoine Laurent, Joonas Kalda, Hervé Bredin
Adapting Speaker Diarization to Code-Switched Medical Conversations: AUDIAS-UAM at the DISPLACE-M Challenge
Sara Barahona, Laura Herrera-Alarcón, Juan Ignacio Alvarez-Trejos, Alicia Lozano-Diez
Augmented State Space Speaker Clustering: Reformulating HMM Based Clustering To Improve Speaker Diarization
Anurag Chowdhury, Abhinav Misra, Yinong Wang, Bongjun Kim, Mark C. Fuhs, Monika Woszczyna
Quantized Approximate Signal Processing (QASP): Towards Homomorphic Encryption for Audio
Tu Duyen Nguyen, Adrien Lesage, Clotilde Cantini, Rachid Riad
Privacy in Spoken Interaction: An Overview of Inferable Attributes
Eline Bijmold, Anastasiia Korenevskaia, Martha Larson
Joint Timbral and Non-Timbral Speaker Anonymisation
Rayane Bakari, Olivier Le Blouch, Nicolas Gengembre, Nicholas Evans
Evaluating voice anonymisation using similarity rank disclosure
Shilpa Chandra, Matteo Pettenò, Michele Panariello, Nicholas Evans, Massimiliano Todisco, Tom Bäckström, Dorothea Kolossa, Rainer Martin, Themos Stafylakis, Nicolas Gengembre
MEGConformer: Conformer-Based MEG Decoder for Robust Speech and Phoneme Classification
Xabier de Zuazo, Ibon Saratxaga, Eva Navas
Adaptive Phone-Wise Weighted Loss for Silent Speech Restoration in Continuous Spanish
Eder del Blanco, David Gimeno-Gómez, Ibon Saratxaga, Eva Navas, Inma Hernáez
Comparator Loss: An Ordinal Contrastive Loss to Derive a Severity Score for Speech-based Health Monitoring
Jacob J Webber, Oliver Watts, Lovisa Wihlborg, Johnny Tam, Christine Weaver, Suvankar Pal, Siddharthan Chandran, Cassia Valentini-Botinhao
Rapid Calibration for Cross-Subject Imagined Speech Decoding Toward Restoring Communication
Sanae Belfrouh, Rahhal Errattahi, Fatima zahra Salmam
Deep learning based analysis of spontaneous speech for diagnostic classification and biomarker prediction in Alzheimer’s disease and primary progressive aphasia
Roger Esteve, Pilar Armas, Marc Casals-Salvador, Miguel A Santos-Santos, Alexandre Bejanin, Javier Hernando
Vocal markers of Turner syndrome: a preliminary analysis of sustained vowel recordings
Marc Freixes, Jordi Sanz, Joan Claudi Socoró, Jordi-Elm Margalef, Isabella Monlleó, Debora Michelatto, Francesc Alías-Pujol, Neus Martínez-Abadías, Xavier Sevillano
End-to-End Intracortical Speech Decoding from Neural Activity
Owais M. Khanday, Jose A. Gonzalez-Lopez, Marc Ouellet, Alberto Galdón, Gonzalo Olivares Granado
FiLM-Based Speaker Conditioning of a SpeechLLM for Pathological Speech Recognition
Fernando López, Santosh Kesiraju, Jordi Luque
The Effect of Telephony Transmission on Source Tracing of Audio Deepfakes
Nicholas Klein, Hemlata Tak, Nikolay Gaubitch, David Looney, Tianxiang Chen, Elie Khoury
Advancing Zero-Shot Open-Set Speech Deepfake Source Tracing
Manasi Chhibber, Jagabandhu Mishra, Tomi H. Kinnunen
I4U’s Official and Streamlined Audio Systems for NIST SRE24
Daniele Colibro, Claudio Vair, Youzhi Tu, Junjie Li, Zilong Huang, Yijia Chen, Kong Aik Lee, Man-Wai Mak, Jagabandhu Mishra, Vishwanath Singh, Xi Xuan, Manasi Chhibber, Oguzhan Kurnaz, Tomi Kinnunen, Suyeon Lee, Chaeyoung Jung, Kihyun Nam, Joon Son Chung, Shuai Wang
Analysis of the NIST 2024 Speaker Recognition Evaluation
Elliot Singer, Craig Greenberg, Lukas Diduch, Trang Nguyen, Lisa Mason, Beth Matys, Bob Dunn, Audrey Tong
Spoken Language Identification with Pre-trained Models and Margin Loss
Zhihua Fang, Liang He, Weiwu Jiang
LLM-Based Language Verification and Multimodal Ensemble for Spoken Language Recognition
Aivo Olev, Tanel Alumäe
Speaker-Aware Language Verification Based on Attentive Pooling, Mixture of Experts and Neural PLDA
Mikel Penagarikano, Luis Javier Rodriguez-Fuentes, Amparo Varona, Germán Bordel
Harmonizing data augmentation and loss function for speaker recognition: examples with speed perturbation, mixup and mixout
Pierre-Michel Bousquet, Mickaël Rouvier
Assessing the Energy and Carbon Emissions of Neural Speaker Verification Model in Training and Inference
Hugo Leguillier, Driss Matrouf, Guillaume Lechien, Mickael Rouvier
On Low-Bit Quantization Errors in Speaker Verification: Diagnostic and Mitigation
Hugo Leguillier, Driss Matrouf, Guillaume Lechien, Mickael Rouvier
SLAP: Learning Speaker and Health-Related Representations from Natural Language Supervision
Angelika Andò, Auguste Crabeil, Quentin Spinat, Adrien Lesage, Rachid Riad
Speech Quality Embeddings for Improved Detection and Classification of Degradations in Speech Signals
Michael Kuhlmann, Tobias Cord-Landwehr, Reinhold Haeb-Umbach
Dysarthria Severity Classification on the HeyJay! Dataset: A Parameter-Efficient Approach Using Self-Supervised Speech Representations
Davide Lillini, Thomas Thebaud, Lucia Migliorelli, Najim Dehak, Stefano Squartini, Laureano Moro Velazquez
A Comparison of SSL-Based Feature Extractors and Back-End Classifiers for Spoofing Detection: A Multi-Corpus Training and Cross-Linguistic Analysis
Anh-Tuan Dao, Driss Matrouf, Mickael Rouvier, Nicholas Evans
From Self-Supervised Speech Models to Mixture-of-Experts for Robust Anti-Spoofing
Hugo Daumain, Driss Matrouf, Khaled Khelif, Mickael Rouvier
Can SSL Frontend Generalize to All-Type Audio Spoofing?
Arnab Das, Yassine El Kheir, Fabian Ritter Guttierez, Tim Polzehl, Sebastian Möller
Spherical-Gaussian TPSDA: combining PLDA, T-PSDA and duration models for speaker verification
Sandro Cumani
Condition-Aware System Fusion for Speaker Verification
Jonas J. Borgstrom
Towards Language-Agnostic Speaker Verification: A Cross-Lingual Transfer Study of Architectures
Pol Buitrago, Javier Hernando
Subtract to Clean, Add to Enrich: Dual-Path Disentanglement for Speaker and Language Recognition
Aref Farhadipour
Functionnally-grounded evaluation of dimensional interpretability in sparse speaker representations
Félix Saget, Nicolas Dugué, Marie Tahon, Anthony Larcher
Multi-Axis Speech Similarity via Factor-Partitioned Embeddings
Jim O'Regan, Jens Edlund
Flow-Enhanced Language Embeddings for Robust Language Recognition
Tianyu Cao, Laureano Moro Velazquez, Jesus Villalba, Thomas Thebaud, Najim Dehak
Sparse deepfake detection promotes better disentanglement
Marie Tahon, Antoine Tessier, Nicolas Dugué, Aghilas Sini
I Hear, Therefore I Trust: A Socio-Technical Investigation of Humans as Synthetic Speech Detectors
Lelia Erscoi, Tomi Kinnunen
PLDA Scoring for Spoofing-Robust Automatic Speaker Verification
Shani Budilovsky, Yehuda Ben-Shimol, Itshak Lapidot
J-SPAW2: A Japanese Corpus for Speaker Verification and Anti-Spoofing with Challenging Replay and Speech Synthesis Attacks
Sayaka Shiota, Suzuka Horie, Sawato Furubayashi, Shinnosuke Takamichi
| Article |
|---|