Select Publications

Journal articles

Liu H; Zhang H; Zhang Q; Zhang X; Shi D; Chng ES; Li H, 2026, 'Code-Switching Speech Recognition under the Lens: Model- and Data-Centric Perspectives', IEEE Transactions on Audio Speech and Language Processing, 34, pp. 1853 - 1865, http://dx.doi.org/10.1109/TASLPRO.2026.3675776

Zhang X; Ahmed B; Epps J, 2026, 'Why Pre-trained Models Fail: Feature Entanglement in Multimodal Depression Detection', IEEE Transactions on Affective Computing, http://dx.doi.org/10.1109/TAFFC.2026.3711426

Liu H; Zhang X; Zhang H; Garcia-Perera LP; Khong AWH; Chng ES; Watanabe S, 2025, 'Aligning Speech to Languages to Enhance Code-Switching Speech Recognition', IEEE Transactions on Audio Speech and Language Processing, 33, pp. 4712 - 4725, http://dx.doi.org/10.1109/TASLPRO.2025.3629290

Zhang X; Zhang Q; Liu H; Xiao T; Qian X; Ahmed B; Ambikairajah E; Li H; Epps J, 2025, 'Mamba in Speech: Towards an Alternative to Self-Attention', IEEE Transactions on Audio Speech and Language Processing, 33, pp. 1933 - 1948, http://dx.doi.org/10.1109/TASLPRO.2025.3566210

Chen M; Zhang Q; Wang M; Zhang X; Liu H; Ambikairaiah E; Chen D, 2025, 'Selective State Space Model for Monaural Speech Enhancement', IEEE Transactions on Consumer Electronics, 71, pp. 5414 - 5424, http://dx.doi.org/10.1109/TCE.2024.3523297

Shu H; Liang R; Li Z; Goodridge A; Zhang X; Ding H; Nagururu N; Sahu M; Creighton FX; Taylor RH; Munawar A; Unberath M, 2023, 'Twin-S: a digital twin for skull base surgery', International Journal of Computer Assisted Radiology and Surgery, 18, pp. 1077 - 1084, http://dx.doi.org/10.1007/s11548-023-02863-9

Conference Papers

Niu X; Ma J; Harper-Harris D; Zhang X; Martin CP; Zhang J, 2026, 'Beyond Video-to-SFX: Video to Audio Synthesis with Environmentally Aware Speech', in ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing, IEEE, pp. 22697 - 22701, http://dx.doi.org/10.1109/ICASSP55912.2026.11463835

Zhang X; Liu D; Xiao T; Xiao C; Szalay T; Shahin M; Ahmed B; Epps J, 2025, 'Auto-Landmark: Acoustic Landmark Dataset and Open-Source Toolkit for Landmark Extraction', in Proceedings of the Annual Conference of the International Speech Communication Association Interspeech, pp. 4263 - 4267, http://dx.doi.org/10.21437/Interspeech.2025-17

Xiao C; Liang R; Zhang X; Tiryaki ME; Bae V; Shankar L; Yang R; Poon E; Dupoux E; Khudanpur S; Perera LPG, 2025, 'CASPER: A Large Scale Spontaneous Speech Dataset', in Asru 2025 2025 IEEE Automatic Speech Recognition and Understanding Workshop, http://dx.doi.org/10.1109/ASRU65441.2025.11434634

Zhang Q; Chen M; Song Z; Liu H; Zhang X; Li H, 2025, 'Long-Context Modeling Networks for Monaural Speech Enhancement: A Comparative Study', in IEEE Workshop on Applications of Signal Processing to Audio and Acoustics, http://dx.doi.org/10.1109/WASPAA66052.2025.11230983

Zafar MA; Zhang X; Shahin M; Ahmed B, 2025, 'Multi-Class Dementia Detection Using Acoustic Features - ICASSP-2025 PROCESS Challenge', in ICASSP IEEE International Conference on Acoustics Speech and Signal Processing Proceedings, http://dx.doi.org/10.1109/ICASSP49660.2025.10889847

Zhang X; Ma J; Shahin M; Ahmed B; Epps J, 2025, 'Rethinking Mamba in Speech Processing by Self-Supervised Models', in ICASSP IEEE International Conference on Acoustics Speech and Signal Processing Proceedings, http://dx.doi.org/10.1109/ICASSP49660.2025.10889111

Zhang X; Liu H; Zhang Q; Ahmed B; Epps J, 2025, 'SpeechT-RAG: Reliable Depression Detection in LLMs with Retrieval-Augmented Generation Using Speech Timing Information', in Proceedings of the Annual Meeting of the Association for Computational Linguistics, pp. 10019 - 10030, http://dx.doi.org/10.18653/v1/2025.findings-acl.521

Meng H; Zhang Q; Zhang X; Sethu V; Ambikairajah E, 2024, 'Binaural Selective Attention Model for Target Speaker Extraction', in Proceedings of the Annual Conference of the International Speech Communication Association Interspeech, pp. 4323 - 4327, http://dx.doi.org/10.21437/Interspeech.2024-683

Liu H; Garcia LP; Zhang X; Khong AWH; Khudanpur S, 2024, 'ENHANCING CODE-SWITCHING SPEECH RECOGNITION WITH INTERACTIVE LANGUAGE BIASES', in ICASSP IEEE International Conference on Acoustics Speech and Signal Processing Proceedings, pp. 10886 - 10890, http://dx.doi.org/10.1109/ICASSP48485.2024.10448335

Zhang X; Liu D; Liu H; Zhang Q; Meng H; Garcia LP; Chng ES; Yao L, 2024, 'Speaking in Wavelet Domain: A Simple and Efficient Approach to Speed up Speech Diffusion Model', in Emnlp 2024 2024 Conference on Empirical Methods in Natural Language Processing Proceedings of the Conference, pp. 159 - 171, http://dx.doi.org/10.18653/v1/2024.emnlp-main.9

Joshi A; Renzella J; Bhattacharyya P; Jha S; Zhang X, 2024, 'Striking a Balance between Classical and Deep Learning Approaches in Natural Language Processing Pedagogy', in Teachnlp 2024 6th Workshop on Teaching Nlp Proceedings of the Workshop, pp. 23 - 32

Liang R; Zhang X; Li Q; Wei L; Liu H; Kumar A; Leadingham KMK; Punnoose J; Garcia LP; Manbachi A, 2024, 'Unidirectional Brain-Computer Interface: Artificial Neural Network Encoding Natural Images to FMRI Response in the Visual Cortex', in ICASSP IEEE International Conference on Acoustics Speech and Signal Processing Proceedings, pp. 1851 - 1855, http://dx.doi.org/10.1109/ICASSP48485.2024.10446366

Zhang X; Liu H; Xu K; Zhang Q; Liu D; Ahmed B; Epps J, 2024, 'When LLMs Meet Acoustic Landmarks: An Efficient Approach to Integrate Speech into Large Language Models for Depression Detection', in Emnlp 2024 2024 Conference on Empirical Methods in Natural Language Processing Proceedings of the Conference, pp. 146 - 158, http://dx.doi.org/10.18653/v1/2024.emnlp-main.8

Xuan Y; Zhang X; Li SS; Shen Z; Xie X; Garcia LP; Togneri R, 2023, 'A New Approach to Extract Fetal Electrocardiogram Using Affine Combination of Adaptive Filters', in ICASSP IEEE International Conference on Acoustics Speech and Signal Processing Proceedings, http://dx.doi.org/10.1109/ICASSP49357.2023.10095885

Chua VYH; Liu H; Perera LPG; Woon FT; Wong J; Zhang X; Khudanpur S; Khong AWH; Dauwels J; Styles SJ, 2023, 'MERLIon CCS Challenge: A English-Mandarin code-switching child-directed speech corpus for language identification and diarization', in Proceedings of the Annual Conference of the International Speech Communication Association Interspeech, pp. 4109 - 4113, http://dx.doi.org/10.21437/Interspeech.2023-1446

Li SS; Zhang X; Zhou S; Shu H; Liang R; Liu H; Garcia LP, 2023, 'PQLM - Multilingual Decentralized Portable Quantum Language Model', in ICASSP IEEE International Conference on Acoustics Speech and Signal Processing Proceedings, http://dx.doi.org/10.1109/ICASSP49357.2023.10095215

Li SS; Xu B; Zhang X; Liu H; Chao W; Garcia LP, 2023, 'A Quantitative Approach to Understand Self-Supervised Models as Cross-lingual Feature Extracters', in Proceedings of the 6th International Conference on Natural Language and Speech Processing (ICNLSP 2023), Association for Computational Linguistics, Online, pp. 200 - 211, https://aclanthology.org/2023.icnlsp-1.20/

Reports

Liu C; Ma L; Zhang XT; Zhang Y; Zhang H; Yang X; Tian F, 2026, Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation, arXiv, arXiv:2605.12034, https://arxiv.org/abs/2605.12034

Zhang H; Chen J; Wu D; Li Y; Zhang Y; Zhang XT; Liu C; Lin Q; Peng Y; Liu H; Chng ES; Yan C; Wu B; Huang Y; Yang X; Tian F, 2026, DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action, arXiv, arXiv:2605.20755, https://arxiv.org/abs/2605.20755

Zhang Y; Zhang XT; Liu D; Tian F; Deng Y; Chen J; Lin Q; Zhang H; Li Y; Gong J; Huang Y; Zhao L; Yao C; Liu H; Chng ES; Yang X; Yu G; Zhang X; Jiang D, 2026, Step-Audio-R1.5 Technical Report, arXiv, arXiv:2604.25719, https://arxiv.org/abs/2604.25719

Lin B; Zhao B; Wu B; Yan C; Wu C; Yi C; Yao C; Liu D; Tian F; Tian F; Sun H; Zhang H; Zhen J; Gong J; Chen J; Xie L; Li P; Yang P; Tan P; Lin Q; Li R; Hu S; Zhou S; Qu W; Li X; Zhang XT; Yang X; Yang Y; Huang Y; Fu Y; Luo Y; Li Y; Zhang Y; Sheng Z; Li B; Zeng C; Zhang C; Geng C; Dong C; Feng C; Zhou D; Wan D; Chen D; Zhang D; Pang D; Yang G; Hu G; Zhu H; Gao J; Liang J; Wan J; Yuan J; An K; Lei L; Zhong L; Cai L; Ren M; Xu M; Li M; Li M; Wang N; Tong Q; Huang Q; Du Q; Wang R; Zhou S; Qiu S; Peng S; Yang S; Tu S; Deng T; Xu T; Wang T; Niu W; Xie W; Zhang X; Feng X; Liu X; Chen X; Wu X; Wu Y; Li Y; Liu Y; Zhang Y; Liu Y; Long Y; Luo Y; Ding Y; Wang Y; Yin Y; Xu Y; Yang Y; Huang Z; Wu Z; Li Z; Zhou Z; Jiang D; Li F; Yu G; Zhang X; Zhu Y, 2026, StepAudio 2.5 Technical Report, arXiv, arXiv:2605.23463, https://arxiv.org/abs/2605.23463

Wu D; Zhang H; Chen J; Liu H; Chng ES; Tian F; Yang X; Zhang X; Jiang D; Yu G, 2025, Mind-Paced Speaking: A Dual-Brain Approach to Real-Time Reasoning in Spoken Language Models, arXiv, arXiv:2510.09592, https://arxiv.org/abs/2510.09592

Wu B; Yan C; Hu C; Yi C; Feng C; Tian F; Shen F; Yu G; Zhang H; Li J; Chen M; Liu P; You W; Zhang XT; Li X; Yang X; Deng Y; Huang Y; Li Y; Zhang Y; You Z; Li B; Wan C; Hu H; Zhen J; Chen S; Yuan S; Zhang X; Jiang Y; Zhou Y; Yang Y; Li B; Ma B; Song C; Pang D; Hu G; Sun H; An K; Wang N; Gao S; Ji W; Li W; Sun W; Wen X; Ren Y; Ma Y; Lu Y; Wang B; Li B; Miao C; Liu C; Xu C; Shi D; Hu D; Wu D; Liu E; Huang G; Yan G; Zhang H; Nie H; Jia H; Zhou H; Sun J; Wu J; Wu J; Yang J; Yang J; Lin J; Li K; Yang L; Shi L; Zhou L; Gu L; Li M; Li M; Li M; Wu N; Han Q; Tan Q; Pang S; Fan S; Liu S; Cao T; Lu W; He W; Xie W; Zhao X; Li X; Yu Y; Yang Y; Liu Y; Lu Y; Wang Y; Ding Y; Liang Y; Lu Y; Luo Y; Yin Y; Zhan Y; Zhang Y; Yang Z; Zhang Z; Jiao B; Jiang D; Shum H-Y; Chen J; Li J; Zhang X; Zhu Y, 2025, Step-audio 2 technical report, arXiv, arXiv:2507.16632, https://arxiv.org/abs/2507.16632

Yan C; Wu B; Yang P; Tan P; Hu G; Zhang Y; Tian F; Yang X; Zhang X; Jiang D; Yu G, 2025, Step-Audio-EditX Technical Report, arXiv, arXiv:2511.03601, https://arxiv.org/abs/2511.03601

Tian F; Zhang XT; Zhang Y; Zhang H; Li Y; Liu D; Deng Y; Wu D; Chen J; Zhao L; Yao C; Liu H; Chng ES; Yang X; Zhang X; Jiang D; Yu G, 2025, Step-Audio-R1 Technical Report, arXiv, arXiv:2511.15848, https://arxiv.org/abs/2511.15848

Working Papers

Li Y; Zhang X; Li Y; Guo Z; Zhang H; Chng ES; Guan C, 2026, DepFlow: Disentangled Speech Generation to Mitigate Semantic Bias in Depression Detection, http://dx.doi.org, https://arxiv.org/abs/2601.00303

Zhang X; Li Y; Zhang H; Han S; Liu H; Zhang Q; Ahmed B; Epps J, 2026, The WER Trap: Shattering the Illusion of Unified Tokens in Speech Language Models, http://dx.doi.org, https://arxiv.org/abs/2605.29209

Zhang X; Southwell BJ; Pan S; Niu X; Ahmed B; Epps J, 2026, Why your tokenizer fails in information fusion: A timing-aware pre-quantization fusion for video-enhanced audio tokenization, http://dx.doi.org, https://arxiv.org/abs/2604.12145

Zhang H; Liu H; Zhang X; Zhang Q; Hu Y; Zhao J; Tian F; Yang X; Garcia LP; Chng ES, 2025, Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English, http://dx.doi.org, https://arxiv.org/abs/2505.17076

Deng Y; Hu G; Sun H; Zhang X; Zhang H; Tian F; Yang X; Yu G; Chng ES, 2025, Multi-bench: A multi-turn interactive benchmark for assessing emotional intelligence ability of spoken dialogue models, http://dx.doi.org, https://arxiv.org/abs/2511.00850

Huang A; Wu B; Wang B; Yan C; Hu C; Feng C; Tian F; Shen F; Li J; Chen M; Liu P; Miao R; You W; Chen X; Yang X; Huang Y; Zhang Y; Gong Z; Zhang Z; Zhou H; Sun J; Li B; Feng C; Wan C; Hu H; Wu J; Zhen J; Ming R; Yuan S; Zhang X; Zhou Y; Li B; Ma B; Wang H; An K; Ji W; Li W; Wen X; Kong X; Ma Y; Liang Y; Mou Y; Ahmidi B; Wang B; Li B; Miao C; Xu C; Wang C; Shi D; Sun D; Hu D; Sai D; Liu E; Huang G; Yan G; Wang H; Jia H; Zhang H; Gong J; Guo J; Liu J; Liu J; Feng J; Wu J; Wu J; Yang J; Wang J; Zhang J; Lin J; Li K; Xia L; Zhou L; Zhao L; Gu L; Chen M; Wu M; Li M; Li M; Li M; Liang M; Wang N; Hao N; Wu Q; Tan Q; Sun R; Shuai S; Pang S; Yang S; Gao S; Yuan S; Liu S; Deng S; Jiang S; Liu S; Cao T; Wang T; Deng W; Xie W; Ming W; He W; Sun W; Han X; Huang X; Deng X; Liu X; Wu X; Zhao X; Wei Y; Yu Y; Cao Y; Li Y; Ma Y; Xu Y; Wang Y; Shi Y; Wang Y; Zhou Y; Zhong Y; Zhang Y; Wei Y; Luo Y; Lu Y; Yin Y; Luo Y; Ding Y; Yan Y; Dai Y; Yang Y; Xie Z; Ge Z; Sun Z; Huang Z; Chang Z; Guan Z; Yang Z; Zhang Z; Jiao B; Jiang D; Shum H-Y; Chen J; Li J; Zhou S; Zhang X; Zhang X; Zhu Y, 2025, Step-audio: Unified understanding and generation in intelligent speech interaction, http://dx.doi.org, https://arxiv.org/abs/2502.11946

Preprints

Zhang X; Li Y; Zhang H; Han S; Liu H; Zhang Q; Ahmed B; Epps J, 2026, The WER Trap: Shattering the Illusion of Unified Tokens in Speech Language Models, https://arxiv.org/abs/2605.29209v1

Lin B; Zhao B; Wu B; Yan C; Wu C; Yi C; Yao C; Liu D; Tian F; Tian F; Sun H; Zhang H; Zhen J; Gong J; Chen J; Xie L; Li P; Yang P; Tan P; Lin Q; Li R; Hu S; Zhou S; Qu W; Li X; Zhang XT; Yang X; Yang Y; Huang Y; Fu Y; Luo Y; Li Y; Zhang Y; Sheng Z; Li B; Zeng C; Zhang C; Geng C; Dong C; Feng C; Zhou D; Wan D; Chen D; Zhang D; Pang D; Yang G; Hu G; Zhu H; Gao J; Liang J; Wan J; Yuan J; An K; Lei L; Zhong L; Cai L; Ren M; Xu M; Li M; Li M; Wang N; Tong Q; Huang Q; Du Q; Wang R; Zhou S; Qiu S; Peng S; Yang S; Tu S; Deng T; Xu T; Wang T; Niu W; Xie W; Zhang X; Feng X; Liu X; Chen X; Wu X; Wu Y; Li Y; Liu Y; Zhang Y; Liu Y; Long Y; Luo Y; Ding Y; Wang Y; Yin Y; Xu Y; Yang Y; Huang Z; Wu Z; Li Z; Zhou Z; Jiang D; Li F; Yu G; Zhang X; Zhu Y, 2026, StepAudio 2.5 Technical Report, https://arxiv.org/abs/2605.23463v1

Zhang H; Chen J; Wu D; Li Y; Zhang Y; Zhang XT; Liu C; Lin Q; Peng Y; Liu H; Chng ES; Yan C; Wu B; Huang Y; Yang X; Tian F, 2026, DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action, https://arxiv.org/abs/2605.20755v2

Liu C; Ma L; Zhang XT; Zhang Y; Zhang H; Yang X; Tian F, 2026, Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation, https://arxiv.org/abs/2605.12034v2

Zhang Y; Zhang XT; Liu D; Tian F; Deng Y; Chen J; Lin Q; Zhang H; Li Y; Gong J; Huang Y; Zhao L; Yao C; Liu H; Chng ES; Yang X; Yu G; Zhang X; Jiang D, 2026, Step-Audio-R1.5 Technical Report, https://arxiv.org/abs/2604.25719v2

Zhang X; Southwell BJ; Pan S; Niu X; Ahmed B; Epps J, 2026, Why Your Tokenizer Fails in Information Fusion: A Timing-Aware Pre-Quantization Fusion for Video-Enhanced Audio Tokenization, https://arxiv.org/abs/2604.12145v1

Li Y; Zhang X; Li Y; Guo Z; Zhang H; Chng ES; Guan C, 2026, DepFlow: Disentangled Speech Generation to Mitigate Semantic Bias in Depression Detection, https://arxiv.org/abs/2601.00303v1

Tian F; Zhang XT; Zhang Y; Zhang H; Li Y; Liu D; Deng Y; Wu D; Chen J; Zhao L; Yao C; Liu H; Chng ES; Yang X; Zhang X; Jiang D; Yu G, 2025, Step-Audio-R1 Technical Report, https://arxiv.org/abs/2511.15848v2

Yan C; Wu B; Yang P; Tan P; Hu G; Xie L; Zhang Y; Xiangyu ; Zhang ; Tian F; Yang X; Zhang X; Jiang D; Zhou S; Yu G, 2025, Step-Audio-EditX Technical Report, https://arxiv.org/abs/2511.03601v2

Deng Y; Hu G; Sun H; Zhang X; Zhang H; Tian F; Yang X; Yu G; Chng ES, 2025, MULTI-Bench: A Multi-Turn Interactive Benchmark for Assessing Emotional Intelligence ability of Spoken Dialogue Models, https://arxiv.org/abs/2511.00850v1

Wu D; Zhang H; Chen J; Xiangyu ; Zhang ; Liu H; Chng ES; Tian F; Yang X; Zhang X; Jiang D; Yu G, 2025, Mind-Paced Speaking: A Dual-Brain Approach to Real-Time Reasoning in Spoken Language Models, https://arxiv.org/abs/2510.09592v2

Wu B; Yan C; Hu C; Yi C; Feng C; Tian F; Shen F; Yu G; Zhang H; Li J; Chen M; Liu P; You W; Zhang XT; Li X; Yang X; Deng Y; Huang Y; Li Y; Zhang Y; You Z; Li B; Wan C; Hu H; Zhen J; Chen S; Yuan S; Zhang X; Jiang Y; Zhou Y; Yang Y; Li B; Ma B; Song C; Pang D; Hu G; Sun H; An K; Wang N; Gao S; Ji W; Li W; Sun W; Wen X; Ren Y; Ma Y; Lu Y; Wang B; Li B; Miao C; Liu C; Xu C; Shi D; Hu D; Wu D; Liu E; Huang G; Yan G; Zhang H; Nie H; Jia H; Zhou H; Sun J; Wu J; Wu J; Yang J; Yang J; Lin J; Li K; Yang L; Shi L; Zhou L; Gu L; Li M; Li M; Li M; Wu N; Han Q; Tan Q; Pang S; Fan S; Liu S; Cao T; Lu W; He W; Xie W; Zhao X; Li X; Yu Y; Yang Y; Liu Y; Lu Y; Wang Y; Ding Y; Liang Y; Lu Y; Luo Y; Yin Y; Zhan Y; Zhang Y; Yang Z; Zhang Z; Jiao B; Jiang D; Shum H-Y; Chen J; Li J; Zhang X; Zhu Y, 2025, Step-Audio 2 Technical Report, https://arxiv.org/abs/2507.16632v3

Zhang X; Fang F; Gao P; Qin B; Ahmed B; Epps J, 2025, Distinctive Feature Codec: An Adaptive Efficient Speech Representation for Depression Detection, https://arxiv.org/abs/2505.18516v2


Back to profile page