Scheduled Maintenance Notice

Please note that Researcher Profiles will be undergoing scheduled maintenance on Wednesday 7th Oct, from 8:00am to 9:00am. During this time, the Researcher Profiles system will be unavailable. We apologise for any inconvenience and appreciate your understanding.

Select Publications

Preprints

Zhang X; Li Y; Zhang H; Han S; Liu H; Zhang Q; Ahmed B; Epps J, 2026, The WER Trap: Shattering the Illusion of Unified Tokens in Speech Language Models, https://arxiv.org/abs/2605.29209v1

Lin B; Zhao B; Wu B; Yan C; Wu C; Yi C; Yao C; Liu D; Tian F; Tian F; Sun H; Zhang H; Zhen J; Gong J; Chen J; Xie L; Li P; Yang P; Tan P; Lin Q; Li R; Hu S; Zhou S; Qu W; Li X; Zhang XT; Yang X; Yang Y; Huang Y; Fu Y; Luo Y; Li Y; Zhang Y; Sheng Z; Li B; Zeng C; Zhang C; Geng C; Dong C; Feng C; Zhou D; Wan D; Chen D; Zhang D; Pang D; Yang G; Hu G; Zhu H; Gao J; Liang J; Wan J; Yuan J; An K; Lei L; Zhong L; Cai L; Ren M; Xu M; Li M; Li M; Wang N; Tong Q; Huang Q; Du Q; Wang R; Zhou S; Qiu S; Peng S; Yang S; Tu S; Deng T; Xu T; Wang T; Niu W; Xie W; Zhang X; Feng X; Liu X; Chen X; Wu X; Wu Y; Li Y; Liu Y; Zhang Y; Liu Y; Long Y; Luo Y; Ding Y; Wang Y; Yin Y; Xu Y; Yang Y; Huang Z; Wu Z; Li Z; Zhou Z; Jiang D; Li F; Yu G; Zhang X; Zhu Y, 2026, StepAudio 2.5 Technical Report, https://arxiv.org/abs/2605.23463v1

Zhang H; Chen J; Wu D; Li Y; Zhang Y; Zhang XT; Liu C; Lin Q; Peng Y; Liu H; Chng ES; Yan C; Wu B; Huang Y; Yang X; Tian F, 2026, DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action, https://arxiv.org/abs/2605.20755v2

Liu C; Ma L; Zhang XT; Zhang Y; Zhang H; Yang X; Tian F, 2026, Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation, https://arxiv.org/abs/2605.12034v2

Zhang Y; Zhang XT; Liu D; Tian F; Deng Y; Chen J; Lin Q; Zhang H; Li Y; Gong J; Huang Y; Zhao L; Yao C; Liu H; Chng ES; Yang X; Yu G; Zhang X; Jiang D, 2026, Step-Audio-R1.5 Technical Report, https://arxiv.org/abs/2604.25719v2

Zhang X; Southwell BJ; Pan S; Niu X; Ahmed B; Epps J, 2026, Why Your Tokenizer Fails in Information Fusion: A Timing-Aware Pre-Quantization Fusion for Video-Enhanced Audio Tokenization, https://arxiv.org/abs/2604.12145v1

Li Y; Zhang X; Li Y; Guo Z; Zhang H; Chng ES; Guan C, 2026, DepFlow: Disentangled Speech Generation to Mitigate Semantic Bias in Depression Detection, https://arxiv.org/abs/2601.00303v1

Tian F; Zhang XT; Zhang Y; Zhang H; Li Y; Liu D; Deng Y; Wu D; Chen J; Zhao L; Yao C; Liu H; Chng ES; Yang X; Zhang X; Jiang D; Yu G, 2025, Step-Audio-R1 Technical Report, https://arxiv.org/abs/2511.15848v2

Yan C; Wu B; Yang P; Tan P; Hu G; Xie L; Zhang Y; Xiangyu ; Zhang ; Tian F; Yang X; Zhang X; Jiang D; Zhou S; Yu G, 2025, Step-Audio-EditX Technical Report, https://arxiv.org/abs/2511.03601v2

Deng Y; Hu G; Sun H; Zhang X; Zhang H; Tian F; Yang X; Yu G; Chng ES, 2025, MULTI-Bench: A Multi-Turn Interactive Benchmark for Assessing Emotional Intelligence ability of Spoken Dialogue Models, https://arxiv.org/abs/2511.00850v1

Wu D; Zhang H; Chen J; Xiangyu ; Zhang ; Liu H; Chng ES; Tian F; Yang X; Zhang X; Jiang D; Yu G, 2025, Mind-Paced Speaking: A Dual-Brain Approach to Real-Time Reasoning in Spoken Language Models, https://arxiv.org/abs/2510.09592v2

Wu B; Yan C; Hu C; Yi C; Feng C; Tian F; Shen F; Yu G; Zhang H; Li J; Chen M; Liu P; You W; Zhang XT; Li X; Yang X; Deng Y; Huang Y; Li Y; Zhang Y; You Z; Li B; Wan C; Hu H; Zhen J; Chen S; Yuan S; Zhang X; Jiang Y; Zhou Y; Yang Y; Li B; Ma B; Song C; Pang D; Hu G; Sun H; An K; Wang N; Gao S; Ji W; Li W; Sun W; Wen X; Ren Y; Ma Y; Lu Y; Wang B; Li B; Miao C; Liu C; Xu C; Shi D; Hu D; Wu D; Liu E; Huang G; Yan G; Zhang H; Nie H; Jia H; Zhou H; Sun J; Wu J; Wu J; Yang J; Yang J; Lin J; Li K; Yang L; Shi L; Zhou L; Gu L; Li M; Li M; Li M; Wu N; Han Q; Tan Q; Pang S; Fan S; Liu S; Cao T; Lu W; He W; Xie W; Zhao X; Li X; Yu Y; Yang Y; Liu Y; Lu Y; Wang Y; Ding Y; Liang Y; Lu Y; Luo Y; Yin Y; Zhan Y; Zhang Y; Yang Z; Zhang Z; Jiao B; Jiang D; Shum H-Y; Chen J; Li J; Zhang X; Zhu Y, 2025, Step-Audio 2 Technical Report, https://arxiv.org/abs/2507.16632v3

Zhang X; Fang F; Gao P; Qin B; Ahmed B; Epps J, 2025, Distinctive Feature Codec: An Adaptive Efficient Speech Representation for Depression Detection, https://arxiv.org/abs/2505.18516v2

Zhang H; Liu H; Zhang X; Zhang Q; Hu Y; Zhao J; Tian F; Yang X; Garcia LP; Chng ES, 2025, Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English, https://arxiv.org/abs/2505.17076v3

Huang A; Wu B; Wang B; Yan C; Hu C; Feng C; Tian F; Shen F; Li J; Chen M; Liu P; Miao R; You W; Chen X; Yang X; Huang Y; Zhang Y; Gong Z; Zhang Z; Zhou H; Sun J; Li B; Feng C; Wan C; Hu H; Wu J; Zhen J; Ming R; Yuan S; Zhang X; Zhou Y; Li B; Ma B; Wang H; An K; Ji W; Li W; Wen X; Kong X; Ma Y; Liang Y; Mou Y; Ahmidi B; Wang B; Li B; Miao C; Xu C; Wang C; Shi D; Sun D; Hu D; Sai D; Liu E; Huang G; Yan G; Wang H; Jia H; Zhang H; Gong J; Guo J; Liu J; Liu J; Feng J; Wu J; Wu J; Yang J; Wang J; Zhang J; Lin J; Li K; Xia L; Zhou L; Zhao L; Gu L; Chen M; Wu M; Li M; Li M; Li M; Liang M; Wang N; Hao N; Wu Q; Tan Q; Sun R; Shuai S; Pang S; Yang S; Gao S; Yuan S; Liu S; Deng S; Jiang S; Liu S; Cao T; Wang T; Deng W; Xie W; Ming W; He W; Sun W; Han X; Huang X; Deng X; Liu X; Wu X; Zhao X; Wei Y; Yu Y; Cao Y; Li Y; Ma Y; Xu Y; Wang Y; Shi Y; Wang Y; Zhou Y; Zhong Y; Zhang Y; Wei Y; Luo Y; Lu Y; Yin Y; Luo Y; Ding Y; Yan Y; Dai Y; Yang Y; Xie Z; Ge Z; Sun Z; Huang Z; Chang Z; Guan Z; Yang Z; Zhang Z; Jiao B; Jiang D; Shum H-Y; Chen J; Li J; Zhou S; Zhang X; Zhang X; Zhu Y, 2025, Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction, https://arxiv.org/abs/2502.11946v2

Zhang X; Li SS; He Z; Togneri R; Garcia LP, 2022, End-to-End Lyrics Recognition with Self-supervised Learning, https://arxiv.org/abs/2209.12702v4


Back to profile page