| 1 | Dreaming the Sound of Contact: Leveraging Video and Audio Generation for Zero-Shot Force-Aware Manipulation and Data Generation | Guanhua Ji, Tianyu Li, Dayoon Suh +3 | cs.RO | 2026-09-16 |
| 2 | FRAUDSkill: Structured Frozen-Weight Skill Optimization for Audio Anti-Fraud Detection | Chengxian Hu, Zhiming Ma, Mingjun Pan +9 | cs.SD | 2026-09-16 |
| 3 | TeleAntiFraud 2.0: A Refreshable, Profile-Grounded, and Audio-Based Benchmark for Telecom Fraud Detection | Huiyuan Liu, Zhiming Ma, Yanxing Liu +11 | cs.SD | 2026-09-16 |
| #4 | Label-free steering: Compressing test-time reinforcement learning into bias-only subspaces | Naveen Vakada, Mingyuan Li, Shaoxiong Ji | cs.LG | 2026-09-16 |
| #5 | TTM-Bench: A Framework for Text-to-Music System Performance Benchmarking | Giorgia Adorni, Michela Papandrea, Battista Rimoldi +1 | cs.SD | 2026-09-16 |
| #6 | VoiceTrace: A Benchmark and Retrieval Framework for Who-Said-What Speech Retrieval | Aaron Yee, Fengjie Lu, Jiarui Hai +5 | cs.SD | 2026-09-16 |
| #7 | Divide and Conquer: Mixture-of-Bottleneck Experts in Informative Ordinal Space for Video-based Multimodal Sentiment Analysis | Ronghao Lin, Qiaolin He, Zefeng Lu +5 | cs.MM | 2026-09-16 |
| #8 | MSR: Multiple Subject Reference for Video Generation | Guannan Li, Jiaji Chen, Jingyuan Liao +2 | cs.CV | 2026-09-16 |
| #9 | Look Less, Hear Better: Jointly Rewarded GRPO for Streaming ASR | Xiuwen Zheng | cs.SD | 2026-09-16 |
| #10 | Can MiniMax-H3 Reason About the Physical World? An Evaluation of Omni-Modal Generative Model | Haoyu Zhao, Zihao Zhao, Tianyu Deng +10 | cs.CV | 2026-09-16 |
| #11 | Correlation-Guided Encoder Selection for Multi-Encoder Large Audio-Language Models | Pei-Jun Liao, Hung-Shin Lee, Wenze Ren +3 | eess.AS | 2026-09-16 |
| #12 | G-Mamba: Sparse Graph-Guided Mamba for Audio-Visual Speech Enhancement | Guo-Ruei Tseng, Hung-Shin Lee, Hsin-Min Wang +1 | eess.AS | 2026-09-16 |
| #13 | Audio for Sports Highlight Detection: A Comparative Empirical Study | Hao Xu, Meenakshi Sarkar, Vishnu Raj +1 | cs.CV | 2026-09-15 |
| #14 | The Unbearable Weight: Scaling Models and Methods for UAV Audio Classification | Andrew P. Berg, Qian Zhang, Mia Y. Wang | cs.SD | 2026-09-15 |
| #15 | LACE: Layer-Wise Compression for Dynamic Frame Rate Codecs | Thanapat Trachu, Samuele Cornell, William Chen +1 | cs.SD | 2026-09-15 |
| #16 | Video-HolmesV2: Can MLLMs Reason with Spatio-Temporal Audio-Visual Evidence in Long Videos? | Zhaoyang Wei, Zipeng Wang, Yushe Cao +10 | cs.CV | 2026-09-15 |
| #17 | Sample-Conditioned Representation Selection for Audio Few-Shot Learning | Fengrui Liu, Ningxin Shen, Yi Li +3 | cs.AI | 2026-09-15 |
| #18 | Audio-Visual Turn-taking Prediction in Cocktail Party Scenarios | Long-Vu Hoang, Naomi Harte | cs.SD | 2026-09-15 |
| #19 | Structure Across Voices: Comparing acoustic-event type accumulation and sequence dependence across four vocal repertoires using frozen audio encoders | Mudit Sinha, Sanika Chavan | cs.SD | 2026-09-15 |
| #20 | CLASH: Counterfactual Auditing of Lexical and Prosodic Reliance in Spoken Sarcasm Detection | Qiyang Sun, Xudong Li, Yupei Li +4 | cs.SD | 2026-09-15 |
| #21 | A multimodal large language model for evidence-based autism spectrum disorder screening | Jun Chen, Qi Zhao, Yunliang Jiang +8 | cs.CV | 2026-09-15 |
| #22 | Language Orthogonalization for Zero-Shot Cross-Lingual Audio Deepfake Detection | Minu Kim, Ji Sub Um, Hoirin Kim | eess.AS | 2026-09-15 |
| #23 | LynnReal-Omni: Native multi-modal Video Generation for Agentic Visual Workflows | Xiaofeng Mao, Peijia Lin, Shaohao Rui +3 | cs.CV | 2026-09-14 |
| #24 | PIVOT: Physics-Grounded Verification for AI-Generated Audio-Video Detection | Bo Zheng, Kangran Zhao, Xiaoyu Zhang +7 | cs.CV | 2026-09-14 |
| #25 | MUUNRiver-Bench: Diagnosing Relation-Dependent Music Retrieval with Multimodal Instructions | Zhancheng Guo, Congren Dai, Shangda Wu +4 | cs.SD | 2026-09-14 |
| #26 | Query-Conditioned Spherical Centroid Aggregation for Multimodal Retrieval | Ambuj Mehrish, Anindya Nag, Sebastiano Vascon | cs.CV | 2026-09-14 |
| #27 | Hypergraph-Regularized Gramian Volumes for Multimodal Retrieval | Anindya Nag, Ambuj Mehrish, Sebastiano Vascon | cs.CV | 2026-09-14 |
| #28 | Reducing the Output-Mode Gap in Speech Language Models via Joint-Output On-Policy Distillation | Daxin Tan, Dehua Tao, Chengxi Deng +2 | eess.AS | 2026-09-14 |
| #29 | MAST: Label-Efficient, Robust, and Generalizable Sound Detection for Biodiversity Monitoring via Masked Audio Pretraining and Self-Training | Tianyi Xu, Daniel Pimentel-Alarcón, Zuzana Buřivalová +1 | cs.SD | 2026-09-14 |
| #30 | Augmenting Large Audio-Language Models with Frame-Level Grounding for Fine-Grained Temporal Perception | Yanfeng Shi, Yan Song, Junhui Li +4 | cs.SD | 2026-09-14 |
| #31 | Omni-Streaming Thinking | Enjun Du, Siyi Liu, Ziyu Zheng +4 | cs.LG | 2026-09-14 |
| #32 | ER-EDF: A Psychology-Grounded Emotion Regulation Framework for Speech Empathetic Dialogue Generation in Large Audio-Language Models | Hongyu Jin, Wenda Zhang, Runqiu Fei +3 | cs.AI | 2026-09-14 |
| #33 | Rethinking Procedural Audio Pre-training: Source Scaling and Objective Adaptation | Jiajun Peng, Fengrui Liu, Xinyu Liu +1 | cs.SD | 2026-09-14 |
| #34 | POLARIS: Training-Free Audio Fingerprinting with Saliency-Based Landmarks and Delaunay Grouping | Jiheng Li | cs.SD | 2026-09-13 |
| #35 | Tone on a Budget: A Reference-Free Metric for Lexical Tone in Massively Multilingual Text-to-Speech | Moses Daudu, Adeola Enitan Bamidele, Honor-Jesus Bezaleel | cs.CL | 2026-09-13 |
| #36 | Parameter isolation with domain-specific experts for incremental audio classification | Jongyeon Park, Do-Hyeon Lim, Sang-won Park +4 | eess.AS | 2026-09-13 |
| #37 | Exploring Multimodal Turn-Taking Cues in Face-to-Face Conversation using Voice Activity Projection | Willem Berner, Julio Cesar Cavalcanti, Kalle Åström +1 | eess.AS | 2026-09-13 |
| #38 | Beyond Scene Description: Multi-Agent Orchestration for Non-visual Access to Virtual Worlds | Toqeer Ali Syed, Ali Akarma, Adeel Ahmad +1 | cs.AI | 2026-09-13 |
| #39 | Bridging the Modality Gap in Long-Form Clinical Audio: A Comparative Study of Lightweight and Heavyweight End-to-End SOAP Generation | Ziyu Zhang, Mingchen Shao, Wenjie Tian +3 | cs.SD | 2026-09-13 |
| #40 | AURA: Unified Multimodal Framework for Conversational Music Editing | Quoc-Huy Trinh, Minh-Van Nguyen, Debesh Jha | cs.SD | 2026-09-13 |
| #41 | Inherited Heads: Audio language models track speakers with their text backbone's attention, and an attention-mass ranking retrieves a different set | Bojro Das | cs.LG | 2026-09-12 |
| #42 | CyFM: Cylindrical Optimal Transport for Few-Step Complex-Valued Flow Matching | Marcel Musiałek, Iga Wolanin, Damian Ryczko +2 | cs.LG | 2026-09-12 |
| #43 | A New Transformer-Based Approach for Audio-Based Kinship Verification and a New Uncontrolled Mandarin Kinship Speech Dataset | Qiyang Sun, Langqing Zhang, Yupei Li +1 | cs.SD | 2026-09-12 |
| #44 | Talking to Me or Someone Else? Rethinking Talk-to-Me Detection in Egocentric Videos | Feiyu Du, Xi He, Jia Li +2 | cs.CV | 2026-09-12 |
| #45 | Lie to me: Detecting Managerial Evasiveness in Earnings Calls via Conversational Audio Encoders | Huizhong Chen, Huan Zhang | cs.LG | 2026-09-12 |
| #46 | ReH-FUSE: Reliability-Aware Hierarchical Fusion of Experts for Multimodal Emotion Recognition in Conversation | Guan-Hua Wen, Hou-Chiang Tseng, Kuan-Yu Chen | cs.LG | 2026-09-12 |
| #47 | CRAF: Cross-View Residual-Aware Fusion for Deepfake Speech Detection | Minh-Xuan Phan, Khalid Zaman, Candy Olivia Mawalim +1 | cs.SD | 2026-09-12 |
| #48 | DiVA: Enabling Interactive Digital Life Simulation via Video Models | Cheng Chen, Hao Ouyang, Qiuyu Wang +11 | cs.CV | 2026-09-12 |
| #49 | Realtime-Venus: A full-duplex interaction system with asynchronous delegation | Ruixiang Zhao, Hualei Wang, Renhe Sun +24 | cs.CV | 2026-09-12 |
| #50 | UniqueShip: Mitigating Data Leakage in Acoustic Ship Classification Benchmark Datasets | Connor Hashemi, Trevor Stout, Anthony Hoogs +1 | cs.SD | 2026-09-12 |