PaperScope
LIVE · 2026-09-17 05:40 UTC

audio 14 papers this week · +88% WoW

papers mentioning "audio" in title/abstract · 30d window

Latestcs.CLcs.LGcs.AIcs.CV

Mentions per Day (30d)

Latest Papers

#TitleAuthorsCatDate
1Dreaming the Sound of Contact: Leveraging Video and Audio Generation for Zero-Shot Force-Aware Manipulation and Data GenerationGuanhua Ji, Tianyu Li, Dayoon Suh +3cs.RO2026-09-16
2FRAUDSkill: Structured Frozen-Weight Skill Optimization for Audio Anti-Fraud DetectionChengxian Hu, Zhiming Ma, Mingjun Pan +9cs.SD2026-09-16
3TeleAntiFraud 2.0: A Refreshable, Profile-Grounded, and Audio-Based Benchmark for Telecom Fraud DetectionHuiyuan Liu, Zhiming Ma, Yanxing Liu +11cs.SD2026-09-16
#4Label-free steering: Compressing test-time reinforcement learning into bias-only subspacesNaveen Vakada, Mingyuan Li, Shaoxiong Jics.LG2026-09-16
#5TTM-Bench: A Framework for Text-to-Music System Performance BenchmarkingGiorgia Adorni, Michela Papandrea, Battista Rimoldi +1cs.SD2026-09-16
#6VoiceTrace: A Benchmark and Retrieval Framework for Who-Said-What Speech RetrievalAaron Yee, Fengjie Lu, Jiarui Hai +5cs.SD2026-09-16
#7Divide and Conquer: Mixture-of-Bottleneck Experts in Informative Ordinal Space for Video-based Multimodal Sentiment AnalysisRonghao Lin, Qiaolin He, Zefeng Lu +5cs.MM2026-09-16
#8MSR: Multiple Subject Reference for Video GenerationGuannan Li, Jiaji Chen, Jingyuan Liao +2cs.CV2026-09-16
#9Look Less, Hear Better: Jointly Rewarded GRPO for Streaming ASRXiuwen Zhengcs.SD2026-09-16
#10Can MiniMax-H3 Reason About the Physical World? An Evaluation of Omni-Modal Generative ModelHaoyu Zhao, Zihao Zhao, Tianyu Deng +10cs.CV2026-09-16
#11Correlation-Guided Encoder Selection for Multi-Encoder Large Audio-Language ModelsPei-Jun Liao, Hung-Shin Lee, Wenze Ren +3eess.AS2026-09-16
#12G-Mamba: Sparse Graph-Guided Mamba for Audio-Visual Speech EnhancementGuo-Ruei Tseng, Hung-Shin Lee, Hsin-Min Wang +1eess.AS2026-09-16
#13Audio for Sports Highlight Detection: A Comparative Empirical StudyHao Xu, Meenakshi Sarkar, Vishnu Raj +1cs.CV2026-09-15
#14The Unbearable Weight: Scaling Models and Methods for UAV Audio ClassificationAndrew P. Berg, Qian Zhang, Mia Y. Wangcs.SD2026-09-15
#15LACE: Layer-Wise Compression for Dynamic Frame Rate CodecsThanapat Trachu, Samuele Cornell, William Chen +1cs.SD2026-09-15
#16Video-HolmesV2: Can MLLMs Reason with Spatio-Temporal Audio-Visual Evidence in Long Videos?Zhaoyang Wei, Zipeng Wang, Yushe Cao +10cs.CV2026-09-15
#17Sample-Conditioned Representation Selection for Audio Few-Shot LearningFengrui Liu, Ningxin Shen, Yi Li +3cs.AI2026-09-15
#18Audio-Visual Turn-taking Prediction in Cocktail Party ScenariosLong-Vu Hoang, Naomi Hartecs.SD2026-09-15
#19Structure Across Voices: Comparing acoustic-event type accumulation and sequence dependence across four vocal repertoires using frozen audio encodersMudit Sinha, Sanika Chavancs.SD2026-09-15
#20CLASH: Counterfactual Auditing of Lexical and Prosodic Reliance in Spoken Sarcasm DetectionQiyang Sun, Xudong Li, Yupei Li +4cs.SD2026-09-15
#21A multimodal large language model for evidence-based autism spectrum disorder screeningJun Chen, Qi Zhao, Yunliang Jiang +8cs.CV2026-09-15
#22Language Orthogonalization for Zero-Shot Cross-Lingual Audio Deepfake DetectionMinu Kim, Ji Sub Um, Hoirin Kimeess.AS2026-09-15
#23LynnReal-Omni: Native multi-modal Video Generation for Agentic Visual WorkflowsXiaofeng Mao, Peijia Lin, Shaohao Rui +3cs.CV2026-09-14
#24PIVOT: Physics-Grounded Verification for AI-Generated Audio-Video DetectionBo Zheng, Kangran Zhao, Xiaoyu Zhang +7cs.CV2026-09-14
#25MUUNRiver-Bench: Diagnosing Relation-Dependent Music Retrieval with Multimodal InstructionsZhancheng Guo, Congren Dai, Shangda Wu +4cs.SD2026-09-14
#26Query-Conditioned Spherical Centroid Aggregation for Multimodal RetrievalAmbuj Mehrish, Anindya Nag, Sebastiano Vasconcs.CV2026-09-14
#27Hypergraph-Regularized Gramian Volumes for Multimodal RetrievalAnindya Nag, Ambuj Mehrish, Sebastiano Vasconcs.CV2026-09-14
#28Reducing the Output-Mode Gap in Speech Language Models via Joint-Output On-Policy DistillationDaxin Tan, Dehua Tao, Chengxi Deng +2eess.AS2026-09-14
#29MAST: Label-Efficient, Robust, and Generalizable Sound Detection for Biodiversity Monitoring via Masked Audio Pretraining and Self-TrainingTianyi Xu, Daniel Pimentel-Alarcón, Zuzana Buřivalová +1cs.SD2026-09-14
#30Augmenting Large Audio-Language Models with Frame-Level Grounding for Fine-Grained Temporal PerceptionYanfeng Shi, Yan Song, Junhui Li +4cs.SD2026-09-14
#31Omni-Streaming ThinkingEnjun Du, Siyi Liu, Ziyu Zheng +4cs.LG2026-09-14
#32ER-EDF: A Psychology-Grounded Emotion Regulation Framework for Speech Empathetic Dialogue Generation in Large Audio-Language ModelsHongyu Jin, Wenda Zhang, Runqiu Fei +3cs.AI2026-09-14
#33Rethinking Procedural Audio Pre-training: Source Scaling and Objective AdaptationJiajun Peng, Fengrui Liu, Xinyu Liu +1cs.SD2026-09-14
#34POLARIS: Training-Free Audio Fingerprinting with Saliency-Based Landmarks and Delaunay GroupingJiheng Lics.SD2026-09-13
#35Tone on a Budget: A Reference-Free Metric for Lexical Tone in Massively Multilingual Text-to-SpeechMoses Daudu, Adeola Enitan Bamidele, Honor-Jesus Bezaleelcs.CL2026-09-13
#36Parameter isolation with domain-specific experts for incremental audio classificationJongyeon Park, Do-Hyeon Lim, Sang-won Park +4eess.AS2026-09-13
#37Exploring Multimodal Turn-Taking Cues in Face-to-Face Conversation using Voice Activity ProjectionWillem Berner, Julio Cesar Cavalcanti, Kalle Åström +1eess.AS2026-09-13
#38Beyond Scene Description: Multi-Agent Orchestration for Non-visual Access to Virtual WorldsToqeer Ali Syed, Ali Akarma, Adeel Ahmad +1cs.AI2026-09-13
#39Bridging the Modality Gap in Long-Form Clinical Audio: A Comparative Study of Lightweight and Heavyweight End-to-End SOAP GenerationZiyu Zhang, Mingchen Shao, Wenjie Tian +3cs.SD2026-09-13
#40AURA: Unified Multimodal Framework for Conversational Music EditingQuoc-Huy Trinh, Minh-Van Nguyen, Debesh Jhacs.SD2026-09-13
#41Inherited Heads: Audio language models track speakers with their text backbone's attention, and an attention-mass ranking retrieves a different setBojro Dascs.LG2026-09-12
#42CyFM: Cylindrical Optimal Transport for Few-Step Complex-Valued Flow MatchingMarcel Musiałek, Iga Wolanin, Damian Ryczko +2cs.LG2026-09-12
#43A New Transformer-Based Approach for Audio-Based Kinship Verification and a New Uncontrolled Mandarin Kinship Speech DatasetQiyang Sun, Langqing Zhang, Yupei Li +1cs.SD2026-09-12
#44Talking to Me or Someone Else? Rethinking Talk-to-Me Detection in Egocentric VideosFeiyu Du, Xi He, Jia Li +2cs.CV2026-09-12
#45Lie to me: Detecting Managerial Evasiveness in Earnings Calls via Conversational Audio EncodersHuizhong Chen, Huan Zhangcs.LG2026-09-12
#46ReH-FUSE: Reliability-Aware Hierarchical Fusion of Experts for Multimodal Emotion Recognition in ConversationGuan-Hua Wen, Hou-Chiang Tseng, Kuan-Yu Chencs.LG2026-09-12
#47CRAF: Cross-View Residual-Aware Fusion for Deepfake Speech DetectionMinh-Xuan Phan, Khalid Zaman, Candy Olivia Mawalim +1cs.SD2026-09-12
#48DiVA: Enabling Interactive Digital Life Simulation via Video ModelsCheng Chen, Hao Ouyang, Qiuyu Wang +11cs.CV2026-09-12
#49Realtime-Venus: A full-duplex interaction system with asynchronous delegationRuixiang Zhao, Hualei Wang, Renhe Sun +24cs.CV2026-09-12
#50UniqueShip: Mitigating Data Leakage in Acoustic Ship Classification Benchmark DatasetsConnor Hashemi, Trevor Stout, Anthony Hoogs +1cs.SD2026-09-12

all trends · matching is case-insensitive substring after tokenization