PaperScope
LIVE · 2026-09-10 05:40 UTC

speech 15 papers this week · -20% WoW

papers mentioning "speech" in title/abstract · 30d window

Latestcs.CLcs.LGcs.AIcs.CV

Mentions per Day (30d)

Latest Papers

#TitleAuthorsCatDate
1Do speech foundation models really learn words?Robin Huo, Ewan Dunbarcs.CL2026-09-09
2Candor-LR: A Dyadic Conversational Dataset for Audio-Visual Speech RecognitionRishabh Jain, Aristeidis Papadopoulos, Zhaofeng Lin +1eess.AS2026-09-09
3AVSRBench: A Multi-Condition AVSR BenchmarkRishabh Jain, Naomi Harteeess.AS2026-09-09
#4The Semantic Bottleneck: Leveraging Semantic Representations for Non-Invasive Speech DecodingGilad D. Landau, Dulhan Jayalath, Oiwi Parker Jonescs.CL2026-09-09
#5Politics of Feelings: Emotional Expression and Legislative Effectiveness in the U.S. CongressSegun Aroyehuncs.CL2026-09-09
#6NOPE-HYPE: A Structured Simulation Workflow for Robust Speech-to-Text Across Diverse Acoustic EnvironmentsNiramay M. Patel, Bibek Behera, Raksha Sharmacs.SD2026-09-09
#7Orukeet: Multilingual ASR with Frozen Gabor KernelsNathan Roll, Irene Yi, Büşra Marşan +6cs.SD2026-09-09
#8Zero-Shot Temporal Localisation of Audio Deepfakes in Multi-Speaker ConversationsSoumyadeep Roycs.SD2026-09-09
#9Deterministic Prompting for Speaker-Stable Low-Resource Greek TTSGeorgios Syllas, Efthymios Georgiou, Kosmas Kritsis +1cs.SD2026-09-09
#10Leveraging Fine-grained Error Correction in Korean Speech Recognition for Consultation ServicesYonghyun Jun, Jimin Lee, Hwan Chang +3cs.CL2026-09-09
#11Shifting Relational Paradigms for Affective Computing: Affective Resonance, Vitality Affects, and Vocal Interaction FieldsCy Gorman, Yihang Yaocs.AI2026-09-09
#12$S^3$-Bench: Evaluating Speech Interaction Models as Scientific Voice AssistantsHeyang Liu, Jiayi Huang, Wenyang Xiao +8cs.CL2026-09-09
#13MUCnoHARM@GermEval Shared Task 2026: Retrieval-based In-Context Learning for Defamatory Offences, and Where It Falls ShortKristin Gnadt, Maximilian Meidinger, Matthias Aßenmachercs.CL2026-09-09
#14Arti-JEPA: Adapting Video World Model to Real-Time MRI of the Vocal Tract for Speech-Production AnalysisHong Nguyen, Sean Foley, Christina Hagedorn +4cs.SD2026-09-09
#15StreamAlign: Streaming Text-Aligned Speech TokenizationKang-wook Kim, Jinyoung Park, Jinsoo Kim +3cs.CL2026-09-09
#16X2-NativeCursor: Native-Token Text Progress Tracking for Incremental-Text Streaming Codec TTSZehan Liu, Carl Chen, Rime Wen +7cs.CL2026-09-09
#17SEA-SpeechBench: A Large-Scale Multitask Benchmark for Speech Understanding Across Southeast AsiaJingyi Liao, Wenyu Zhang, Zhuohan Liu +6cs.CL2026-09-09
#18Who Are They to Each Other? Multi-Agent Reasoning for Speaker Relationship InferenceYaohan Guan, Yen-Ju Lu, Yuzhe Wang +5cs.MA2026-09-09
#19BuzzASR: A Swarm of 100+ Monolingual Speech Recognition ModelsShivam Singh, Aditya Yadavalli, Catherine Arnett +1cs.CL2026-09-09
#20The Mutations of Machine SpeechMauricio Figueroacs.CL2026-09-08
#21Voice or Stereotype? Disentangling Acoustic and Content-Based Gender in Speech-to-Speech ModelsXiaoqun Liu, Tanu Mitra, Harshit Rajgarhia +1cs.SD2026-09-08
#22Omni Interaction Agent Technical ReportOrantqing, Shengpeng Ji, Junlong Tong +20eess.AS2026-09-08
#23AuK Technical Report: An Open-Source Foundational Model for Speech Generation and EditingZiyang Ma, Zhikang Niu, Wenming Tu +30cs.SD2026-09-08
#24From Scores to Evidence: Auditable Decisions Can Improve Speech Deepfake DetectionMengzhe Geng, Yujia Lu, Patrick Littell +2cs.SD2026-09-08
#25TontaubeV1: Streaming Text-to-Speech with Hierarchical Codec Modeling and Bounded ContextFritz Cremer, Jonathan Cremercs.SD2026-09-08
#26X2Streaming-ASR: wait when uncertain, emit when ready for streaming ASRZhiwei Lin, Kaiqi Fu, Rime Wen +5cs.SD2026-09-08
#27Navigating the digital spectrum: Assessing political bias, stability, and downstream fairness in Large Language ModelsLuka Debevc, Nishan Chatterjee, Antoine Doucet +2cs.CL2026-09-08
#28Detecting Authorship in Political Texts with Inductive StylometryGennadii Iakovlev, Levente Littvaycs.CL2026-09-08
#29Noise Adaptive Streaming Audio-Visual Speech Token Enhancement for Robust Full-Duplex Spoken Dialogue ModelsBella Godiva, Yeonju Kim, Yong Man Rocs.SD2026-09-08
#30EviSI: An Evaluation Agent for Simultaneous InterpretingBen Yan, Zongyao Li, Daimeng Wei +5cs.CL2026-09-08
#31ConversationalVoice: Full-Duplex Speech Data from Real Conversations through Source-Faithful Reconstruction and Conversation-Grounded ExpansionRichard Yucheng He, Baodong Cao, Chen Xu +2cs.CL2026-09-08
#32Reasoning Beyond Transcription: Audio Language Models on Child Stuttering SpeechChibuzor Okocha, Christan Grant, Zoey Liucs.CL2026-09-07
#33Syntactic Patterns and Stylistic Functions in Narrative Prose: A Rule-Based and Machine-Learning ApproachStefana Janicijeviccs.CL2026-09-07
#34Qwen-Audio-3.0-ASR Technical ReportChuanmeng Bian, Daren Chen, Peixin Chen +42cs.CL2026-09-07
#35Where Should Language Sit in a Multimodal Model? Lessons from What Language Does to Human Perception and CognitionPeng Xiecs.CL2026-09-07
#36RAFM-SER++: A Lightweight Multimodal Emotion Recognition Framework for Real-Time Behavioral Monitoring in Surveillance SystemsNgo Truong Dinh, Tung-Lam Bui, Chi-Trung Duong +3cs.AI2026-09-07
#37Iterative Audio Separation with Mixture Consistency via MIMO Model ExtensionYukara Ikemiya, WeiHsiang Liao, Yuki Mitsufujics.SD2026-09-07
#38KABURI-TTS: Phoneme-Keyed Activity-conditioned Bi-channel Utterance Rendering for InteractionRyuichiro Higashinaka, Shinnosuke Takamichi, Tetsuji Ogawacs.SD2026-09-07
#39AV-SafetyBench: A Safety Benchmark for Text-to-Audio-Video GenerationSuah Choi, Tae-Young Lee, Gyeong-Moon Parkcs.CV2026-09-07
#40When Speech Meets Lips: Interpretable Audio-Visual Synchronization for L2 Pronunciation AssessmentBowen Yu, Mingyu Huang, Yishen Liu +1cs.CV2026-09-06
#41MARBO: Relational Belief Grounding for LLM Agents in Social Deduction GamesHwang Yechan, Bae Sangjun, Kim Jeongmo +2cs.AI2026-09-06
#42Visual Search Augmented Chain-of-Thought Reasoning for Attribute Value Extraction from Product VideosTong Wu, Ming Cheng, Jiazhen Hu +2cs.CL2026-09-06
#43PRISM-Bench: An Audio-Centric Diagnostic Benchmark for Text-to-Audio-Video GenerationYuchen Sun, Qian Yang, Jun Wang +4cs.MM2026-09-04
#44ElderBench: Benchmarking Autonomous Mobile Agents for Older AdultsWeide Zhan, Qumu Shaqu, Yuanqing Liu +6cs.AI2026-09-04
#45Enhancing Multimodal Emotion Recognition via Multi-Feature Encoding and Attention-Based FusionXu Lin, Ke Wang, Hui Kang +1cs.CV2026-09-04
#46Prospective Coding Improves Learning in Deep Continuous-Time Recurrent NetworksShivang Rawat, Mirko Morello, Flaviano Morone +1cs.LG2026-09-03
#47Alignment-Free Text-Audiobox for Voice Dubbing and Full-Duplex Dialogue SynthesisSanyuan Chen, Min-Jae Hwang, Sho Inoue +12cs.CL2026-09-03
#48Masked Autoregressive Speech Enhancement with Continuous Neural Audio Codec RepresentationsYoto Fujita, Simon Leglaive, Laurent Girincs.SD2026-09-03
#49Test-time adaptation for speech enhancement with an autoregressive speech priorSofiene Kammoun, Simon Leglaive, Xavier Alameda-Pineda +1cs.SD2026-09-03
#50Building and Evaluating Fixed-Voice Thai TTS from Synthetic SpeechKunat Pipatanakul, Potsawee Manakul, Warit Sirichotedumrong +3cs.CL2026-09-03

all trends · matching is case-insensitive substring after tokenization