| 1 | ShallowStream: Index Shallow then Answer Deep for Streaming Video Understanding | Jitai Hao, Ke Yang, Qiang Huang +1 | cs.CV | 2026-09-02 |
| 2 | Language Models Can Control Their Own Attention | Namgyu Ho, Huzama Ahmad, Woosung Koh +3 | cs.CL | 2026-09-02 |
| 3 | Choosing a PEFT Variant for Per-Patient Dysarthric ASR: A Single-Speaker Case Study on Two ASR Bases | Bernard Muller, László Tóth, LaVonne Roberts | cs.CL | 2026-09-02 |
| #4 | A Top-Down Framework for Metric-Scale Athlete Localization from Single Broadcast Frames | Thanh-Khoi Nguyen, Hoang-Phuc Nguyen, Linh-Huynh +1 | cs.CV | 2026-09-02 |
| #5 | GaLe: memory-efficient Global Approximate and Local Exact features | Alberto Ancilotto, Elisabetta Farella | cs.CV | 2026-09-02 |
| #6 | Learning to Attract and Repel: Dual Quality Margin Learning for Face Recognition (DQM-Face) | El Ouanas Belabbaci, Bhavesh Wani, Philipp Terhörst | cs.CV | 2026-09-02 |
| #7 | Seeing Beyond the Lesion: Disease Recognition from Reactive CNS Tissue | Jan Schnorrenberg, Jan Ernsting, Enrico Küllenberg +3 | eess.IV | 2026-09-02 |
| #8 | ProSR: Semantic-Prototype-Guided Discrete Modeling for Physically Consistent SAR Super-Resolution | Byoungwoo Kim, Munchurl Kim | cs.CV | 2026-09-02 |
| #9 | Subcellularly Resolved Single-Cell Embedding Learning with Transcriptomic data, Protein Structure and Localization Information | Zhen Zhou, Jiachen Li, Yuan Liu +2 | q-bio.GN | 2026-09-02 |
| #10 | If It Moves, Radar Knows: A Physics-Aware Radar Transformer for Class-Agnostic Moving-Object Detection | Yinghao Sun, Shuguang Li, Jinliang Shao +1 | cs.CV | 2026-09-02 |
| #11 | From Detection to Characterization: A Large-Scale Study of Ragebait on Japanese X | Zhiyang Qi, Kazuhiro Ito, Jinghui Chen +5 | cs.SI | 2026-09-02 |
| #12 | Learning the Constitutive Behavior of Materials via Neural Operators and Causal Attention: Case Studies in Plasticity and Damage | Rishabh Arora, Lisa Scheunemann, Tim Brepols +1 | cs.LG | 2026-09-02 |
| #13 | DMRL: Document-Mediated Reinforcement Learning for Skill Optimization in Advertising Recommendation | Wei Zhang, Hongji Li, Song Sun +4 | cs.LG | 2026-09-02 |
| #14 | Beyond Modality Harmony: Orthogonal Purification and Topology-Guided MoE for Conflict-Aware Multimodal Recommendation | Jialin Liu, Zhaorui Zhang, Ray C. C. Cheung | cs.IR | 2026-09-02 |
| #15 | Predict, Don't Iterate: Efficient Adaptive-Length Infilling for Diffusion Language Models | Haobo Xu, Sirui Chen, Yuanchen Bei +5 | cs.CL | 2026-09-02 |
| #16 | IDEEA: training-free Input-Dependent stEEring via Activation cluster matching | Zheng Wang, Muchen Li, Renjie Liao +1 | cs.CL | 2026-09-02 |
| #17 | Transfer Safety Awareness for Cross-Modal Safety Drift in Multimodal Large Language Models | Tianqi Xiao, Shiyao Cui, Minghao Zhang +2 | cs.MM | 2026-09-02 |
| #18 | HeadWiseKV: Budgeted Per-Head Cache Residency for Hybrid Long-Context Language Models | Renjie Xie, Juncheng Yang, Aoting Hu +4 | cs.AI | 2026-09-02 |
| #19 | Detecting Object Hallucinations in Large Vision-Language Models via Cross-Modal Attention Drifts and Mask-Based Verification | Xuanbing Wen, Boxu Chen, Le Yang +4 | cs.CV | 2026-09-02 |
| #20 | CRISP: Cliff-awaRe Input-adaptive Sparse Prefilling with Structural-Mass-Motivated Routing | Huu Huy Nguyen, Chien Van Nguyen, Franck Dernoncourt +4 | cs.LG | 2026-09-01 |
| #21 | hLLM: Single Pass Decoding for Generative Reranking | Emil Laftchiev, Prachi Agrawal, Moe Kayali +7 | cs.LG | 2026-09-01 |
| #22 | CoViT: Instance-Correspondence Contrastive Learning for Vision Transformer | Yisen Wang, Zhirong Wu, Limin Wang | cs.CV | 2026-09-01 |
| #23 | Toward Explainable and Policy-Aware AI for Carbon Credit Price Prediction: A Research Framework for Emerging Carbon Markets | Summaiya Unnisa Begum, Mohammed Nadeem Ullah, Mohammed Abdul Ghani Khan | cs.LG | 2026-09-01 |
| #24 | Swin Meets EfficientNet: Lightweight Architectures for GAN-Based Face Forensics | Sejuti Basu, Ashima Sood, Vijay Kumar +1 | cs.CV | 2026-09-01 |
| #25 | Beyond Scores: Understanding LLM-as-a-Judge Mechanisms in Summarization Evaluation | Himil Vasava, Ming Jiang | cs.CL | 2026-09-01 |
| #26 | H3-World: Turning Language Understanding into World Control | Danze Chen, Zeqing Wang, Ziyue Lin +2 | cs.CV | 2026-09-01 |
| #27 | DualDiff3D: Dual Structure-Appearance Diffusion Priors for Reliability-Enhanced 3D Gaussian Splatting | Qian Wang, Yu Wang, Weiqi Li +4 | cs.CV | 2026-09-01 |
| #28 | Rethinking Learnability in Offline Data-driven Optimization | Chao Qian, Chen-Guang Wang, Rong-Xi Tan +1 | cs.LG | 2026-09-01 |
| #29 | Predicting Subsurface Abnormalities Growth using Physics-Informed Neural Networks | Mehrdad Shafiei Dizaji, Hoda Azari | cs.LG | 2026-09-01 |
| #30 | Separating Syntax from Language: A Mechanistic Account of Translation in Multilingual LLMs | Mikhail Sonkin, Tanja Baeumel, Daniil Gurgurov +2 | cs.CL | 2026-09-01 |
| #31 | SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers | Shaowen Wang, Ge Zhang, Kairong Luo +6 | cs.LG | 2026-09-01 |
| #32 | mzCache: On-Device LLM Memory Management under Multitasking | Hongseung Yu, Minsung Kim, Jongseok Park +1 | cs.OS | 2026-09-01 |
| #33 | HiLRP: Toward One Trustworthy Explanation for Vision Transformer: Conservation-Valid Attribution via Attention Primitives | Sathiyamohan Nishankar, Pubudu Sanjeewani, Asanka Perera +1 | cs.CV | 2026-09-01 |
| #34 | TimeSteer: Inference-Time Speech Scheduling in Joint Audio-Visual Diffusion Models | Chao Zhou, Yiling Chen, Qi Chu +3 | cs.CV | 2026-09-01 |
| #35 | Solving In-Table Prediction Problems by Deep Neural Networks with Performance Evaluation Using Synthetic Data | Xiao Zhao, Daniela Oelke | cs.LG | 2026-09-01 |
| #36 | MeRoPE: Metric Rotary Position Embedding for Camera-Controlled Video Generation | Zhijian Qiao, Xinjiang Wang, Jiajie Chen +5 | cs.CV | 2026-09-01 |
| #37 | From Language to Behavior: Scaling Sequence Transformers for Industrial Recommendation Ranking with Rec-Native Designs | Jie Chen, Xiangqian Yu, Yanchao Lian +9 | cs.IR | 2026-09-01 |
| #38 | Multi-Head Self Attention is a Parameter Identification Mechanism | W. Ross Morrow | cs.LG | 2026-09-01 |
| #39 | Dotting the Eye: An Intent-Driven Image Retouching Agent for Visual Focus Enhancement | Chujie Qin, Zilong Zhang, Zewei Chang +5 | cs.CV | 2026-09-01 |
| #40 | Scaled Idempotence in Transformer Attention: Paired OV Geometry and Shared-Value Algebras | Jiming Feng, Junliang Li | cs.LG | 2026-09-01 |
| #41 | IT-TextFusion: Iterative Text-Image Interaction with Text-Guided Residual Refinement for Degradation-Aware Image Fusion | Siyang Liu, Peiyi Zhou, Tianle Jin +3 | cs.CV | 2026-09-01 |
| #42 | Phrase-Localized Language-Contrastive Guidance: Training-Free Localized Accent Control for Code-Switching Text-to-Speech | Che Hyun Lee, Sangkwon Park, Donghun Kang +4 | cs.CL | 2026-09-01 |
| #43 | Low-Quality Face Recognition using Center Aligned Representations and Local Margin Constraints | Vedat Can Dilaver, Benjamin S. Riggan | cs.CV | 2026-09-01 |
| #44 | SinkPruner: Sink-Free Visual Token Pruning for Multimodal Large Language Models | Shiyu Li, Zi-Yuan Hu, Shijia Huang +3 | cs.CV | 2026-09-01 |
| #45 | Context-Grounding Gains Are Mediated by Pre-existing Machinery: Auditing GRPO, SFT, and DPO | Prakhar Gupta, Vaibhav Gupta | cs.CL | 2026-09-01 |
| #46 | On-the-Fly3R: Towards Robust Online 3D Reconstruction with Feed-Forward 3R Models for Large-Scale UAV Scenarios | Zhe Shen, Liyuan Lou, Yifei Yu +4 | cs.CV | 2026-09-01 |
| #47 | CacheBridge: Efficient Cross-Model KV Cache Transfer | Xingyu Qu, Siyuan Lu, Zhiyu Chen +2 | cs.AI | 2026-09-01 |
| #48 | Denoising Diffusion Generative Models Secretly Calculate Attentions | Farzan Haddadi, Leila Monfared, Ebrahim Rezaii +3 | cs.AI | 2026-09-01 |
| #49 | MemoryWalker: Stop Training Agents on Contexts They Never Saw | Zinco J, Xunjie Zhu, Shen Huang +3 | cs.LG | 2026-09-01 |
| #50 | An Intelligent Decision Support System for Emotion Monitoring using Microscopic Fixational Dynamics | Xiangyu Shen, Feiyang Deng, Zijian Dai +4 | cs.CV | 2026-09-01 |