| 1 | RVSD: Retrieval Vision Sparse Decoding for Mitigating Visual Hallucinations in Large Vision-Language Models | Canjie Liu, Jiawen Kang, Jinbo Wen +1 | cs.CV | 2026-09-02 |
| 2 | Query Rewriting for Complex Object Segmentation in 4D Gaussian Representations | Thanh-Khoi Nguyen, Thien-Phuc Tran, Minh-Triet Tran | cs.CV | 2026-09-02 |
| 3 | ViSAR: Training-Free Adaptive-$k$ Retrieval for Visual Document Question Answering | Adrien Mialland, Marc Plantevit, Julien Gallois +1 | cs.IR | 2026-09-02 |
| #4 | Signal or Noise? Auditing Rotation-Induced Saliency Drift in Medical and Aerial Imaging | Khawaja Murad ul Hassan, Mehran Ebrahimi | cs.CV | 2026-09-02 |
| #5 | GeoSPRINT: Geometric Redundancy-Aware Step Pruning for Inference in Diffusion Trajectories | Arpita Joshi | cs.LG | 2026-09-02 |
| #6 | IDEEA: training-free Input-Dependent stEEring via Activation cluster matching | Zheng Wang, Muchen Li, Renjie Liao +1 | cs.CL | 2026-09-02 |
| #7 | DPA: Decoupling Product-Agnostic Anomaly Representations for Zero-shot Anomaly Generation | Hang Yao, Yansheng Fu, Ming Liu +4 | cs.CV | 2026-09-02 |
| #8 | SelfLift: Accelerating Few-Step Diffusion via Self-Recovering Resolution Transition | Tingyan Wen, Chenqian Yan, Xurui Peng +4 | cs.CV | 2026-09-02 |
| #9 | HeadWiseKV: Budgeted Per-Head Cache Residency for Hybrid Long-Context Language Models | Renjie Xie, Juncheng Yang, Aoting Hu +4 | cs.AI | 2026-09-02 |
| #10 | Linear Fusion MultiDiffusion for Fast Training-Free Spherical Panorama Generation | Akio Hayakawa, Yusuke Mukuta, Tatsuya Harada | cs.CV | 2026-09-02 |
| #11 | GAPS: Dimension-Level Gates for Conditional Activation Steering | Moghis Fereidouni, Muhammad Umair Haider, Hassan Sajjad +1 | cs.CL | 2026-09-01 |
| #12 | CAT-Flow: Curvature-Adaptive sTeps for Flow Matching | Qinchan Li, Pedro Cisneros-Velarde, Keru Fu +3 | cs.LG | 2026-09-01 |
| #13 | AutoConcept: Training-Free Concept-Guided Reranking for Metadata-Available Composed Image Retrieval | Tianyu Wang, Tianjiao Wu | cs.IR | 2026-09-01 |
| #14 | IntroConformal: Conformal Factuality Guarantees for Large Vision-Language Models via Introspective Signals | Md. Atabuzzaman, Christian Alexander, Chris Thomas | cs.CV | 2026-09-01 |
| #15 | MIDR: Enrichment-Augmented Indexing for Multimodal Document Retrieval | Debanjan Mahata, Atharva Tendle, Daniel Preotiuc-Pietro +2 | cs.IR | 2026-09-01 |
| #16 | GazeRefine: Expert Gaze as a Test-Time Prompt for Training-Free Medical Image Segmentation | Mohammed Oussama Benyahia, Marouane Tliba, Mohamed Amine Kerkouri +10 | eess.IV | 2026-09-01 |
| #17 | TimeSteer: Inference-Time Speech Scheduling in Joint Audio-Visual Diffusion Models | Chao Zhou, Yiling Chen, Qi Chu +3 | cs.CV | 2026-09-01 |
| #18 | Making Prospective Memory SLM-Shaped: Typed Intention Stores for Small-Model Agents | Jinqing Zhao, Chengcan Wu | cs.AI | 2026-09-01 |
| #19 | S$^2$Prune: Spatially Structured Visual Token Pruning for Multimodal Large Language Models | Yuanyuan Jia, Shunpu Tang, Qianqian Yang | cs.CV | 2026-09-01 |
| #20 | Compressing AI Traffic: Standardized Neural Network Coding of Visual-Token Representations in Split Vision-Language Inference | Reza Heidari, Hamed R. Tavakoli, Juho Kannala | cs.CV | 2026-09-01 |
| #21 | From Truncation to Commitment: Persistent Context in Uniform Discrete Diffusion | Satoshi Hayakawa | cs.LG | 2026-09-01 |
| #22 | Phrase-Localized Language-Contrastive Guidance: Training-Free Localized Accent Control for Code-Switching Text-to-Speech | Che Hyun Lee, Sangkwon Park, Donghun Kang +4 | cs.CL | 2026-09-01 |
| #23 | SinkPruner: Sink-Free Visual Token Pruning for Multimodal Large Language Models | Shiyu Li, Zi-Yuan Hu, Shijia Huang +3 | cs.CV | 2026-09-01 |
| #24 | PredErase: Training-Free Object-and-Effect Removal with Predictive Latent Guidance | Waikit Xiu, Qiang Lu, Junbiao Chen +1 | cs.CV | 2026-09-01 |
| #25 | ASSERT: Adaptive Stochastic Sampling for Robust Diffusion Models on Analog Compute-in-Memory Hardware | Yuannuo Feng, Yizhe Chen, Wenshuai Yao +4 | cs.CV | 2026-09-01 |
| #26 | CERF: Communication-Efficient and Retraining-Free Collaborative Perception | Jiuwu Hao, Ziyi Ni, Liguo Sun +5 | cs.CV | 2026-09-01 |
| #27 | On-the-Fly3R: Towards Robust Online 3D Reconstruction with Feed-Forward 3R Models for Large-Scale UAV Scenarios | Zhe Shen, Liyuan Lou, Yifei Yu +4 | cs.CV | 2026-09-01 |
| #28 | CacheBridge: Efficient Cross-Model KV Cache Transfer | Xingyu Qu, Siyuan Lu, Zhiyu Chen +2 | cs.AI | 2026-09-01 |
| #29 | Training-Free Inpainting Across Domains with a Frozen Text-to-Image Diffusion Model | Zhenhuan Wang, Fengyi Yuan | cs.CV | 2026-09-01 |
| #30 | VOIM: Training-Free Open-Vocabulary 3D Instance Mapping for RGB-D and Monocular SLAM | Sangmin Song, Sarath Kodagoda, Marc G. Carmichael +4 | cs.CV | 2026-09-01 |
| #31 | Escaping Redundant Reasoning: Structure-Aware Search for Inference-Time LLMs | Lu Cheng | cs.AI | 2026-09-01 |
| #32 | SCoNE: Selective Context-aware Neuron Editing for Robust Retrieval-Augmented Generation | Chaewon Kim, Seo Yeon Park | cs.CL | 2026-09-01 |
| #33 | From Saliency to Discriminability: Rank-Preserving Visual Token Pruning for VLM Rerankers | Siyi Liu, Hanjun Yang, Chenchen Zhang +7 | cs.IR | 2026-09-01 |
| #34 | Beyond Token Positions: Safety Alignment Across Denoising Steps in Diffusion Language Models | Guoli Wang, Haonan Shi, Tu Ouyang +1 | cs.CL | 2026-08-31 |
| #35 | SlideBank: A Persistent Hierarchical Evidence Bank for Consistent Whole-Slide Reasoning | Beidi Zhao, Gexin Huang, Ciro Zhang +6 | cs.AI | 2026-08-31 |
| #36 | LOOMSUM:Weaving Quantitative and Narrative Evidence for Faithful Long Text-Table Summarization | Meng Zhou, Wenhao You, Wei Yuan | cs.CL | 2026-08-31 |
| #37 | From Intent to Evidence: Policy-Steered Multi-Strategy Retrieval for Long-Video Agents | Can Zhang, Baofeng Zhang, Xiaotian Han +5 | cs.CV | 2026-08-31 |
| #38 | LOCI: A Locator-Critic with Refinement Loop | Walid Bousselham, Mathilde Caron, Arsha Nagrani +1 | cs.CV | 2026-08-31 |
| #39 | Faster Than Flash: Exploiting Attention Sparsity for Efficient Long-Context Decoding | Zhigeng Liu, Zhiyuan Ning, Ruixiao Li +5 | cs.LG | 2026-08-31 |
| #40 | CARVE: Verified Expansion for Variable-Length Generation in Diffusion Language Models | Wail Bouhedja, Amr Mohamed, Guokan Shang | cs.AI | 2026-08-31 |
| #41 | VCAR: Training-Free 3DGS Segmentation via View Completeness and Axis-Aware Boundary Refinement | Kun Cao, Di Wang, Haibin Zhu +4 | cs.CV | 2026-08-31 |
| #42 | TopoCompress: Long Context Compression via Graph-Wired Semantic Trajectories | Daniel Agyei Asante, Yang Li | cs.CL | 2026-08-31 |
| #43 | VisLens: Single-Pass Interpretable Visual Search for Multimodal LLMs | Jingyi He, Sanghwan Kim, Zeynep Akata | cs.CV | 2026-08-31 |
| #44 | CANVAS: Consistency-Aware Navigation via Visual Adaptive Sampling for Long-Context Text-to-SVG Generation | Yichen Wu, Haoxuan Qu, Yihang Lou +2 | cs.CV | 2026-08-31 |
| #45 | Reading the News: Adapting Large Language Models to Swedish Journalism Through Continued Pre-Training | Lukas Borggren, Jenny Kunz, Marco Kuhlmann | cs.CL | 2026-08-31 |
| #46 | VisER: Visual Evidence and Reliance for Object Hallucination Detection in LVLMs | Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie +1 | cs.CV | 2026-08-31 |
| #47 | RSLM: Training-Free Vector Quantization for Approximate Nearest Neighbor Search | Rastislav Lenhardt, Teodora Dobos, Thomas Vecchiato +2 | cs.LG | 2026-08-31 |
| #48 | Dynamic Hub-and-Spoke Memory for Streaming Video Understanding | Xinru Jiang, Lin Zhao, Xi Xiao +7 | cs.CV | 2026-08-31 |
| #49 | Amortized Anchor Refinement for Deployable Continuous-Time 4D Gaussian Reconstruction | Jingong Chen, Qingwen Zhang, Sanghyeon Jun +3 | cs.CV | 2026-08-31 |
| #50 | ALTSTEER: Selective Safety Steering for Moving Beyond Hard Refusals to Constructive Alternatives | Hoejoon Kwon, Byeonggeuk Lim, Kahyeon Kim +1 | cs.CL | 2026-08-31 |