PaperScope
LIVE · 2026-09-03 05:40 UTC

vision-language 36 papers this week · -24% WoW

papers mentioning "vision-language" in title/abstract · 30d window

Latestcs.CLcs.LGcs.AIcs.CV

Mentions per Day (30d)

Latest Papers

#TitleAuthorsCatDate
1RVSD: Retrieval Vision Sparse Decoding for Mitigating Visual Hallucinations in Large Vision-Language ModelsCanjie Liu, Jiawen Kang, Jinbo Wen +1cs.CV2026-09-02
2Characterizing Text Branch Sensitivity in Medical Vision-Language Segmentation via Evidence DecouplingZiquan Liu, Zhewei Zhu, Xuyang Shics.CV2026-09-02
3ViSAR: Training-Free Adaptive-$k$ Retrieval for Visual Document Question AnsweringAdrien Mialland, Marc Plantevit, Julien Gallois +1cs.IR2026-09-02
#4TempoGround: State-Aware Streaming Visual Grounding with Vision-Language ModelsLeqian Ding, Junning Qiu, Manwen Yang +2cs.CV2026-09-02
#5LookStep: Efficient Vision-Language Navigation with Linguistic Foresight and Event Driven MemoryKun-Yang Yu, Yingzhe Li, Hongyu Xu +8cs.CV2026-09-02
#6Towards Zero-Shot Transfer Across Embodiments For Driving VLAsCaio Azevedo, Stefano Sabatini, Sascha Hornauer +1cs.CV2026-09-02
#7YesTrack: Referring Multi-Object Tracking via MLLM-based Yes/No VerificationQuansheng Hu, Qin Sun, Qiansen Dai +4cs.CV2026-09-02
#8InfraPatch: Cross-Task Targeted Grayscale Patch Attacks on Infrared-Adapted Vision-Language ModelsChengyin Hu, Dingyi Lu, Jiaju Han +5cs.CV2026-09-02
#9LeakageBench: Document-Level Leakage Risk for Redacting Personally Identifiable Information in Document ImagesVishnu Prasad Vijaya Kumar, Santhosh Venkatesh, Ivan P. Yamshchikovcs.CV2026-09-02
#10TAME: Temporal-Aware Mixture-of-Experts for Text-Video RetrievalUicheol Jung, Juyoung Hong, Hojung Kwon +1cs.CV2026-09-02
#11Lightweight Adaptation of General-Purpose VLMs for Multispectral and SAR Image UnderstandingShanji Liu, Kelu Yao, Junxiao Xue +5cs.CV2026-09-02
#12Federated LoRA Adaptation of BiomedCLIP Across Four International Chest X-Ray CohortsSanjaya Poudel, Nirajan Kunwor, Manish Dhakal +2cs.LG2026-09-02
#13Test-Time Logit Prompting for Source-Free Missing Modality AdaptationTaixi Chen, Nancy Guocs.CV2026-09-02
#14Detecting Object Hallucinations in Large Vision-Language Models via Cross-Modal Attention Drifts and Mask-Based VerificationXuanbing Wen, Boxu Chen, Le Yang +4cs.CV2026-09-02
#15Who Drives the Probability Game of VLMs? A Temporal Causal Drive Evaluation FrameworkShuyao Xiao, Shengling Wang, Haoyu Niu +4cs.CV2026-09-02
#16Does Playing it Safe Count as Faithfulness? Reassessing LVLM Hallucination Mitigation MethodsMehrdad Fazli, Sina Mansouri, Mohit Marvania +1cs.CV2026-09-01
#17Video2Reaction: Training Foundation Video Models to Predict Audience ReactionSidong Zhang, Trang Nguyen, Shiv Shankar +4cs.CV2026-09-01
#18DESA-TTA: Dynamic EMA and Source Anchoring for Test-Time AdaptationAtif Belal, Lilian Hollard, Marco Pedersoli +1cs.CV2026-09-01
#19MemeCULT-1K: Benchmarking South Asian Cultural Context and Humor Understanding of Multimodal ModelsTawsif Tashwar Dipto, Mehedi Ahamed, Radib Bin Kabir +5cs.CL2026-09-01
#20AlphaRAD: Grounded Zero-Shot Classification in Chest Radiology via $α$-Corrected Binary Cross Entropy and Factorized Latent SupervisionJianzhong You, Yuan Gao, Chris McIntoshcs.CV2026-09-01
#21Facet-0: A Robotic Foundation Model for Contact-Rich Precise ManipulationHaoyuan Deng, Haichao Liu, Wenkai Guo +6cs.RO2026-09-01
#22Selective Agent Guidance via Entropy: Learning Autonomous Policies from Imperfect VLM TeachersGiovanni Bonetta, Matteo Merler, Davide Zago +2cs.AI2026-09-01
#23FairLens: Benchmarking Fairness in Vision-Language Models for High-Stakes Decision-MakingVahid Reza Khazaie, Ahmed Y. Radwan, Shaina Razacs.CV2026-09-01
#24EdiTikZ: Scientific Figure Editing from Revision TrajectoriesChristian Greisinger, Zhixue Zhao, Steffen Egercs.AI2026-09-01
#25Evaluating Multimodal LLMs as Generalist Vision-Language-Action Agents for Drone Control: Commanding, Approaching, Tracking and SearchingJaewoo Park, Minyoung Lee, Sukmin Seo +11cs.RO2026-09-01
#26IntroConformal: Conformal Factuality Guarantees for Large Vision-Language Models via Introspective SignalsMd. Atabuzzaman, Christian Alexander, Chris Thomascs.CV2026-09-01
#27Reliability Challenges in Diffusion Vision-Language ModelsMd. Atabuzzaman, Chris Thomascs.CV2026-09-01
#28Agentic Multimodal Models for Environmental Hyperspectral UnmixingMichał Cholewa, Luca Ciampi, Nicola Messina +2cs.CV2026-09-01
#29EmbodiedSkills: A Unified Framework for Orchestrating, Training, and Deploying VLA AgentsWei Wang, Wenqiao Zhang, Yutong Lin +14cs.RO2026-09-01
#30REFACTOR-VLA: Unsupervised Library Learning of Typed Motor ProgramsRiyaaz Shaik, Chandru Venkataramancs.LG2026-09-01
#31Compressing AI Traffic: Standardized Neural Network Coding of Visual-Token Representations in Split Vision-Language InferenceReza Heidari, Hamed R. Tavakoli, Juho Kannalacs.CV2026-09-01
#32Dyn-3D: Unveiling and Resolving Ego-Motion Ambiguity in Vision-Language ModelsJiayu Ding, Zhuodong Liu, Lei Zhang +6cs.CV2026-09-01
#33From Terminology to Diagrams: Visual-Instruction Generation for Scientific Diagram UnderstandingRaul Ortega, José Manuel Gómez-Pérezcs.CV2026-09-01
#34A multicenter benchmark and clinically structured metric for coronary CTA report generationZhiyu Ye, Yue Sun, Limiao Zou +7cs.CV2026-09-01
#35Vision-Language-Guided Pseudo-Labels for Unsupervised Domain Adaptation in Semantic Segmentation for Waste SortingUdo Schlegel, Shubhangi, Gabriel Dax +3cs.CV2026-09-01
#36Towards reliable multimodal disaster severity assessment through preference optimization and explainable vision-language reasoningYuanjun Zhang, Fuzel Ahamed Shaik, Suvojit Acharjee +2cs.AI2026-09-01
#37The Visual Insensitivity Gap: Diagnosing When Vision-Language Models Fail to Use Visual EvidenceGenpei Zhangcs.CV2026-09-01
#38Benchmarking Vision-Language Models for Automated Pathology Diagnosis and Report GenerationYumi Lee, Harim Oh, Hyoryung Kim +52cs.CV2026-09-01
#39Towards Generalizable Visually Grounded Exploration of Household DevicesLinhao Zheng, Zeming Liu, Wangke Chen +4cs.AI2026-09-01
#40Visual Attention Faithfulness in Vision-Language Models is HeterogeneousXurui Song, Weishi Wang, Zhongqi Yue +5cs.CV2026-09-01
#41Text Capability Loss in Vision-Language Adaptation: An Attention-Sink DiagnosisMinsik Choi, Geewook Kim, Young Geun Kimcs.LG2026-09-01
#42EarthLD: Towards Unified Open-World Landslide Understanding via Vision-Language Guided Diffusion ModelsYuanchao Su, Lianru Gao, Mengying Jiang +3cs.CV2026-09-01
#43Controllable Image Captioning with Prompt-Conditioned Scene RewardsJongyeop Hyun, Taeyoung Kim, Hyounghun Kimcs.CV2026-09-01
#44From Saliency to Discriminability: Rank-Preserving Visual Token Pruning for VLM RerankersSiyi Liu, Hanjun Yang, Chenchen Zhang +7cs.IR2026-09-01
#45Separating perception from reasoning in vision-language models: a model-free render ceiling for crystal structuresCan Polat, Mustafa Kurban, Erchin Serpedin +1cs.CV2026-09-01
#46Teaching Vision-Language Models to Use the Scale They Are Given: Label-Free Equivariance Training for Metric Physical ReasoningKaizhen Tan, Yang Feng, Heqing Du +3cs.CV2026-09-01
#47You Cannot Photograph the Same Street Twice: Reliability Limits in Vision-Language Measurement of Urban ChangeKaizhen Tancs.CV2026-09-01
#48ExpArt-KG: Artwork Image Description Generation through Iterative Exploration of Knowledge GraphsYuta Kato, Shintaro Ozaki, Kazuki Hayashi +4cs.CL2026-09-01
#49Restrict, Don't Retrain: Inference-Time VLM Guidance for Zero-Shot Aerial SegmentationTeresa DiMeola, Charles Walter, Hong Xiaocs.CV2026-09-01
#50BrainDiff: Longitudinal Report Generation for Multimodal Brain MRIKrish Patel, Peirong Liucs.CV2026-09-01

all trends · matching is case-insensitive substring after tokenization