PaperScope
LIVE · 2026-09-15 05:40 UTC

vlm 10 papers this week · +22% WoW

papers mentioning "vlm" in title/abstract · 30d window

Latestcs.CLcs.LGcs.AIcs.CV

Mentions per Day (30d)

Latest Papers

#TitleAuthorsCatDate
1Beyond Accuracy: Robustness, Cost, and Governance Trade-offs for Vision-Language Models in Templated Document ExtractionKushal Patel, Pushkal Shrivastava, Mackenzie Lees +4cs.AI2026-09-14
2NoteVQA: Benchmarking VLMs on Real-Life Questions from Human CommunitiesHaonan Jiang, Guojian Zhan, Jiancong Xie +6cs.AI2026-09-14
3Don't Send What You Don't Need: Question-Guided Token Pruning as a Privacy Defense for Vision-Language ModelsMd Khalid Syfullah, Alvi Ataur Khalilcs.CV2026-09-14
#4ModaLens: Measuring Image Sensitivity in Report-Conditioned Medical VLMsSebastián Andrés Cajas Ordóñez, Maximin Lange, Quang Bui +9cs.CV2026-09-14
#5A Unified Vision-Language Model for PSMA PET/CT Report Generation, Visual Question Answering, and Lesion SegmentationYang Xing, Jiong Wu, Savas Ozdemir +11cs.CV2026-09-14
#6Option-Aware Retrieval and Task-Specific VLM Adaptation for Medical VQATristan Kirscher, Niklas C. Koser, Soren Pirkcs.AI2026-09-14
#7AnchorGUI: Asymmetric Memory for Dual-Scale Learning in GUI NavigationShengjie Jin, Zelong Sun, Hengbo Xu +2cs.CV2026-09-14
#8Planning in the Backbone: DiffAdapterVLA for Native Continuous Trajectory Generation with Driving VLMsChangxin Lu, Xiaoliang Meng, Yu Wu +5cs.RO2026-09-14
#9Pre-PEFT Probing: Weight Statistics and Perturbation Robustness for Layer Selection in VLM Vision EncodersQingtao Xia, Jiahua Bao, Siyao Cheng +1cs.CV2026-09-14
#10GRAVA: Grounded Reasoning-to-Action Representation and Learning for Autonomous DrivingXiao Liu, Haoyu Li, Jianghao Leng +2cs.CV2026-09-14
#11Compositional SVG Generation via VLM-Driven Hierarchical Semantic ParsingSehwan Park, Taehoon Kim, Geonhee Han +3cs.CV2026-09-13
#12Open-UniMo: Towards Unified Motion-Language Understanding and Generation in the Open WorldGuocun Wang, Kenkun Liu, Guorui Song +7cs.CV2026-09-13
#13Selective Tool Use for Agentic Change Visual Question Answering in Remote SensingYakoub Bazi, Mohamad M. Al Rahhal, Mohamed A. Mekhtiche +1cs.CV2026-09-13
#14A Generative AI Integrated Multimodal Framework for Low-Latency Multi-Camera Person Re-IdentificationLeon Fernando, C Dombawala, P. Hettigoda +3cs.CV2026-09-13
#15Two-Stage Mixture-of-LoRA for Multi-Task Medical Vision-Language LearningZhanghao Chen, Yuanyuan Li, Zhenyu Lu +3cs.CV2026-09-13
#16E2A-Bench: Benchmarking Evidence-to-Action Reliability in Financial Chart ReasoningXiaoya Wang, Yutong Xu, Junjie Wangcs.CL2026-09-13
#17Vision-Language Models for Criterion-Level Grading of Handwritten Examinations in Outcome-Based EducationMd Khalid Syfullah, Asif Hasan Tonmoy, Saad Ahmed +1cs.CV2026-09-13
#18SPARK: Representation-Level KV Memory Alignment for Safer Vision-Language ModelsMohd Azfar, Izhar Dad Khancs.CV2026-09-13
#19RA-CoA: Training-free Fashion Image Captioning via Retrieval-Augmented Chain-of-AttributesAbhirama Subramanyam Penamakuri, Shreya Shukla, Anand Mishracs.CV2026-09-12
#20Inside VLM Chart Reading: Tracing Value Reading from Vertical Bar Charts Across Space and DepthTianhao Niu, Qingfu Zhu, Wanxiang Checs.CL2026-09-12
#21Can Edge-Deployable Vision-Language Models Identify Species?William Zhou, Mayukha Siripuram, Xiao Yan +2cs.AI2026-09-10
#22ZipCodec: Ultra-Low-Frame-Rate Streaming Speech CodingLuca Della Libera, Cem Subakan, Mirco Ravanellics.SD2026-09-10
#23Combining Synthetic and Real Data for Low-Resource Historical OCR: A Manchu Case StudyYan Hon Michael Chung, Hanlin Wangcs.LG2026-09-10
#24Routing by Reasoning Need: Trajectory-Aware Decoding Control for Diffusion Vision-Language ModelsYixiang Liu, Zhongxing Xu, Zhonghua Wang +1cs.AI2026-09-10
#25Your Model Already Knows Don't Teach It, Learn to Ask It: Soft Prompting for Few-Shot Adaptation of Vision-Language ModelsGautam Rajendrakumar Gare, Siyi Li, Hewei Wang +5cs.CV2026-09-10
#26From Evaluation to Enhancement: Benchmarking and Improving Think-with-Video Reasoning for Video Generative ModelsMeng Luo, Yicheng Liu, Jiahao Wang +5cs.CV2026-09-10
#27Beyond Benchmarks: Using VLMs to Reveal Systematic Classification Failures Under Real World ConditionsDieuwertje Alblas, Alma M. Liezenga, Jan Erik van Woerden +3cs.CV2026-09-10
#28Evaluation of Vision-Language Models Across Diverse Coastal EnvironmentsSeth Knoop, Chad R. Samuelson, Gabriel R. Slade +2cs.CV2026-09-09
#29BodyCam-VQA: Enhanced Body-Worn Camera Video Captioning via Multimodal Reasoning and Probe Question GenerationKarish Gupta, Matthew Alex, Alex Li +6cs.CV2026-09-09
#30MHE-Former: Multi-Hypothesis Transformers via Entropy Maximization for 3D Mesh RecoveryBoshu Jia, Rongyu Chen, Linlin Yang +9cs.CV2026-09-09
#31Show-Harness: Just a VLM Agent Can Play RobotsYanzhe Chen, Zechen Bai, Zhijun Cao +7cs.RO2026-09-09
#32Can Foundation Models Moderate Online Content? Evaluating Instruction- vs. Example-Driven Policy OperationalizationAyan Majumdar, Shounak Paul, Pushpdeep Singh +6cs.CL2026-09-09
#33Learning to Adapt and Calibrate: Score Distribution Alignment for Few-Shot Uncertainty Prediction in Medical VLMsXuan Cuong Ngo, Ngan Lecs.CV2026-09-09
#34Two-Token Features and Small-Large Ensembles for VLM Hallucination DetectionEli Schwartzcs.CL2026-09-09
#35From Pixels to Hierarchical Sequences: Quadtree Mask Encoding for Vision-Language Binary Change DetectionXiao An, Ruikang Zhang, Chen Zhong +4cs.CV2026-09-09
#36Vision-language models know more about agriculture than they show and rubric-grounded verifications close the gapEarl Ranario, Jared Smith, Lars Lundqvist +1cs.CV2026-09-08
#37VANTAGE-Bench: Evaluating the Infrastructure AI Gap in Vision-Language ModelsZaid Pervaiz Bhat, Nimra Nayyar, Arihant Jain +6cs.CV2026-09-08
#38Canonical Color as a Lens into Concept Decodability in Vision Encoders and VLMsXiaofu Chen, Stella Frank, Yova Kementchedjhievacs.CV2026-09-08
#39From Scores to Evidence: Auditable Decisions Can Improve Speech Deepfake DetectionMengzhe Geng, Yujia Lu, Patrick Littell +2cs.SD2026-09-08
#40Charts Are Beyond Pixels: Probing for Layer-Wise Chart Understanding and EditingXiaochuan Zhong, Yifan Hou, Chenxi Pang +1cs.CV2026-09-08
#41CASD: Chunk-Aligned Semantic Distillation for Multi-StageRobot ManipulationTinghe Ding, Jiahao Li, He Wangcs.RO2026-09-08
#42CLAMP: Constrained Decoding for Vision-Language Embodied PlanningTianyi Ma, Parisa Kordjamshidics.AI2026-09-08
#43STSG-VQA: Evidence-Grounded Temporal Question Answering from Surgical Spatio-Temporal Scene GraphsJing Li, Duygu Sarikayacs.CV2026-09-08
#44Layer Selection in VLMs for Zero-Shot OOD Detection via Multi-Resolution Entropy EstimationShyam Nandan Rai, Francesco Di Salvo, Sebastian Doerrich +1cs.CV2026-09-08
#45Towards Embodied Air-Ground Cooperative Object Search: Benchmark, Dataset and Agentic MethodBoao Yu, Zimo Chen, Junreng Rao +4cs.CV2026-09-08
#46CoVeR: Coverage-Based Token Pruning for Multi-View 3D Reasoning in VLMsNhat-Tan Bui, Varshini Elangovan, Arun Reddy Anugu +7cs.CV2026-09-08
#47CS-CLIP: Compositional Scene Graph-guided CLIP for Robust Compositional ReasoningSeongJun Jeong, Minjoon Jung, Woo Suk Choi +2cs.CV2026-09-08
#483DWay: Generalizing Robot Manipulation via 3D Consistent WaypointsZiqin Huang, Yingyue Li, Chenyangguang Zhang +6cs.RO2026-09-08
#49Drive by Hindsight and Foresight: Tool-Grounded Synergistic Reasoning over Hierarchical Memory for Autonomous DrivingBaojie Chen, Zijun Jia, Jing Zhongcs.CV2026-09-08
#50Bridging the Semantic-Utility Gap in Multimodal RAG via Generator-in-the-Loop AlignmentZhan-Lun Chang, Dong-Jun Han, Seyyedali Hosseinalipour +2cs.AI2026-09-08

all trends · matching is case-insensitive substring after tokenization