PaperScope
LIVE · 2026-09-09 05:40 UTC

visual 29 papers this week · -56% WoW

papers mentioning "visual" in title/abstract · 30d window

Latestcs.CLcs.LGcs.AIcs.CV

Mentions per Day (30d)

Latest Papers

#TitleAuthorsCatDate
1SyncWorld: Visual Calibration Enables World Models as Zero-Shot SimulatorsYuncong Yang, Zhengtao Han, Furkan Ozyurt +6cs.CV2026-09-08
2Point4D: Long-range 4D Motion ReconstructionMinsik Jeon, Jay Karhade, Deva Ramanan +1cs.CV2026-09-08
3Studying Image Tokenizers as Visual Languages in Unified Multimodal ModelsSiting Li, Zhengyang Wang, Simon Shaolei Du +2cs.CV2026-09-08
#4Canonical Color as a Lens into Concept Decodability in Vision Encoders and VLMsXiaofu Chen, Stella Frank, Yova Kementchedjhievacs.CV2026-09-08
#5Mask Forcing: Improving Autoregressive Video Diffusion Distillation via Dual-Noise Masking RolloutZhuoran Zhao, Shengju Qian, Tongtong Liang +7cs.CV2026-09-08
#6DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-ImaginationYankai Fu, Ning Chen, Junkai Zhao +5cs.RO2026-09-08
#7"World Knowledge" in the Weights: Reading Concept Circuits of Vision TransformersYanlin Chen, Tang Li, Xi Pengcs.CV2026-09-08
#8Spheriverse: 3D Scene Understanding from Spherical Observations in the WildFei Teng, Sheng Wu, Mengfei Duan +7cs.CV2026-09-08
#9EgoSIS: From Factorized Visual Ego-Transitions to Motion-Canonical Spatial Evidence for UAV ReasoningJingpu Yang, Fengxian Ji, Mingxuan Cui +4cs.CV2026-09-08
#10DSE-VTG: Dual-Side Enhancement for Training-Free Video Temporal GroundingZhuo Cao, Bingqing Zhang, Sen Wang +1cs.CV2026-09-08
#11Leveraging Visual and Geometric Priors for Metric-scale and Complete Vehicle Gaussian Reconstruction from Limited ViewsJinyu Miao, Jiusi Li, Yifei He +4cs.CV2026-09-08
#12Evaluation Principles for MRI-MRA Registration in Trigeminal Neuralgia: An ROI-Centered Neurovascular BenchmarkXupeng Zhang, Xihang Wang, Michael Xie +6cs.CV2026-09-08
#13Compensating for Scarce Historical Images in Cross-Domain Cultural Heritage Retrieval Using Synthetic AgingMarcin Iwanowski, Adam Mazgaj, Ferdynand Gorski +1cs.CV2026-09-08
#14Kairos: A Dataset for Fine-Grained Video-Language Modeling over Space, Time, and DynamicsRuibo Ming, Lei Sun, Deheng Zhang +8cs.CV2026-09-08
#15CVT-GS: Learning to Simplify 3D Gaussian Splatting with Centroidal Voronoi TessellationBingxian Li, Yilong Li, Jingliang Peng +6cs.CV2026-09-08
#16MorphoOrgaAgent: A Foundation-Model-Based Multi-Agent System for Autonomous Organoid AnalysisHanyi Zhang, Maximilian Hoermann, Lion J. Gleiter +5cs.MA2026-09-08
#17Charts Are Beyond Pixels: Probing for Layer-Wise Chart Understanding and EditingXiaochuan Zhong, Yifan Hou, Chenxi Pang +1cs.CV2026-09-08
#18From Where to How: Continuous 4D Interaction Forecasting from Egocentric VideoQiaohui Chu, Haoyu Zhang, Meng Liu +3cs.CV2026-09-08
#19MFVINS: Multiple Fisheye Camera-Based Visual Inertial SystemEunseong Jang, YuJin Chung, Sang Jun Lee +2cs.RO2026-09-08
#20CLAMP: Constrained Decoding for Vision-Language Embodied PlanningTianyi Ma, Parisa Kordjamshidics.AI2026-09-08
#21Temporal State Transport in Video Generation: Diagnosing and Correcting Spectral ImbalanceLuyao Tang, Bingjun Luo, Dong Yi +5cs.CV2026-09-08
#22SignRefine: Adapting Foundational Video Models for Sign Language GenerationAnton Pelykh, Edward Fish, Ozge Mercanoglu Sincan +1cs.CV2026-09-08
#23AURORA: Active Uncertainty-Driven Re-Orientation for In-Hand ReconstructionFeiyu Zhao, Yuetong Li, Chenxi Xiaocs.RO2026-09-08
#24AirAnchor: Bridging Local and Global Spatial Information for Zero-Shot Aerial Vision-and-Language NavigationShanwei Fan, Bin Zhang, Zhiwei Xu +4cs.CV2026-09-08
#25Towards Embodied Air-Ground Cooperative Object Search: Benchmark, Dataset and Agentic MethodBoao Yu, Zimo Chen, Junreng Rao +4cs.CV2026-09-08
#26From Coordinates to Candidate Regions: Temporal Change Localization via Region Selection in Remote Sensing Multimodal LLMsJuwan Chung, Sungjune Park, Yeongyun Kim +1cs.CV2026-09-08
#27Noise Adaptive Streaming Audio-Visual Speech Token Enhancement for Robust Full-Duplex Spoken Dialogue ModelsBella Godiva, Yeonju Kim, Yong Man Rocs.SD2026-09-08
#28Segment Any Motion with Radar: Robust Multimodal Moving-Object Segmentation and TrackingJue Wang, Xuan Wang, Hao Zhou +6cs.CV2026-09-08
#29CoVeR: Coverage-Based Token Pruning for Multi-View 3D Reasoning in VLMsNhat-Tan Bui, Varshini Elangovan, Arun Reddy Anugu +7cs.CV2026-09-08
#30RoboCousin: Build Your Own Simulation Playground for Robust Bimanual Robotic ManipulationJingxuan Zhu, Jingyi Li, LiangLiang Chen +3cs.RO2026-09-08
#31Do Input-Level Defenses Transfer to Observation-Level Attacks on VideoLLMs?Bangshuo Zhu, Wei Song, Yuxin Cao +4cs.CV2026-09-08
#32EMBLEM: Enhancing Multi-script Table Detection through MaskingDhruv Kudale, Udhay Brahmi, Ganesh Ramakrishnancs.LG2026-09-08
#33Supervised Cross-Modal Feature Alignment for Zero-Wearable Freezing of Gait Detection in ParkinsonismAryan Singh, Chandan Biswascs.CV2026-09-08
#34From Glance to Scrutiny: Progressive Distortion Reasoning for Fine-Grained Image Quality AssessmentAoting Zhang, Mingze Gao, Dongbao Yang +5cs.CV2026-09-08
#35Dreaming in Flow: Generative Grounding Feedback for Self-Evolving Unified Multimodal ModelsKe Hao, Yuanzhi Liang, Tingxi Chen +5cs.CV2026-09-08
#36ACEA: An Adversarial Co-Evolution Arena for Head-to-Head Red-Team and Blue-Team LLM TestingYi Ting Shen, Kentaroh Toyoda, Alex Leungcs.CR2026-09-08
#37CALIPER: Clean Scenes Cannot Rank Physical Inference in Pretrained Visual RepresentationsAman Mehta, Riya Baviskarcs.RO2026-09-08
#38CS-CLIP: Compositional Scene Graph-guided CLIP for Robust Compositional ReasoningSeongJun Jeong, Minjoon Jung, Woo Suk Choi +2cs.CV2026-09-08
#39SoftRerank: Hierarchical Soft Fusion with Candidate-Label Reranking for Long-Tailed Micro-Action RecognitionYichi Zhang, Zhichao Xia, Yanjun Chi +6cs.CV2026-09-08
#40PhysFlow: Physics-Aware Optical Flow for Motion Controllable Video GenerationCong Wang, Hanxin Zhu, Yonglin Tian +5cs.CV2026-09-08
#41Dual-Layer Semantic-Spatial Belief Mapping for Aerial Object Goal NavigationJianqiang Xiao, Xiang Deng, Yuexuan Sun +3cs.RO2026-09-08
#42SciFigure2Code: An AI-Reconstructed Benchmark for Scientific Figure-to-CodeWentao Li, Yibo Wu, Yizhe Chen +5cs.CV2026-09-08
#43SynthGait-19K: A Physically Grounded Synthetic Video Dataset for Gait Parameter EstimationSoroush Mehraban, Xin Lei Lin, Vida Adeli +5cs.CV2026-09-08
#44RevalExo: A Functional Daily-Activity Benchmark for Inertial and Visual Locomotion Mode Recognition in Older Adults and Clinical CohortsDiwas Lamsal, Juha Carlon, Reinhard Claeys +8cs.AI2026-09-08
#45VI-Bench: Benchmarking Prompt Inversion from AIGC VideosWulin Xie, Rui Zhao, Kecen Li +5cs.CV2026-09-08
#46BanglaMemeX: Advancing Cultural Metaphoric Image Interpretation in Bangla with a Multimodal Explainable DatasetMd. Sadman Sakib, Zisan Mahmud, Md. Fahim Arefin +1cs.CL2026-09-07
#47Eliciting Self-Verification in Multimodal Reasoning Agents with Reinforcement LearningVishwas Sathish, Viresh Ranjan, Xinliang Zhu +2cs.AI2026-09-07
#48A Black-Box Adversarial Attack on Human Pose Estimation and Keypoint-Based Action Recognition ModelsKacper Mroczek, Michal Kepskics.CV2026-09-07
#49TaskGuard: Task-Conditioned Restoration Utility for Risk-Aware Object DetectionVung Phamcs.CV2026-09-07
#50ReactVAU: A Slow-Fast Decoupled Framework for Streaming Video Anomaly UnderstandingChia-Hui Chen, Shih-Ying Yeh, Fu-En Yang +2cs.CV2026-09-07

all trends · matching is case-insensitive substring after tokenization