PaperScope
LIVE · 2026-09-03 05:40 UTC

cs.CV Computer Vision · 35,250 papers

计算机视觉 · daily new submissions

Latestcs.CLcs.LGcs.AIcs.CV

New Papers per Day (30d)

#TitleAuthorsCatDate
1SolarWM: Open Data and Scalable Training for Long-Horizon Video World ModelsJunchao Huang, Guian Fang, Shengju Qian +15cs.CV2026-09-02
2Thinking in Pictures: A Systematic Benchmark for Reasoning-driven Image GenerationYutong Liu, Nan Huang, Xu Cao +1cs.CV2026-09-02
3PlantC2USeg: Cross-Scale Consistent Pre-Training for Few-Shot Unified Plant Point Cloud SegmentationYu Tian, Xintong Jiang, Jan Franklin Adamowski +2cs.CV2026-09-02
#4MuyBridge: Mobile Human Center-of-Mass Estimation from Monocular Video via Sparse FusionAidan Bradshaw, Marco Giordano, David Rode +8cs.CV2026-09-02
#5RoGe: Novel View Synthesis via End-to-End Implicit Reconstruction and GenerationXiaolei Lang, Ze Kang, Zehao Huang +1cs.CV2026-09-02
#6Efficient All-in-One Weather Restoration using Spectral HarmonizationPaula Garrido-Mellado, Daniel Feijoo, Yuning Cui +2cs.CV2026-09-02
#7Benchmarking RAW and RGB Restoration in Image Signal ProcessorsZihao Lu, Radu Timofte, Marcos V. Condecs.CV2026-09-02
#8GDB-Reward: From Evaluation Metrics to Training Rewards for Graphic DesignAdrienne Deganutti, Purvanshi Mehta, Simon Hadfield +1cs.CV2026-09-02
#9AutoCompass: Accurate Visual Localization on Public Maps by Learning from Weak LabelsJavier Tirado-Garín, Alan Savio Paul, Shuai Chen +5cs.CV2026-09-02
#10ShallowStream: Index Shallow then Answer Deep for Streaming Video UnderstandingJitai Hao, Ke Yang, Qiang Huang +1cs.CV2026-09-02
#11Video-Based Palm-Vein Authentication under Challenging ConditionsXiaofeng Yan, Kechen Liu, Abhilash Venkatesh +3cs.CV2026-09-02
#12Multi-Tool Image Editing Attribution in Facial ForgerySheng Liu, Qiang Sheng, Danding Wang +3cs.CV2026-09-02
#13Balancing Frequencies and Pixels in Flow MatchingLucas Degeorge, Paul Couairon, Arijit Ghosh +3cs.CV2026-09-02
#14InceptionGS: Generative Bootstrapping for Large-Scale Gaussian Splatting under Unstructured View SamplingTianheng Lu, Guangyu Wang, Ruqi Huang +1cs.CV2026-09-02
#15RVSD: Retrieval Vision Sparse Decoding for Mitigating Visual Hallucinations in Large Vision-Language ModelsCanjie Liu, Jiawen Kang, Jinbo Wen +1cs.CV2026-09-02
#16MV-dVRK: A Multi-Viewpoint Benchmark for Spatial Surgical PerceptionGuido Caccianiga, Sergey Prokudin, Yutong Chen +9cs.CV2026-09-02
#17A Top-Down Framework for Metric-Scale Athlete Localization from Single Broadcast FramesThanh-Khoi Nguyen, Hoang-Phuc Nguyen, Linh-Huynh +1cs.CV2026-09-02
#18Generating Medical Image Counterfactuals using Causal ExplanationsDavid A. Kelly, Tom Yaacov, Nathan Blake +2cs.CV2026-09-02
#19GaLe: memory-efficient Global Approximate and Local Exact featuresAlberto Ancilotto, Elisabetta Farellacs.CV2026-09-02
#20Genesis: A Generative Engine for Hierarchical Satellite Image SynthesisSubash Khanal, Yangzhi Cui, Daniel Cher +4cs.CV2026-09-02
#21LoFi RADIO: A Distilled In-Domain Backbone Applied for Artifact-Severity Grading of Ultra-Low-Field Neonatal Brain MRJonathan B. Martin, Yashwant Kurmi, Charlotte R. Sappoeess.IV2026-09-02
#22Query Rewriting for Complex Object Segmentation in 4D Gaussian RepresentationsThanh-Khoi Nguyen, Thien-Phuc Tran, Minh-Triet Trancs.CV2026-09-02
#23Characterizing Text Branch Sensitivity in Medical Vision-Language Segmentation via Evidence DecouplingZiquan Liu, Zhewei Zhu, Xuyang Shics.CV2026-09-02
#24Learning to Attract and Repel: Dual Quality Margin Learning for Face Recognition (DQM-Face)El Ouanas Belabbaci, Bhavesh Wani, Philipp Terhörstcs.CV2026-09-02
#25From Detection to Localization: A Unified Forensics Framework for Fully Synthetic and Tampered ImagesAnnalisa Gallina, Marco Fiorucci, Marco Brigo +2cs.CV2026-09-02
#26AffectDelta: Beyond Emotion Labels for Image EditingXingzu Zhan, Lin Gu, Ruogu Fangcs.CV2026-09-02
#27Generalizable Brain Tumor Segmentation with Self-Training and Tumor-Aware DeformationsHenrique Zan Grande, Jeovane Honorio Alves, Rayson Laroca +1cs.CV2026-09-02
#28Deeply Interleaved Text-Image Contexts for Multimodal LLMs AssessmentZihao Wang, Xi Xiang, Yuwen Sun +5cs.CV2026-09-02
#29MARS: What Retrieval Signals Are Hidden in Multimodal Large Language Models for Text-Video Retrieval?Uicheol Jung, Juyoung Hong, Geuntaek Lim +1cs.CV2026-09-02
#30Stereo 4D Radar for 3D Object Detection: Integrating Geometric Alignment and Absolute Velocity EstimationSeung-Hyun Song, Dong-Hee Paek, Woong-Chan Byun +1cs.CV2026-09-02
#31RGB-to-IR image translation for infrared vehicle detection in unseen UAV domainsThijs A. Eker, Ella P. Fokkinga, Jan Erik van Woerden +4cs.CV2026-09-02
#32Spatially Aware World Action Model via Geometric Latent DiffusionJavier Alejandro Lopetegui Gonzalez, Paul Pacaud, Cordelia Schmidcs.CV2026-09-02
#33Fine-Grained Anomaly Perception in Wild UGC-Enhanced Images: A Comprehensive Dataset and Difference-Fusion FrameworkYan Zhong, Gefei Chen, Qiufang Ma +4cs.CV2026-09-02
#34Doppio: A Dataset for Contactless Weight Estimation of Falling ParticlesSimon Kiefhaber, Jan-Martin O. Steitz, Julia Grabinski +5cs.CV2026-09-02
#35Beauty is in the AI of the beholder: MLLMs systematically overrate facial attractivenessSantiago Grandas, Juan Sebastian Cely-Acosta, Mohit Mendiratta +2cs.CV2026-09-02
#36Orthogonal Ensembles and Tested Explanations for Performer-Independent Body-Motion Emotion RecognitionNaoto Nishida, Yoshio Ishigurocs.CV2026-09-02
#37SR-Edit: Region-Aware Image Editing via Self-RefinementAndong Wang, Zehua Chen, Yuxuan Jiang +1cs.CV2026-09-02
#38Blending Concepts: Benchmarking Visual Metaphor Generation in Text-to-Image ModelsChuer Chen, Zichen Wang, Yi He +2cs.CV2026-09-02
#39ViSAR: Training-Free Adaptive-$k$ Retrieval for Visual Document Question AnsweringAdrien Mialland, Marc Plantevit, Julien Gallois +1cs.IR2026-09-02
#40UnCapsTSR: An Unsupervised Transformer-based Image Super-Resolution Approach for Capsule Endoscopy ImagesAnjali Sarvaiya, Shubh Kawa, Lalit Agrawal +3cs.CV2026-09-02
#41Learning to Track from Privileged Target AppearancesXin Chen, Jiao Xu, Dong Wang +2cs.CV2026-09-02
#42VIPS: Vehicle-Infrastructure Cooperative Planning Benchmark via Pseudo-SimulationHoonhee Cho, Jae-Young Kang, Giwon Lee +3cs.CV2026-09-02
#43WiFlow: Estimating Optical Flow using WiFi Channel State InformationThomas Weigel, Simon Kiefhaber, Fabian Portner +2cs.CV2026-09-02
#44Adapting a Foundation Model for Lunar Surface Height EstimationPatrick Bauer, Marius Schwinning, Melanie Siegel +2cs.CV2026-09-02
#45Uncertainty-Guided Adverse Weather Restoration via Gated Transformer NetworkZheke Jin, Yuning Cui, Tianle Jin +2cs.CV2026-09-02
#46The Diagnosis a Reporter Leaves Unspoken: Surfacing Frozen Tumor Features for Brain-Tumor MRI ReportingKhawaja Murad ul Hassan, Ruqiyya Adil, Adil Qayyum +4cs.CV2026-09-02
#47CA-OPD: Confidence-Aware On-Policy Distillation for Structured Visual PredictionMenghao Li, Linjie Mu, Yin Wang +4cs.CV2026-09-02
#48Seeing Beyond the Lesion: Disease Recognition from Reactive CNS TissueJan Schnorrenberg, Jan Ernsting, Enrico Küllenberg +3eess.IV2026-09-02
#49ProSR: Semantic-Prototype-Guided Discrete Modeling for Physically Consistent SAR Super-ResolutionByoungwoo Kim, Munchurl Kimcs.CV2026-09-02
#50Information Density Imbalance in Visual Object DetectionZiwei Zhao, Yanxi Lu, Yuwei Hu +8cs.CV2026-09-02
#51The Missing Temporal Link: Temporal Context Routing for Script-Driven Audio-Video GenerationYichen Liu, Quanwei Zhang, Haozhe Wang +7cs.MM2026-09-02
#52TempoGround: State-Aware Streaming Visual Grounding with Vision-Language ModelsLeqian Ding, Junning Qiu, Manwen Yang +2cs.CV2026-09-02
#53LookStep: Efficient Vision-Language Navigation with Linguistic Foresight and Event Driven MemoryKun-Yang Yu, Yingzhe Li, Hongyu Xu +8cs.CV2026-09-02
#54GlyphAnchor: Enhancing Visual Text Rendering via Position-Anchored Glyph PriorsQiang Xiang, Shuang Sun, Binglei Li +4cs.CV2026-09-02
#55Structured-Prior-Guided Diffusion Inpainting with Physical Consistency for Traffic Sign AugmentationLuo Li, Chongchong Huang, Jun Jia +4cs.CV2026-09-02
#56Towards Zero-Shot Transfer Across Embodiments For Driving VLAsCaio Azevedo, Stefano Sabatini, Sascha Hornauer +1cs.CV2026-09-02
#57ORB-SVM : An Innovative Hybrid Framework for Efficient Brain Tumor Detection from MRI ScansAmirhosein Azarpourcs.CV2026-09-02
#58YesTrack: Referring Multi-Object Tracking via MLLM-based Yes/No VerificationQuansheng Hu, Qin Sun, Qiansen Dai +4cs.CV2026-09-02
#59Domain shift-robust object detection with GenAI image editingIsabel D. Stein, Thijs A. Eker, Sebastiaan P. Snel +4cs.CV2026-09-02
#60VoRTeC: Taming Foundation Flow for One-step Real time Video CompressionYichong Xia, Qinhong Wu, Qinhong Wu +3cs.CV2026-09-02
#61If It Moves, Radar Knows: A Physics-Aware Radar Transformer for Class-Agnostic Moving-Object DetectionYinghao Sun, Shuguang Li, Jinliang Shao +1cs.CV2026-09-02
#62Diffusion-Encoding Gaussian Field for Joint k-q dMRI ReconstructionZhibo Chen, Yajuan Huang, Yu Guan +3cs.CV2026-09-02
#63RouteGraph-Mona: Confusion-Aware Routing Fine-Tuning for Mineral Image ClassificationJierui Li, Zhiyuan Qi, Hao Zhu +7cs.CV2026-09-02
#64Retrosynthesis of Synthetic Media for Explainable AI Provenance ForensicsYijie Lin, Ching-Chun Chang, Isao Echizen +2cs.CR2026-09-02
#65MAOL: Morphology-Aware Ordinal Learning for Fine-Grained Industrial Defect Severity GradingZhaoyang Wang, Haiyong Chen, Binyi Su +4cs.CV2026-09-02
#66T2LSC-Bench: Benchmarking Localized Semantic Control in Text-to-Image GenerationYan Wang, Xinyi Hou, Weiguo Lin +2cs.CV2026-09-02
#67Handwriting Trajectory Recovery via Autoregressive Ordered Stroke Instance PredictionEn-Guang Wang, Yan-Ming Zhang, Fei Yin +1cs.CV2026-09-02
#68SAUF-Net: Structure--Appearance Representation Learning with Uncertainty Feedback for Semi-Supervised Medical Image SegmentationQin Lu, Zheyang Jing, Yujie Yang +3cs.CV2026-09-02
#69InfraPatch: Cross-Task Targeted Grayscale Patch Attacks on Infrared-Adapted Vision-Language ModelsChengyin Hu, Dingyi Lu, Jiaju Han +5cs.CV2026-09-02
#70Signal or Noise? Auditing Rotation-Induced Saliency Drift in Medical and Aerial ImagingKhawaja Murad ul Hassan, Mehran Ebrahimics.CV2026-09-02
#71Hardware-Accelerated Instance Segmentation for Resource-Constrained Space Robotics with Criticality AnalysisSiddhant Shete, Hilmi Dogu Kücüker, Udo Frese +1cs.RO2026-09-02
#72FuDU: A Fuzzy Dual-dimensional Uncertainty Framework for Streaming Active Learning in Industrial Defect DetectionZhaoyang Wang, Haiyong Chen, Binyi Su +1cs.CV2026-09-02
#73Asymmetric Paired-Annotation Learning for Multi-Structure ULF Pediatric Brain MRI SegmentationHa-Hieu Pham, Dang P. M. Cao, Minh Hoang Pham +4cs.CV2026-09-02
#74LeakageBench: Document-Level Leakage Risk for Redacting Personally Identifiable Information in Document ImagesVishnu Prasad Vijaya Kumar, Santhosh Venkatesh, Ivan P. Yamshchikovcs.CV2026-09-02
#75TAME: Temporal-Aware Mixture-of-Experts for Text-Video RetrievalUicheol Jung, Juyoung Hong, Hojung Kwon +1cs.CV2026-09-02
#76Lightweight Adaptation of General-Purpose VLMs for Multispectral and SAR Image UnderstandingShanji Liu, Kelu Yao, Junxiao Xue +5cs.CV2026-09-02
#77CC-4DGS: Computational Deformation and Point-Cloud Compression for Storage-Efficient Dynamic Gaussian SplattingKyungdae Park, Chae Eun Rheecs.CV2026-09-02
#78Progressive Pseudo-Label Optimization for Point-Supervised Change DetectionHailong Ning, Hao Wang, Yimeng Wang +3cs.CV2026-09-02
#79World-Coherent Decoding: Self-Verifying Test-Time Planning for World Action ModelsChuhan Zhang, Seiji Ito, Kenta Hoshino +2cs.CV2026-09-02
#80Synergistic Information Disentanglement for Omni-modal Slide Representation Learning in Computational PathologyMingxin Liu, Chengfei Cai, Anwen Lu +5cs.CV2026-09-02
#81Disease Burden over Skin Tone: Decomposing the Dermatology-AI Generalization GapNirajan Kunwor, Sanjaya Poudel, Quoc-Huy Trinh +2cs.CV2026-09-02
#82A Unified Rate-Distortion Perspective on Vector, Product, and Scalar QuantizationXianghong Fang, Wenlong Mou, Yuan Yuan +2cs.LG2026-09-02
#83Federated LoRA Adaptation of BiomedCLIP Across Four International Chest X-Ray CohortsSanjaya Poudel, Nirajan Kunwor, Manish Dhakal +2cs.LG2026-09-02
#84Evidence-Guided Detection, Localization and Explanation for Text-Centric Image ForensicsPeifeng Liu, Bin Li, Qingsong Zhang +3cs.CV2026-09-02
#85Rendering-in-the-Loop: An Execution-Driven Agent for Interactive Web DevelopmentYilong Guo, Hanqi Chen, Zixiao Ye +3cs.CV2026-09-02
#86TC-Next: Zero-Shot Multimodal Cyclone ForecastingZhe Wang, Sijie Chen, Yiming Luo +2cs.LG2026-09-02
#87KSG-Net: Key-Sparse and Global-Context Learning for Maritime 3D Ship DetectionZhouyuan Huai, Meiqi Wan, Yan Yang +4cs.CV2026-09-02
#88DPA: Decoupling Product-Agnostic Anomaly Representations for Zero-shot Anomaly GenerationHang Yao, Yansheng Fu, Ming Liu +4cs.CV2026-09-02
#89LaST-SR: Laplace-Inspired Steady-Transient Complex-Frequency Decomposition for Single Image Super-ResolutionLinhao Li, Zhaojie Pan, Langkun Chencs.CV2026-09-02
#90DocHop: Benchmarking Out-of-domain Multi-hop Reasoning in Information-Dense DocumentsZhuoran Yu, Le Thien Phuc Nguyen, Jaden Park +5cs.AI2026-09-02
#91Test-Time Logit Prompting for Source-Free Missing Modality AdaptationTaixi Chen, Nancy Guocs.CV2026-09-02
#92SelfLift: Accelerating Few-Step Diffusion via Self-Recovering Resolution TransitionTingyan Wen, Chenqian Yan, Xurui Peng +4cs.CV2026-09-02
#93Detecting Object Hallucinations in Large Vision-Language Models via Cross-Modal Attention Drifts and Mask-Based VerificationXuanbing Wen, Boxu Chen, Le Yang +4cs.CV2026-09-02
#94Source-Free Class Relearning: Diagnosing Forgetting in Class UnlearningZahra Dehghani, Pablo Piantanida, Mohammadhadi Shaterics.LG2026-09-02
#95Perceptually Regularized Diffusion Model for Image Super-ResolutionChuxiangbo Wang, Pavithra Venkatachalapathy, Ying Liang +4eess.IV2026-09-02
#96GeoStore: Finding Small Storefronts in Large Scenes -- A Fine-Grained POI Localization Benchmark with Global-to-Local Asymmetric MatchingLu Han, Xiting Sun, Hao Wang +4cs.CV2026-09-02
#97InstEditSeg: Instruction-Driven Image Editing for Polyp and Skin Lesion SegmentationZiquan Liu, Zhewei Zhu, Xuyang Shics.CV2026-09-02
#98InsightSeg: Reusing Correction Insights for Guideline-Consistent SegmentationVanshika Vats, Ashwani Rathee, James Daviscs.CV2026-09-02
#99Who Drives the Probability Game of VLMs? A Temporal Causal Drive Evaluation FrameworkShuyao Xiao, Shengling Wang, Haoyu Niu +4cs.CV2026-09-02
#100Linear Fusion MultiDiffusion for Fast Training-Free Spherical Panorama GenerationAkio Hayakawa, Yusuke Mukuta, Tatsuya Haradacs.CV2026-09-02
#101Morphology signal in whole slide image foundation models can automatically triage slidesAyushi Sinha, Shashank Yadav, Benjamin Holmes +9cs.CV2026-09-02
#102Aggregating Neighbor Embedding Projection and Rank-Based Manifold Learning for Image RetrievalVinicius Atsushi Sato Kawai, Gustavo Rosseto Leticio, Lucas Pascotti Valem +1cs.CV2026-09-02
#103Data-Efficient Networks for Multi-Contrast MRI Reconstruction based on a Generalized Content/Style PriorChinmay Rao, Efe Ilıcak, Matthias J. P. van Osch +5eess.IV2026-09-02
#104Learning with Volterra Neural Networks: A System Theoretic PerspectiveHaoyu Yun, Hamid Krim, Yufang Baocs.CV2026-09-01
#105Automated Maize Ear Phenotyping Using 3D ReconstructionsRitwesh A. Kumar, Som Tripathi, Peja Matthews +5cs.CV2026-09-01
#106TAPVid-MV: A Benchmark for Tracking Any Point in 3D Across Multiple ViewsSkanda Koppula, Frano Rajic, Abdullah Faiz Ur Rahman +9cs.CV2026-09-01
#107Does Playing it Safe Count as Faithfulness? Reassessing LVLM Hallucination Mitigation MethodsMehrdad Fazli, Sina Mansouri, Mohit Marvania +1cs.CV2026-09-01
#108SignMatch: Matching Dictionary Signs to Continuous Sign Language VideoRyan Wong, Youngjoon Jang, Liliane Momeni +2cs.CV2026-09-01
#109RAFT-DVC: Resolution-Aware Machine Learning-Based Digital Volume CorrelationZixiang Tong, Lehu Bu, Jin Yangcs.CV2026-09-01
#110Cross-Model Distillation of a Human-Pose Foundation Model from Unannotated Infant Video for Markerless 3D Pose EstimationR. James Cotton, Divya Joshi, Colleen Peytoncs.CV2026-09-01
#111SliceBridge: context-consistent repair of corrupted slice intervals in T1-weighted MRIJiheng Li, Michael E. Kim, Trent Schwartz +6cs.CV2026-09-01
#112Kirin: Animal Motion Generation from In-the-Wild VideoBrian Nlong Zhao, Zhuoyang Pan, James M. Rehg +2cs.CV2026-09-01
#113Video2Reaction: Training Foundation Video Models to Predict Audience ReactionSidong Zhang, Trang Nguyen, Shiv Shankar +4cs.CV2026-09-01
#114Integrated Laser Scanning and Image-Based Topology Optimization Techniques for Detection and Quantification of Visible and Subsurface Structural DefectsMehrdad Shafiei Dizaji, Devin Harriscs.CV2026-09-01
#115Consistency as Regularization for Unsupervised Shadow RemovalAnh-Kiet Duong, Petra Gomez-Krämer, Jean-Michel Carozzacs.CV2026-09-01
#116Improved Automatic Target Recognition in Synthetic Aperture Sonar Imagery Using Large Deep Neural NetworksC. J. Moore, Alex Hurt, Jordan Malofcs.CV2026-09-01
#117Designing Versatile Samples for Learned Trajectory ScoringYaguang Li, Jiaru Zhang, Chuheng Wei +2cs.RO2026-09-01
#118DESA-TTA: Dynamic EMA and Source Anchoring for Test-Time AdaptationAtif Belal, Lilian Hollard, Marco Pedersoli +1cs.CV2026-09-01
#119Efficient Passive Acoustic Monitoring of Killer Whales Using a Two-Stage Detection and Ecotype Classification CascadeDaniela Ruiz, Manuel Castellote, Zhongqi Miao +5cs.SD2026-09-01
#120CoViT: Instance-Correspondence Contrastive Learning for Vision TransformerYisen Wang, Zhirong Wu, Limin Wangcs.CV2026-09-01
#121Ten Architectures, One Error: Shared Failure Modes in Hyperspectral Classification under Spatially Disjoint EvaluationEhsan Faghih, Fatemeh Ashrafi, Marguerite Moore +1cs.CV2026-09-01
#122Allocate Before You Embed: Adaptive Visual Input Allocation for Video EmbeddingsSong Jin, Zhongtao Jiang, Chenglei Shen +5cs.CV2026-09-01
#123MemeCULT-1K: Benchmarking South Asian Cultural Context and Humor Understanding of Multimodal ModelsTawsif Tashwar Dipto, Mehedi Ahamed, Radib Bin Kabir +5cs.CL2026-09-01
#124AlphaRAD: Grounded Zero-Shot Classification in Chest Radiology via $α$-Corrected Binary Cross Entropy and Factorized Latent SupervisionJianzhong You, Yuan Gao, Chris McIntoshcs.CV2026-09-01
#125Swin Meets EfficientNet: Lightweight Architectures for GAN-Based Face ForensicsSejuti Basu, Ashima Sood, Vijay Kumar +1cs.CV2026-09-01
#126SCULPT: Training Edge Vision Models for Post-Training Quantization ReadinessBharadwaj Kavuri, Sourav Babu-PK, Varadhraj Ellapan +2cs.CV2026-09-01
#127Evidential Deep Learning for Multi-Modal Anti-UAV DetectionDmitry Golovchits, Seyed Sahand Mohammadi Ziabari, Ali Mohammed Mansoor Alsahagcs.CV2026-09-01
#128ZipTok3D: High-Fidelity 3D Tokenization with Compact Token PrefixesMingda Lin, Weijie Wang, Zeyu Zhang +7cs.CV2026-09-01
#129UAV Thermal Imagery for Inert Ordnance Screening: Multi Campaign Dataset Development,Object Detection, and Practical RecommendationsChad Melton, PhD., Annabelle Keltoncs.CV2026-09-01
#130From Visual Cues to Spoken Narration: Rethinking Audio DescriptionAkshita Gupta, Aditya Arora, Federico Tombari +2cs.CV2026-09-01
#131Uncovering Understanding-Generation Synergy in Native Unified Multimodal Models: From Representation, Task to SystemPenghao Wu, Haiwen Diao, Weichen Fan +3cs.CV2026-09-01
#132UI-VISA: U-Net Initialized Vascular Image Segmentation ArchitectureAsees Kaur, Suzanne S. Sindi, Erica M. Ruttercs.CV2026-09-01
#133A Benchmark for Vehicle Attribute Classification in Cross-Domain Surveillance ScenariosSergio M. Silva, Otavio T. Remer, Gabriel E. Lima +3cs.CV2026-09-01
#134SpatialGuard: Harness-Guided Verifiable Spatial Reasoning for Text-to-Image GenerationZiyun Qian, Zizhi Chen, Yizhou Liu +3cs.CV2026-09-01
#135H3-World: Turning Language Understanding into World ControlDanze Chen, Zeqing Wang, Ziyue Lin +2cs.CV2026-09-01
#136BS: Take the Hint - Interactive Multitracer PET/CT Lesion Segmentation with a Scribble-Conditioned ResEnc U-NetMarven Sherif, Amgad Elmasry, Youssef Ghazal +1cs.CV2026-09-01
#137What, Where, and How: Probing Spatiotemporal Representations in Video Foundation ModelsSharon S. Musa, Fereshteh Forghani, Harrish Thasarathan +3cs.CV2026-09-01
#138Revisiting Cross-View Completion: Self-Supervised Pre-Training via Reconstruction Error ComparisonThibaut Loiseau, Guillaume Bourmaud, Vincent Lepetitcs.CV2026-09-01
#139DualDiff3D: Dual Structure-Appearance Diffusion Priors for Reliability-Enhanced 3D Gaussian SplattingQian Wang, Yu Wang, Weiqi Li +4cs.CV2026-09-01
#140TempCloze: Can Video-LLMs Identify the Missing Middle?Wenqi Pei, Henry Hengyuan Zhao, Yilai Liu +4cs.CV2026-09-01
#141A Sensor-Adaptive Incremental Learning Framework for Artifact Detection in Satellite Precipitation DataAndres F. Monsalve, Hernan A. Moreno, Christian D. Kummerowphysics.ao-ph2026-09-01
#142Benchmarking Spatial, Spectral, and Self-Supervised Cues for Face Forgery Detection under Realistic DegradationLucas Cunha, Lucas Sotomaior, Lucas Gasperin +3cs.CV2026-09-01
#143CameraEditor: Camera-Controlled Image Editing via Video-Prior Sequential ModelingXin Shen, Chengyou Jia, Keshuo Xing +6cs.CV2026-09-01
#144FairLens: Benchmarking Fairness in Vision-Language Models for High-Stakes Decision-MakingVahid Reza Khazaie, Ahmed Y. Radwan, Shaina Razacs.CV2026-09-01
#145RadMatch: Auditable Radiology Report Evaluation via Finding-Level MatchingCharles Corbière, Léo Machado, Aubin Charley +3cs.CV2026-09-01
#146Gaussian Core LoRA: Distribution-Aware Dynamic Adaptation for Broad Concept ErasureQinghui Gong, Xunlei Chen, Yu-Xuan Zhang +2cs.CV2026-09-01
#147Pix2Rep-v2: Data-Efficient Representation Learning for Dense Medical Imaging ApplicationsS. Sifaoui, E. Angelini, S. Toupin +2cs.CV2026-09-01
#148Semantic-Guided Multimodal Preprocessing for Vision Transformer-Based Clear Cell Renal Cell Carcinoma GradingFatemeh Javadian, Zhu Chen, Zahra Aminparast +1cs.CV2026-09-01
#149MegaStyle++: Scaling Image Style Space through Hierarchical Style DefinitionJunyao Gao, Sibo Liu, Jiaxing Li +4cs.CV2026-09-01
#150EdiTikZ: Scientific Figure Editing from Revision TrajectoriesChristian Greisinger, Zhixue Zhao, Steffen Egercs.AI2026-09-01
#151Neuro-Symbolic Geometric Abstraction (NeuSOGA): From Observations to Symbolic Mathematical RepresentationsQingde Li, Qingqi Hong, Zihan Li +1cs.AI2026-09-01
#152Scale-based Approach for Active Wildfire Segmentation on Satellite ImageryMatheus F. Kovaleski, Cristiano Premebida, João Ruivo Paulocs.CV2026-09-01
#153Multimodal RGB-Infrared Combination for UAV-Based Wildfire Segmentation: A Comparative Study on FLAME3Matheus F. Kovaleski, Luís Garrote, Cristiano Premebida +2cs.CV2026-09-01
#154InSight: A Benchmark for Agentic Claim Verification in Interactive VisualizationsMaeve Hutchinson, Syed Mahbubul Huq, Mohammad Albinhassan +3cs.CL2026-09-01
#155IntroConformal: Conformal Factuality Guarantees for Large Vision-Language Models via Introspective SignalsMd. Atabuzzaman, Christian Alexander, Chris Thomascs.CV2026-09-01
#156Diffusion Based Unpaired Data Learning for Inverse ProblemsChenglong Bao, Yiming Dang, Chenguang Duan +2cs.CV2026-09-01
#157Accurate Reconstruction of Gas Turbine Blade Geometry Using 3D/2D Rigid Registration and CT View OptimizationHristo Valtchanov, Nicolas Piché, Vladimir Brailovski +3cs.CV2026-09-01
#158ExBind: A Controlled Diagnostic Benchmark for Visual-to-Executable CorrespondenceZiqian Wang, Yuxiao Cheng, Tingxiong Xiao +1cs.CV2026-09-01
#159Reliability Challenges in Diffusion Vision-Language ModelsMd. Atabuzzaman, Chris Thomascs.CV2026-09-01
#160MIDR: Enrichment-Augmented Indexing for Multimodal Document RetrievalDebanjan Mahata, Atharva Tendle, Daniel Preotiuc-Pietro +2cs.IR2026-09-01
#161GazeRefine: Expert Gaze as a Test-Time Prompt for Training-Free Medical Image SegmentationMohammed Oussama Benyahia, Marouane Tliba, Mohamed Amine Kerkouri +10eess.IV2026-09-01
#162CMRVision: A Foundation Model for Cardiac MR Image AnalysisAthira J. Jacob, Puneet Sharma, Daniel Rueckertcs.CV2026-09-01
#163MeshSplatBench: A Unified Benchmark for Triangle-Based Neural RenderingKaixuan Zhang, Minxian Li, Mingwu Ren +1cs.GR2026-09-01
#164Agentic Multimodal Models for Environmental Hyperspectral UnmixingMichał Cholewa, Luca Ciampi, Nicola Messina +2cs.CV2026-09-01
#165HiLRP: Toward One Trustworthy Explanation for Vision Transformer: Conservation-Valid Attribution via Attention PrimitivesSathiyamohan Nishankar, Pubudu Sanjeewani, Asanka Perera +1cs.CV2026-09-01
#166TimeSteer: Inference-Time Speech Scheduling in Joint Audio-Visual Diffusion ModelsChao Zhou, Yiling Chen, Qi Chu +3cs.CV2026-09-01
#167Seeing the World and the Self from Egocentric VideoKai Guan, Minchao Jiang, Ruichen WangLi +2cs.CV2026-09-01
#168FORGE: Forward-Only Test-Time Adaptation for Integer-Only Vision Models on MicrocontrollersMuhammad Rehan, Haider Ali, Muhammad Ali Munir +1cs.CV2026-09-01
#169MeRoPE: Metric Rotary Position Embedding for Camera-Controlled Video GenerationZhijian Qiao, Xinjiang Wang, Jiajie Chen +5cs.CV2026-09-01
#170One Prompt Is Enough: Watermark Laundering Through Foundation Image ModelsJidong Yang, Qi Li, Wei Zong +5cs.CV2026-09-01
#171S$^2$Prune: Spatially Structured Visual Token Pruning for Multimodal Large Language ModelsYuanyuan Jia, Shunpu Tang, Qianqian Yangcs.CV2026-09-01
#172Compressing AI Traffic: Standardized Neural Network Coding of Visual-Token Representations in Split Vision-Language InferenceReza Heidari, Hamed R. Tavakoli, Juho Kannalacs.CV2026-09-01
#173Monocular Depth Estimation from a Single Image: Progress and OpportunitiesMuxin Liu, Xiaoyang Lyu, Yang-Tian Sun +4cs.CV2026-09-01
#174Dotting the Eye: An Intent-Driven Image Retouching Agent for Visual Focus EnhancementChujie Qin, Zilong Zhang, Zewei Chang +5cs.CV2026-09-01
#175On the Design Fundamentals of Pixel Text Representation LearningChaohao Yuan, Ruifeng Yuan, Zhuoxu Huang +4cs.CV2026-09-01
#176StainPresetNet: Stain Preset Network for Fast Multi-to-Multi Stain NormalizationHongtao Kang, Die Luo, Li Chen +4cs.CV2026-09-01
#177Physics-Driven Independent Pair Generation for Iterative Self-Supervised Low-Dose CT DenoisingXianlei Han, Shaoyu Wang, Jiancheng Fang +2cs.CV2026-09-01
#178Revisiting Face Recognition for Monozygotic Twins: The Celeb Twins Test SetMichael Zang, Haiyu Wu, Mrinal Sharma +1cs.CV2026-09-01
#179Different Changes Require Different Reasoning: Change-Type-Specialized Experts for Robust Change CaptioningJiyoung Park, InJae Oh, Jung Uk Kimcs.CV2026-09-01
#180P-PatchDiff: Progressive Patch Diffusion Models for Low-light Image EnhancementRuoyu Guo, Haonan Zhong, Maurice Pagnucco +1cs.CV2026-09-01
#181When Modality Gap Reduction Fails: Prediction-Level Hubness in CLIPShota Sato, Hajime Kiyama, Tosho Hirasawa +1cs.CL2026-09-01
#182IT-TextFusion: Iterative Text-Image Interaction with Text-Guided Residual Refinement for Degradation-Aware Image FusionSiyang Liu, Peiyi Zhou, Tianle Jin +3cs.CV2026-09-01
#183Let Confidence Change, Not the Prediction: Prediction-Preserving Repair for Post-hoc CalibrationDaehwan Kim, Haejun Chung, Ikbeom Jangcs.LG2026-09-01
#184Lightweight Interpretable RGB-Guided Hyperspectral Super-Resolution under Real Cross-resolution MisalignmentMohamad Jouni, Aurélien Godet, Mauro Dalla Muraeess.IV2026-09-01
#185Dyn-3D: Unveiling and Resolving Ego-Motion Ambiguity in Vision-Language ModelsJiayu Ding, Zhuodong Liu, Lei Zhang +6cs.CV2026-09-01
#186SAGE: Subpopulation-Aware Generative Enhancement for Mitigating Spurious CorrelationsYiming Luo, Rongqiang Zhao, Jie Liucs.LG2026-09-01
#187ViTAMINS: An Empirical Study of Training Self-Supervised Vision Transformers with Synthetic Hard NegativesNikos Giakoumoglou, Andreas Floros, Kleanthis-Marios Papadopoulos +1cs.CV2026-09-01
#188MultiGait: A Multi-Sensor Multi-Perspective Multi-Session Biometric Inference Benchmark and its DatasetJulian Todt, Felix Morsbach, Philip Dissert +1cs.CR2026-09-01
#189Fi-ImageNet-1k: An OOD Benchmark From the Inside of the ImageNet-1k Validation SetRuslan Rozumnyi, Matěj Suchánek, Tomáš Vojíř +2cs.CV2026-09-01
#190PyDoseRT Proton: A GPU Pencil-Beam Engine with a Convolutional Residual-Correction Network for Fast Proton Dose CalculationLukas Zimmermann, Hermann Fuchs, Attila Simkó +1physics.med-ph2026-09-01
#191Low-Quality Face Recognition using Center Aligned Representations and Local Margin ConstraintsVedat Can Dilaver, Benjamin S. Riggancs.CV2026-09-01
#192SinkPruner: Sink-Free Visual Token Pruning for Multimodal Large Language ModelsShiyu Li, Zi-Yuan Hu, Shijia Huang +3cs.CV2026-09-01
#193Does This Moment Justify the Recommendation? Counterfactual Behavior-Grounded Evidence Retrieval for Personalized Video RecommendationXin Liucs.CV2026-09-01
#194CQF-HMR: Continuous Quaternion Flows for Probabilistic 3D Human Mesh Recovery from a Single ImageCuong Le, Bao-Long Tran, Pavlo Melnyk +3cs.CV2026-09-01
#195EvoGS: Modeling Deformation Evolution for Dynamic Gaussian SplattingWei Dong, Shahram Shirani, Jun Chen +1cs.CV2026-09-01
#196Semi-Supervised Virtual Staining via Morphology Preservation and Histopathological Realism ConstraintsBaoshun Wang, Weiping Lin, Linwu Wang +3cs.CV2026-09-01
#197Prior-Guided Implicit Neural Representations for Single-Subject Diffusion MRI Super-ResolutionAbdulkader Ghandoura, Marsil Zakour, William Consagra +1eess.IV2026-09-01
#198ReFlowSET: Representation-Aligned Latent Flow Matching for SAR-to-EO Image TranslationJeonghyeok Do, Seungchul Lee, Munchurl Kimcs.CV2026-09-01
#199Conditional Flow Matching for Cross-Field MRI HarmonisationBaris Imre, Aram Salehi, Levente Baljer +3cs.CV2026-09-01
#200Candidate-Expanding Routing with Permutation-Stabilized Experts for Mixed-Format Medical VQAHai-Dang Nguyen, Huy-Hieu Phamcs.CV2026-09-01

Showing latest 200 of 35,250 · all categories