| 1 | Benchmarking RAW and RGB Restoration in Image Signal Processors | Zihao Lu, Radu Timofte, Marcos V. Conde | cs.CV | 2026-09-02 |
| 2 | GDB-Reward: From Evaluation Metrics to Training Rewards for Graphic Design | Adrienne Deganutti, Purvanshi Mehta, Simon Hadfield +1 | cs.CV | 2026-09-02 |
| 3 | Blending Concepts: Benchmarking Visual Metaphor Generation in Text-to-Image Models | Chuer Chen, Zichen Wang, Yi He +2 | cs.CV | 2026-09-02 |
| #4 | T2LSC-Bench: Benchmarking Localized Semantic Control in Text-to-Image Generation | Yan Wang, Xinyi Hou, Weiguo Lin +2 | cs.CV | 2026-09-02 |
| #5 | MeanField Surrogate Modeling for Scalable Runtime Scheduling of Concurrent Heterogeneous AI Inference on Shared GPUs | Youssef Ennouri, Soonhoi Ha | cs.DC | 2026-09-02 |
| #6 | DocHop: Benchmarking Out-of-domain Multi-hop Reasoning in Information-Dense Documents | Zhuoran Yu, Le Thien Phuc Nguyen, Jaden Park +5 | cs.AI | 2026-09-02 |
| #7 | Benchmarking Language Models for Statistical Problem Formulation | Chen Wang, Junzhe Zhao, Xin Cong +2 | cs.AI | 2026-09-02 |
| #8 | MemeCULT-1K: Benchmarking South Asian Cultural Context and Humor Understanding of Multimodal Models | Tawsif Tashwar Dipto, Mehedi Ahamed, Radib Bin Kabir +5 | cs.CL | 2026-09-01 |
| #9 | Efficient SWE Agent Benchmarking via Trajectory-Aware Evaluation | Kefeng Duan, Dewu Zheng, Yanlin Wang +7 | cs.SE | 2026-09-01 |
| #10 | Benchmarking Spatial, Spectral, and Self-Supervised Cues for Face Forgery Detection under Realistic Degradation | Lucas Cunha, Lucas Sotomaior, Lucas Gasperin +3 | cs.CV | 2026-09-01 |
| #11 | FairLens: Benchmarking Fairness in Vision-Language Models for High-Stakes Decision-Making | Vahid Reza Khazaie, Ahmed Y. Radwan, Shaina Raza | cs.CV | 2026-09-01 |
| #12 | Reliability Challenges in Diffusion Vision-Language Models | Md. Atabuzzaman, Chris Thomas | cs.CV | 2026-09-01 |
| #13 | EDRAC: Benchmarking Arabic Dialect Reading Comprehension | Noor Abo Mokh, Kirill Chirkunov, Teresa Lynn +15 | cs.CL | 2026-09-01 |
| #14 | Benchmarking Vision-Language Models for Automated Pathology Diagnosis and Report Generation | Yumi Lee, Harim Oh, Hyoryung Kim +52 | cs.CV | 2026-09-01 |
| #15 | StudyBench: Can Self-Evolution Squeeze Textbooks for Olympiad Capability? | Yinghao Chen, Zixi Chen, Bingxiang He +7 | cs.AI | 2026-09-01 |
| #16 | Aligned but Flattened: Analyzing the Trade-off between Cultural Alignment and Diversity in LLMs | Jingshen Zhang, Shaoyang Xu, Wenxuan Zhang | cs.SI | 2026-09-01 |
| #17 | MemeBridge: A Dataset for Benchmarking and Mitigating the Bidirectional Cultural Gap in Meme Interpretation | Hangxiao Zhu, Suliu Qin, Zhuoyan Li +3 | cs.CL | 2026-08-31 |
| #18 | Toward Workflow-Aware Benchmarking for Healthcare NLP Agents | Junyi Yao, Baichuan Li, Zihao Zheng +1 | cs.CL | 2026-08-31 |
| #19 | CoLT-Drive: Counterfactual Long-Tail Benchmarking and Knowledge-Preserving Adaptation for Driving Affordance Prediction | Zhengxu Tang, Guofeng Cui, Ziyu Gong +8 | cs.CV | 2026-08-31 |
| #20 | Beyond Blind Compliance: Benchmarking Task Verification in OCR Reasoning | Yue Zhou, Yuan Wu, Yi Chang | cs.CV | 2026-08-31 |
| #21 | Distributed Implicit Harm: A Compositional Safety Blind Spot in MLLM-Based Video Moderation | Ruotong Wang, Zihao Zhu, Siwei Lyu +2 | cs.CV | 2026-08-31 |
| #22 | Stress-Testing Efficient Responsible-AI Evaluation: When Compute Savings Change Benchmark Conclusions | Ahmed El Kady, Aravind Narayanan, Rehana Noorani +2 | cs.LG | 2026-08-31 |
| #23 | Towards Stream Learning on Embedded Systems: Benchmarking the Memory Consumption of Stream Learning Methods | Sebastian Buschjäger, Nuwan Gunasekara, Heitor Murilo Gomes | cs.LG | 2026-08-31 |
| #24 | MMDS-Bench: Benchmarking Multimodal Large Language Models on Dynamic Stance in Social Media Interactions | Yuzhe Ding, Kang He, Li Zheng +5 | cs.CL | 2026-08-31 |
| #25 | ECGQuest: Benchmarking and Fine-Tuning Language Models for Electrocardiography | Mohammadsina Hassannia, Matthew A. Reyna, Reza Sameni | cs.CL | 2026-08-31 |
| #26 | Beyond Good Intentions: When Does the Framing of Multilingual and Low-Resource NLP Research Become a Caricature? | Nedjma Ousidhoum, Noopur Zambare, Mohamed Abdalla | cs.CL | 2026-08-31 |
| #27 | Reliable Benchmarking of Artifact Detection in Computational Pathology: A Reproducibility and Uncertainty Analysis | Konstantinos Moutselos, Ilias Maglogiannis | cs.CV | 2026-08-31 |
| #28 | OCR-Based Field Extraction for Archaeological Pottery Metadata: The CENTURIA Dataset | Gissu Valentina Naghavi, Dominik Hagmann, Martin Kampel +1 | cs.CV | 2026-08-31 |
| #29 | ScienceArena: Benchmarking LLMs on Latest Scientific Olympiad Competitions | Guangxiang Zhao, Qilong Shi, Xusen Xiao +13 | cs.AI | 2026-08-31 |
| #30 | UTILMEM: Benchmarking Evidence Utilization in Long-Term Conversational Memory | Peijun Qing, Fobo Shi, Soroush Vosoughi | cs.CL | 2026-08-31 |
| #31 | Benchmarking External Generalization of SPD Matrix Learning for Resting-State fMRI Connectome Prediction | Ce Ju, Antoine Collas, Florent Bouchard +1 | eess.SP | 2026-08-31 |
| #32 | Foundation Models Meet Agriculture: Challenges Beyond Pretraining | Vishal Nedungadi, Xingguo Xiong, Marc Rußwurm +1 | cs.LG | 2026-08-31 |
| #33 | PaperBanana-Interact: Scientific Diagram Refinement with Multi-Turn Human Feedback | Xueqing Wu, Ashwin Balasubramanian, Bingxuan Li +7 | cs.CL | 2026-08-31 |
| #34 | GPAgentBench-2K: Benchmarking Large Language Model Agents in Complex Clinical Action Space | Boqi Chen, Xudong Liu, Yunke Ao +2 | cs.CL | 2026-08-31 |
| #35 | The PUR-1 Cyber-Physical Digital Twin | Vasileios Theos, Jonah Lau, Konstantinos Gkouliaras +7 | cs.CE | 2026-08-31 |
| #36 | Benchmarking Peptide-Protein Affinity Prediction Across Peptide and Target Shifts | Jiaxin Tian, Darren An, Jun Li | cs.LG | 2026-08-31 |
| #37 | Partition-Aware Unlearning for Removing Spurious Correlations in Large Vision-Language Models | Aditi Sarker, Nazreen Shah, Rafi Ibn Sultan +3 | cs.CV | 2026-08-30 |
| #38 | ContextBias: Controlled Evaluation of Bias Persistence Under Context Shift in Text-to-Image Models | Shaghayegh Kolli, Sina Emami, Moreno D'Incà +4 | cs.CV | 2026-08-30 |
| #39 | DVBench: Benchmarking MLLMs for Understanding Dynamic Charts and Narratives in Data Videos | Bomiao Wang, Zekai Shao, Jiexiang Lan +3 | cs.CL | 2026-08-30 |
| #40 | MedSegBenchmarker: A Raw-Count-First Framework for Controlled 2D Medical Image Segmentation Benchmarks | Vanessa Borst, Lukas Horn, Daniel Grillmeyer +2 | cs.CV | 2026-08-30 |
| #41 | InteractBench: Benchmarking LLMs on Competitive Programming under Unrevealed Information | Jiaze Li, Aocheng Shen, Bing Liu +4 | cs.SE | 2026-08-30 |
| #42 | PrivBench: A Holistic and Modular Benchmarking Platform for Evaluating Text-to-Text Privatization | Stephen Meisenbacher, Andreea-Elena Bodea, Ahmet Bilal Akın +3 | cs.CL | 2026-08-30 |
| #43 | SnapBench: Benchmarking Snap-and-Ask Multimodal Retrieval for Mobile Interactions | Zirong Chen, Fuda Ye, Kuan Zhang +7 | cs.CV | 2026-08-30 |
| #44 | GUI-CC: Benchmarking Contextual Consistency of GUI World Models as Agent Environments | Lin Fu, Zheyuan Yang, Tianhui Zhang +5 | cs.CL | 2026-08-30 |
| #45 | SIC-Agents: Benchmarking and Building an Adaptive Simulator for Pediatric Serious Illness Communication Training | Zihan Wang, Anita Marie Slominska, Rennie Bimman +10 | cs.CL | 2026-08-30 |
| #46 | AlgoWorlds: Benchmarking Tool Use for Global Optimization in Algorithmic Worlds | Zixiang Xu, Jiaan Wang, Fandong Meng | cs.CL | 2026-08-29 |
| #47 | Neural video codecs quality assessment dataset and benchmark | Nikolay Safonov, Nikita Gornostaev, Alexandra Dubonos +1 | cs.CV | 2026-08-29 |
| #48 | Padārtha: Ontology-Grounded Fine-Grained NER Benchmark for Classical Sanskrit | Sujoy Sarkar, Pretam Ray, Paramhans Shah +4 | cs.CL | 2026-08-29 |
| #49 | MMPCBench: Benchmarking Multimodal Large Language Models on Proactive Critique of Flawed Inputs | Jinzhe Li, Gengxu Li, Jinnan Li +2 | cs.AI | 2026-08-29 |
| #50 | NL2AGBench: Benchmarking LLM Auto-Formalization for AlphaGeometry | Samuel Xiao, Judy Song, Rory Hu +1 | cs.CL | 2026-08-28 |