PaperScope
LIVE · 2026-09-03 05:40 UTC

benchmarking 32 papers this week · -21% WoW

papers mentioning "benchmarking" in title/abstract · 30d window

Latestcs.CLcs.LGcs.AIcs.CV

Mentions per Day (30d)

Latest Papers

#TitleAuthorsCatDate
1Benchmarking RAW and RGB Restoration in Image Signal ProcessorsZihao Lu, Radu Timofte, Marcos V. Condecs.CV2026-09-02
2GDB-Reward: From Evaluation Metrics to Training Rewards for Graphic DesignAdrienne Deganutti, Purvanshi Mehta, Simon Hadfield +1cs.CV2026-09-02
3Blending Concepts: Benchmarking Visual Metaphor Generation in Text-to-Image ModelsChuer Chen, Zichen Wang, Yi He +2cs.CV2026-09-02
#4T2LSC-Bench: Benchmarking Localized Semantic Control in Text-to-Image GenerationYan Wang, Xinyi Hou, Weiguo Lin +2cs.CV2026-09-02
#5MeanField Surrogate Modeling for Scalable Runtime Scheduling of Concurrent Heterogeneous AI Inference on Shared GPUsYoussef Ennouri, Soonhoi Hacs.DC2026-09-02
#6DocHop: Benchmarking Out-of-domain Multi-hop Reasoning in Information-Dense DocumentsZhuoran Yu, Le Thien Phuc Nguyen, Jaden Park +5cs.AI2026-09-02
#7Benchmarking Language Models for Statistical Problem FormulationChen Wang, Junzhe Zhao, Xin Cong +2cs.AI2026-09-02
#8MemeCULT-1K: Benchmarking South Asian Cultural Context and Humor Understanding of Multimodal ModelsTawsif Tashwar Dipto, Mehedi Ahamed, Radib Bin Kabir +5cs.CL2026-09-01
#9Efficient SWE Agent Benchmarking via Trajectory-Aware EvaluationKefeng Duan, Dewu Zheng, Yanlin Wang +7cs.SE2026-09-01
#10Benchmarking Spatial, Spectral, and Self-Supervised Cues for Face Forgery Detection under Realistic DegradationLucas Cunha, Lucas Sotomaior, Lucas Gasperin +3cs.CV2026-09-01
#11FairLens: Benchmarking Fairness in Vision-Language Models for High-Stakes Decision-MakingVahid Reza Khazaie, Ahmed Y. Radwan, Shaina Razacs.CV2026-09-01
#12Reliability Challenges in Diffusion Vision-Language ModelsMd. Atabuzzaman, Chris Thomascs.CV2026-09-01
#13EDRAC: Benchmarking Arabic Dialect Reading ComprehensionNoor Abo Mokh, Kirill Chirkunov, Teresa Lynn +15cs.CL2026-09-01
#14Benchmarking Vision-Language Models for Automated Pathology Diagnosis and Report GenerationYumi Lee, Harim Oh, Hyoryung Kim +52cs.CV2026-09-01
#15StudyBench: Can Self-Evolution Squeeze Textbooks for Olympiad Capability?Yinghao Chen, Zixi Chen, Bingxiang He +7cs.AI2026-09-01
#16Aligned but Flattened: Analyzing the Trade-off between Cultural Alignment and Diversity in LLMsJingshen Zhang, Shaoyang Xu, Wenxuan Zhangcs.SI2026-09-01
#17MemeBridge: A Dataset for Benchmarking and Mitigating the Bidirectional Cultural Gap in Meme InterpretationHangxiao Zhu, Suliu Qin, Zhuoyan Li +3cs.CL2026-08-31
#18Toward Workflow-Aware Benchmarking for Healthcare NLP AgentsJunyi Yao, Baichuan Li, Zihao Zheng +1cs.CL2026-08-31
#19CoLT-Drive: Counterfactual Long-Tail Benchmarking and Knowledge-Preserving Adaptation for Driving Affordance PredictionZhengxu Tang, Guofeng Cui, Ziyu Gong +8cs.CV2026-08-31
#20Beyond Blind Compliance: Benchmarking Task Verification in OCR ReasoningYue Zhou, Yuan Wu, Yi Changcs.CV2026-08-31
#21Distributed Implicit Harm: A Compositional Safety Blind Spot in MLLM-Based Video ModerationRuotong Wang, Zihao Zhu, Siwei Lyu +2cs.CV2026-08-31
#22Stress-Testing Efficient Responsible-AI Evaluation: When Compute Savings Change Benchmark ConclusionsAhmed El Kady, Aravind Narayanan, Rehana Noorani +2cs.LG2026-08-31
#23Towards Stream Learning on Embedded Systems: Benchmarking the Memory Consumption of Stream Learning MethodsSebastian Buschjäger, Nuwan Gunasekara, Heitor Murilo Gomescs.LG2026-08-31
#24MMDS-Bench: Benchmarking Multimodal Large Language Models on Dynamic Stance in Social Media InteractionsYuzhe Ding, Kang He, Li Zheng +5cs.CL2026-08-31
#25ECGQuest: Benchmarking and Fine-Tuning Language Models for ElectrocardiographyMohammadsina Hassannia, Matthew A. Reyna, Reza Samenics.CL2026-08-31
#26Beyond Good Intentions: When Does the Framing of Multilingual and Low-Resource NLP Research Become a Caricature?Nedjma Ousidhoum, Noopur Zambare, Mohamed Abdallacs.CL2026-08-31
#27Reliable Benchmarking of Artifact Detection in Computational Pathology: A Reproducibility and Uncertainty AnalysisKonstantinos Moutselos, Ilias Maglogianniscs.CV2026-08-31
#28OCR-Based Field Extraction for Archaeological Pottery Metadata: The CENTURIA DatasetGissu Valentina Naghavi, Dominik Hagmann, Martin Kampel +1cs.CV2026-08-31
#29ScienceArena: Benchmarking LLMs on Latest Scientific Olympiad CompetitionsGuangxiang Zhao, Qilong Shi, Xusen Xiao +13cs.AI2026-08-31
#30UTILMEM: Benchmarking Evidence Utilization in Long-Term Conversational MemoryPeijun Qing, Fobo Shi, Soroush Vosoughics.CL2026-08-31
#31Benchmarking External Generalization of SPD Matrix Learning for Resting-State fMRI Connectome PredictionCe Ju, Antoine Collas, Florent Bouchard +1eess.SP2026-08-31
#32Foundation Models Meet Agriculture: Challenges Beyond PretrainingVishal Nedungadi, Xingguo Xiong, Marc Rußwurm +1cs.LG2026-08-31
#33PaperBanana-Interact: Scientific Diagram Refinement with Multi-Turn Human FeedbackXueqing Wu, Ashwin Balasubramanian, Bingxuan Li +7cs.CL2026-08-31
#34GPAgentBench-2K: Benchmarking Large Language Model Agents in Complex Clinical Action SpaceBoqi Chen, Xudong Liu, Yunke Ao +2cs.CL2026-08-31
#35The PUR-1 Cyber-Physical Digital TwinVasileios Theos, Jonah Lau, Konstantinos Gkouliaras +7cs.CE2026-08-31
#36Benchmarking Peptide-Protein Affinity Prediction Across Peptide and Target ShiftsJiaxin Tian, Darren An, Jun Lics.LG2026-08-31
#37Partition-Aware Unlearning for Removing Spurious Correlations in Large Vision-Language ModelsAditi Sarker, Nazreen Shah, Rafi Ibn Sultan +3cs.CV2026-08-30
#38ContextBias: Controlled Evaluation of Bias Persistence Under Context Shift in Text-to-Image ModelsShaghayegh Kolli, Sina Emami, Moreno D'Incà +4cs.CV2026-08-30
#39DVBench: Benchmarking MLLMs for Understanding Dynamic Charts and Narratives in Data VideosBomiao Wang, Zekai Shao, Jiexiang Lan +3cs.CL2026-08-30
#40MedSegBenchmarker: A Raw-Count-First Framework for Controlled 2D Medical Image Segmentation BenchmarksVanessa Borst, Lukas Horn, Daniel Grillmeyer +2cs.CV2026-08-30
#41InteractBench: Benchmarking LLMs on Competitive Programming under Unrevealed InformationJiaze Li, Aocheng Shen, Bing Liu +4cs.SE2026-08-30
#42PrivBench: A Holistic and Modular Benchmarking Platform for Evaluating Text-to-Text PrivatizationStephen Meisenbacher, Andreea-Elena Bodea, Ahmet Bilal Akın +3cs.CL2026-08-30
#43SnapBench: Benchmarking Snap-and-Ask Multimodal Retrieval for Mobile InteractionsZirong Chen, Fuda Ye, Kuan Zhang +7cs.CV2026-08-30
#44GUI-CC: Benchmarking Contextual Consistency of GUI World Models as Agent EnvironmentsLin Fu, Zheyuan Yang, Tianhui Zhang +5cs.CL2026-08-30
#45SIC-Agents: Benchmarking and Building an Adaptive Simulator for Pediatric Serious Illness Communication TrainingZihan Wang, Anita Marie Slominska, Rennie Bimman +10cs.CL2026-08-30
#46AlgoWorlds: Benchmarking Tool Use for Global Optimization in Algorithmic WorldsZixiang Xu, Jiaan Wang, Fandong Mengcs.CL2026-08-29
#47Neural video codecs quality assessment dataset and benchmarkNikolay Safonov, Nikita Gornostaev, Alexandra Dubonos +1cs.CV2026-08-29
#48Padārtha: Ontology-Grounded Fine-Grained NER Benchmark for Classical SanskritSujoy Sarkar, Pretam Ray, Paramhans Shah +4cs.CL2026-08-29
#49MMPCBench: Benchmarking Multimodal Large Language Models on Proactive Critique of Flawed InputsJinzhe Li, Gengxu Li, Jinnan Li +2cs.AI2026-08-29
#50NL2AGBench: Benchmarking LLM Auto-Formalization for AlphaGeometrySamuel Xiao, Judy Song, Rory Hu +1cs.CL2026-08-28

all trends · matching is case-insensitive substring after tokenization