| 1 | Discriminative World Models for Web Agents | Kelvin Li, Dhruv Pendharkar, Anish Pahilajani +6 | cs.AI | 2026-09-02 |
| 2 | Post-Training Language Models for Gold-Medal Performance in Coding Competitions | Aleksander Ficek, Sean Narenthiran, Mehrzad Samadi +2 | cs.LG | 2026-09-02 |
| 3 | Video-Based Palm-Vein Authentication under Challenging Conditions | Xiaofeng Yan, Kechen Liu, Abhilash Venkatesh +3 | cs.CV | 2026-09-02 |
| #4 | Rethinking the Teacher-Student Framework for Test-Time Adaptation | Damian Sójka, Marc Masana, Bartłomiej Twardowski +1 | cs.LG | 2026-09-02 |
| #5 | DiffIE: Diffusion-based Open Information Extraction | Konstantin Fedorov, Valentin Malykh | cs.CL | 2026-09-02 |
| #6 | APEx: Distillation of Agent Procedural Experience for Adaptive Deep Research Question Answering | Jie Ding, Rui Sun, Xinyuan Zhang +2 | cs.AI | 2026-09-02 |
| #7 | World-Coherent Decoding: Self-Verifying Test-Time Planning for World Action Models | Chuhan Zhang, Seiji Ito, Kenta Hoshino +2 | cs.CV | 2026-09-02 |
| #8 | CHIME: Credit-Aware Hierarchical Memory Evolution for Long-Horizon Agentic Planning | Yongshi Ye, Tian Lan, Feihu Jiang +7 | cs.AI | 2026-09-02 |
| #9 | Test-Time Logit Prompting for Source-Free Missing Modality Adaptation | Taixi Chen, Nancy Guo | cs.CV | 2026-09-02 |
| #10 | DESA-TTA: Dynamic EMA and Source Anchoring for Test-Time Adaptation | Atif Belal, Lilian Hollard, Marco Pedersoli +1 | cs.CV | 2026-09-01 |
| #11 | TempCloze: Can Video-LLMs Identify the Missing Middle? | Wenqi Pei, Henry Hengyuan Zhao, Yilai Liu +4 | cs.CV | 2026-09-01 |
| #12 | GazeRefine: Expert Gaze as a Test-Time Prompt for Training-Free Medical Image Segmentation | Mohammed Oussama Benyahia, Marouane Tliba, Mohamed Amine Kerkouri +10 | eess.IV | 2026-09-01 |
| #13 | FORGE: Forward-Only Test-Time Adaptation for Integer-Only Vision Models on Microcontrollers | Muhammad Rehan, Haider Ali, Muhammad Ali Munir +1 | cs.CV | 2026-09-01 |
| #14 | A Survey on Self-Improving Test-Time Intelligence: Feedback-Driven Adapting, Learning, and Scaling at Inference | Shuaicheng Niu, Guohao Chen, Yaofo Chen +14 | cs.LG | 2026-09-01 |
| #15 | PersianAnonymizer: Evaluating LLM-Labeled Training for Efficient NER-based Anonymization in Persian | Mohammad Hossein Shalchian, Mostafa Amiri, Amir Mahdi Sadeghzadeh | cs.CL | 2026-09-01 |
| #16 | Training-Free Inpainting Across Domains with a Frozen Text-to-Image Diffusion Model | Zhenhuan Wang, Fengyi Yuan | cs.CV | 2026-09-01 |
| #17 | Adapting Without Gradients: Affine Statistics Transport and What Its Certificate Can Tell You | Salim Khazem, Ibrahim Mohamed Serouis | cs.LG | 2026-08-31 |
| #18 | HSRM: Hidden-State Reward Models for Test-Time Verification | Xianzhi Li, Xiaodan Zhu | cs.AI | 2026-08-31 |
| #19 | Safin-1: Safety from Within through Memory-Native State Evolution | Ming Zhang, Kaisen Yang, Shu Yu +15 | cs.LG | 2026-08-31 |
| #20 | When LLM Meets Tree Search: A Systematic View of Inference as Search in Large Language Models | Jiaqi Wei, Xiang Zhang, Yuejin Yang +10 | cs.CL | 2026-08-31 |
| #21 | Augmenting Human Performance with an XR Agent Learning from Online Behavior and BCI Evidence | Ziheng Li, Xichen He, Haoyan Chen +10 | cs.AI | 2026-08-31 |
| #22 | Answer Probing-Guided Search for Diverse Solution Exploration of LLMs | Yi Fang, Que Shen, Chengpeng Li +6 | cs.AI | 2026-08-31 |
| #23 | Rethinking the Test-Time Prompt Tuning Objective from the Perspective of Calibration | Jungwon Choi, Hyeonseo Jang, Kibok Lee +1 | cs.AI | 2026-08-31 |
| #24 | NoisEasier: Test-Time Noise Optimization for Text-to-Video Generation | Yujiang Pu, Yu Kong | cs.CV | 2026-08-31 |
| #25 | Reactivating Test-Time Scaling for Plane Geometry Problem Solving | Xiaoqiang Kang, Shengen Wu, Maizhen Ning +5 | cs.CL | 2026-08-31 |
| #26 | Towards Continual Test-Time Adaptation of Vision-Language Models in Open-Vocabulary Semantic Segmentation | Chandler Timm C. Doloriel, Yunbei Zhang, Sarthak Kumar Maharana +5 | cs.CV | 2026-08-30 |
| #27 | Continual Test-Time Adaptation via Entropy Sensitivity-Guidance in Strict Online Setting | Chandler Timm C. Doloriel, Yunbei Zhang, Muhammad Salman Siddiqui +4 | cs.CV | 2026-08-30 |
| #28 | A Unified Perspective on Conformal Prediction and Wasserstein Distributionally Robust Optimization for Uncertainty Quantification | Kehan Long, Yiqi Zhao, Pol Mestres +3 | math.OC | 2026-08-30 |
| #29 | AGM: Achievement-Grounded Memory for Closed-Loop Agents with Frozen VLA Policies | Hongbo Gao, Zeyu Ni, Xin Wen +2 | cs.RO | 2026-08-30 |
| #30 | FuncRoom-Agent: Sequential Feed-Forward 3D Functional Indoor Scene Generation | Hao Feng, Zhi Zuo, MingJian Liang +6 | cs.CV | 2026-08-30 |
| #31 | GATE: Reliability-Gated Gaussian Evidence Fusion for Training-Free Test-Time Adaptation of Vision-Language Models | Pedram MohajerAnsari, Amir Salarpour, Run Wang +1 | cs.CV | 2026-08-29 |
| #32 | Test-Time Scaling for Video Diffusion Models via Diagnosis-Guided Candidate Recycling | Hangzhou He, Lunhao Duan, Shanshan Zhao +4 | cs.CV | 2026-08-29 |
| #33 | Learning Simple Test-Time Environments for LLM Web Agents | Junxuan Li, Zijun Liu, Ziyi Huang +4 | cs.CL | 2026-08-29 |
| #34 | DARD: Zero-Shot Degradation-Aware Retinex-Guided Diffusion for Low-Light Image Enhancement | Wenjie Cai, Yuezhe Yang, Jianyang Xia +2 | cs.CV | 2026-08-29 |
| #35 | Locked at the Entrance, Open Inside: Where RLVR Narrows the Solution Space | Qiancheng Zhou, Ruizhe Li | cs.LG | 2026-08-29 |
| #36 | Subtraction-Based Tumor Segmentation and Lesion-Centered pCR Prediction for the MAMA-MIA Challenge | Kai Geissler, Raphael Schäfer | cs.CV | 2026-08-29 |
| #37 | Training-Free Hidden-State Refinement for Flow-Matching Image Generators | Yuanyi Yan, Xinzhe Rao, Canyu Shen +5 | cs.CV | 2026-08-29 |
| #38 | Ladders in Chaos: When, How, (and Perhaps Why) Does Test-Time Scaling Improve LLM Machine Translation | Di Wu, Sergey Troshin, Christof Monz +2 | cs.CL | 2026-08-28 |
| #39 | Beyond the Answer Key: Robustness Evaluation of Large Language Models for Step-Level Mathematical Verification | Fateme Mazdarani, Carlos Toxtli | cs.AI | 2026-08-28 |
| #40 | RECAST: Recent & Context-Aware Sampling for Test-Time Adaptation in Streaming Biosignals | Yong-Yeon Jo, Junho Song, Joon-myoung Kwon | cs.AI | 2026-08-28 |
| #41 | SEPO: Evidence-Grounded Prompt Optimization via Structural Editing | Xiaoyu Ma, Haoyue Liu, Yiwen Li +4 | cs.AI | 2026-08-28 |
| #42 | AERA: Adaptive Evidence Residual Allocation for Efficient Test-Time Reasoning | Ziming Wang, Ivor Tsang, Hangwei Qian | cs.AI | 2026-08-28 |
| #43 | Temporal Memory-Aware Online Test-Time Adaptation on Dynamic Graphs | Bo Li, Xin Zheng, Ming Jin +2 | cs.LG | 2026-08-28 |
| #44 | CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes | Yufan Wu, Yinghui He, Zhengyi Hu +4 | cs.CL | 2026-08-27 |
| #45 | TTPO: Test-Time Policy Optimization | Aozhe Wang, Zhengxi Lu, Jianze Wang +8 | cs.CL | 2026-08-27 |
| #46 | Hyperspectral Diffusion Equivariant Imaging (HyDiff-EI): A Self-supervised Framework for Hyperspectral Image Inpainting | Shuo Li, Mike Davies, Mehrdad Yaghoobi | cs.CV | 2026-08-27 |
| #47 | Generative Semantic Scene Completion | Shi Chen, Weifeng Ge | cs.CV | 2026-08-27 |
| #48 | Dynamical phase selection controls compute scaling in looped transformers | Gunn Kim | cond-mat.dis-nn | 2026-08-27 |
| #49 | Prefix Sliding for efficient test-time scaling | Niklas Muennighoff, Zhengyang Wang, Zeyi Chen +15 | cs.CL | 2026-08-26 |
| #50 | $R^3$: Training Robots to Reason in Natural Language via Reinforcement Learning | Lehong Wu, Yuxiao Qu, Zheyuan Hu +4 | cs.RO | 2026-08-26 |