| 1 | Discriminative World Models for Web Agents | Kelvin Li, Dhruv Pendharkar, Anish Pahilajani +6 | cs.AI | 2026-09-02 |
| 2 | Cliff: Learning Process Rewards from the First Mistake | Peixuan Han, Runhui Wang, Ketan Ramaneti +3 | cs.LG | 2026-09-02 |
| 3 | GDB-Reward: From Evaluation Metrics to Training Rewards for Graphic Design | Adrienne Deganutti, Purvanshi Mehta, Simon Hadfield +1 | cs.CV | 2026-09-02 |
| #4 | SafeEvolve: Harness-Policy Co-Evolution from Agent Experience for Safety Alignment | Qinghua Mao, Wanying Qu, Dadi Guo +8 | cs.AI | 2026-09-02 |
| #5 | Coverage, Not Targeting: A Structural Regime in Multi-Turn Agent Credit Assignment | Chenyu Zhou, Qiliang Jiang, Shuning Wu +1 | cs.LG | 2026-09-02 |
| #6 | NE-R1: Enhancing Named Entity Recognition Model via Reinforcement Learning | Meixuan Chen, Hehan Li, Ruizhi Zhao +8 | cs.CL | 2026-09-02 |
| #7 | TempoGround: State-Aware Streaming Visual Grounding with Vision-Language Models | Leqian Ding, Junning Qiu, Manwen Yang +2 | cs.CV | 2026-09-02 |
| #8 | Codebook Agent: Amortized Topology Design for LLM Multi-Agent Systems | Jinxi Yu, Yubei Li, Eric Hanchen Jiang +6 | cs.AI | 2026-09-02 |
| #9 | APEx: Distillation of Agent Procedural Experience for Adaptive Deep Research Question Answering | Jie Ding, Rui Sun, Xinyuan Zhang +2 | cs.AI | 2026-09-02 |
| #10 | DiffuSearch: How Hybrid Trajectory Planning Benefits from Aligned Objectives in Diffusion and Action Space | Steffen Hagedorn, Aron Distelzweig, Alexandru P. Condurache | cs.RO | 2026-09-02 |
| #11 | LLM-as-a-Judge Is Not an Oracle: Why Self-Improving Agents Need Deterministic Guardrails | Vansh Wahi | cs.AI | 2026-09-02 |
| #12 | PGPO: Potential-Guided Policy Optimization for Multi-Turn Agentic Tasks | Yuyao Zheng, Haipeng Sun, Junwei Bao +4 | cs.AI | 2026-09-02 |
| #13 | PhoenixNest-Video: Evidence-Grounded Multimodal Agent Framework for Automated Video Interview Assessment | Fan Yuxuan, Huang Miaojun, Zhang Haimei +2 | cs.AI | 2026-09-02 |
| #14 | DMRL: Document-Mediated Reinforcement Learning for Skill Optimization in Advertising Recommendation | Wei Zhang, Hongji Li, Song Sun +4 | cs.LG | 2026-09-02 |
| #15 | Posterior Tempering Explains Variance Inflation in Linear and Generalized Linear Thompson Sampling | Prateek Jaiswal, Debdeep Pati, Anirban Bhattacharya +1 | stat.ML | 2026-09-02 |
| #16 | On-Policy Distillation Meets Off-Policy GRPO: Training Compact Instruction-Following Rerankers | Vignesh Prabhakar, Jialing Pan, Anil Babu Ankisettipalli | cs.LG | 2026-09-01 |
| #17 | Does Playing it Safe Count as Faithfulness? Reassessing LVLM Hallucination Mitigation Methods | Mehrdad Fazli, Sina Mansouri, Mohit Marvania +1 | cs.CV | 2026-09-01 |
| #18 | Thinking effort aligns between humans and reasoning models in abductive reasoning | Henry Arthur | cs.CL | 2026-09-01 |
| #19 | The Rise of Verbal Reinforcement Learning | Kshitij Tayal, Arun Sharma, Genta Indra Winata +2 | cs.CL | 2026-09-01 |
| #20 | Facet-0: A Robotic Foundation Model for Contact-Rich Precise Manipulation | Haoyuan Deng, Haichao Liu, Wenkai Guo +6 | cs.RO | 2026-09-01 |
| #21 | Mechanism Design for Alignment and Control | Dirk Bergemann, Andrew Koh, Stephen Morris | econ.TH | 2026-09-01 |
| #22 | StudentSim: Training LLM-based Student Simulators | Ke Yang, Chenglong Wang, Michel Galley +4 | cs.CL | 2026-09-01 |
| #23 | Scaling Near-Optimal SFT-RL Annotation Budget Allocation from Small to Large LLMs | Jingtan Wang, Arun Verma, Xiaoqiang Lin +4 | cs.CL | 2026-09-01 |
| #24 | From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix | Olga Tsymboi, Dmitrii Stoianov, Ramil Latypov +11 | cs.CL | 2026-09-01 |
| #25 | Selective Agent Guidance via Entropy: Learning Autonomous Policies from Imperfect VLM Teachers | Giovanni Bonetta, Matteo Merler, Davide Zago +2 | cs.AI | 2026-09-01 |
| #26 | Provably Safe Sim-to-Real Transfer | Tingting Ni, Maryam Kamgarpour | cs.LG | 2026-09-01 |
| #27 | EdiTikZ: Scientific Figure Editing from Revision Trajectories | Christian Greisinger, Zhixue Zhao, Steffen Eger | cs.AI | 2026-09-01 |
| #28 | Where the Verifier Fails: A Category-Level Audit of Reward Signals in RLVR | Esther Xin | cs.CL | 2026-09-01 |
| #29 | Scalable Rao-Blackwellized Online Planning for High-Dimensional POMDPs | Jiho Lee, Nisar Ahmed, Kyle Hollins Wray +1 | cs.RO | 2026-09-01 |
| #30 | Probing Factual Knowledge Transfer with Training Data Interventions | Romina Oji, Marc Braun, Marcel Bollmann +2 | cs.CL | 2026-09-01 |
| #31 | VerTox: Verifiable Reward-Guided Corpus Poisoning Against Neural Ranking Models | Zhiqi Huang, Vivek Datla, Zhichao Xu +3 | cs.CL | 2026-09-01 |
| #32 | From Base Rollouts to RL Reasoning: A Budgeted Search Perspective | Wenhe Sun, Cunxiang Wang, Zijun Yao +1 | cs.CL | 2026-09-01 |
| #33 | Ready to Speak: Aligning LLMs for TTS-Friendly Text Generation | Thibaut Thonet, Jos Rozen, Laurent Besacier | cs.CL | 2026-09-01 |
| #34 | Explore More, Drift Less: Outcome-Only Reinforcement Learning Can Suffice for Long-Horizon Interactive Agents | Liming Pu, Xiaoxia Li, Yifu Liu +2 | cs.LG | 2026-09-01 |
| #35 | Jailbreaking Text-to-Image Models Through Cracks: Navigating Heterogeneous Safety Filters via Multi-Agent Debate | Kaiyan Wen, Shijie Zhang, Lu Yu +1 | cs.AI | 2026-09-01 |
| #36 | ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning | Fanrui Zhang, Ruixue Ding, Qiang Zhang +13 | cs.AI | 2026-09-01 |
| #37 | CoBRA: Learning Tool-Use Boundaries via Counterfactual Margins | Wenhao Zou, Xianglong Liu, Wendong Bi +3 | cs.AI | 2026-09-01 |
| #38 | DualStake: Dual-Path Confidence Calibration in Deep Research Agents | Yinuo Xu, Yuwei Liang, Jianjie Cheng +4 | cs.CL | 2026-09-01 |
| #39 | Context-Grounding Gains Are Mediated by Pre-existing Machinery: Auditing GRPO, SFT, and DPO | Prakhar Gupta, Vaibhav Gupta | cs.CL | 2026-09-01 |
| #40 | VerNav: Verifier-First Low-Latency Vision-and-Language Navigation | Zhixin Wang, Chengzheyi Yao, Leyuan Liu +2 | cs.RO | 2026-09-01 |
| #41 | CARE: Contrastive Anchor-based Rubric Evolution for Large Language Model Post-Training | Siyuan Li, Xinxin Song, Chen Ruinian +5 | cs.AI | 2026-09-01 |
| #42 | Sim2Signal: Sim-to-Real Benchmarks for Traffic Signal Control | Ferdous Al Rafi, Susrik Mukherjee, Latika Liladhar Dekate +6 | cs.LG | 2026-09-01 |
| #43 | MemoryWalker: Stop Training Agents on Contexts They Never Saw | Zinco J, Xunjie Zhu, Shen Huang +3 | cs.LG | 2026-09-01 |
| #44 | Dense Process Supervision for Search Agents via Fact Utility Estimation | Rongzhi Zhu, Xiangyu Liu, Yi Liu +7 | cs.CL | 2026-09-01 |
| #45 | One Policy, Any Budget: Internalizing Budget-Aware Search via Reinforcement Learning | Xiaowei Sun, Jin Li, Yili Hong +2 | cs.AI | 2026-09-01 |
| #46 | Ranked by the Matcher: A Reproducibility Audit of Knowledge Graph Extraction from Threat Reports | Safayat Bin Hakim, Houbing Herbert Song | cs.CR | 2026-09-01 |
| #47 | Controllable Image Captioning with Prompt-Conditioned Scene Rewards | Jongyeop Hyun, Taeyoung Kim, Hyounghun Kim | cs.CV | 2026-09-01 |
| #48 | Patterning in Practice: Debiasing Reward Models with Susceptibilities | George Wang, Elizabeth Donoway, Daniel Murfet | cs.LG | 2026-09-01 |
| #49 | Drift-Aware LLM Routing with Sparse Contexts and Shared Budgets | Cheung Hao Lee, Patrick Wong | cs.AI | 2026-09-01 |
| #50 | It Takes Two to Match: Co-Evolving Generative Retriever with Reinforcement Learning | Runpeng Dai, Kaili Huang, Changsung Kang +1 | cs.IR | 2026-09-01 |