| 1 | Post-Training Language Models for Gold-Medal Performance in Coding Competitions | Aleksander Ficek, Sean Narenthiran, Mehrzad Samadi +2 | cs.LG | 2026-09-02 |
| 2 | Cliff: Learning Process Rewards from the First Mistake | Peixuan Han, Runhui Wang, Ketan Ramaneti +3 | cs.LG | 2026-09-02 |
| 3 | GDB-Reward: From Evaluation Metrics to Training Rewards for Graphic Design | Adrienne Deganutti, Purvanshi Mehta, Simon Hadfield +1 | cs.CV | 2026-09-02 |
| #4 | Eliciting ESG Preferences for Reinforcement Learning-Based Portfolio Optimization | Giovanni Dispoto, Marcello Restelli, Carmine Ventre | q-fin.PM | 2026-09-02 |
| #5 | Online Reinforcement Learning in the Met Office Unified Model through Distributed Model-Agent Coupling | Pritthijit Nath, Sebastian Schemm, Peter Haynes +2 | cs.LG | 2026-09-02 |
| #6 | Learn from Whoever Is Right: Answer-Verified Multi-Teacher Distillation for Multi-Domain LLMs | Xixiang He, Xingming Li, Baiqi Wu +4 | cs.LG | 2026-09-02 |
| #7 | A Comparative Study of Graph Representations for GNN-Based Power Grid Control in L2RPN | Adrian Degenkolb, Qiong Huang, Benjamin Schäfer | cs.LG | 2026-09-02 |
| #8 | NE-R1: Enhancing Named Entity Recognition Model via Reinforcement Learning | Meixuan Chen, Hehan Li, Ruizhi Zhao +8 | cs.CL | 2026-09-02 |
| #9 | TempoGround: State-Aware Streaming Visual Grounding with Vision-Language Models | Leqian Ding, Junning Qiu, Manwen Yang +2 | cs.CV | 2026-09-02 |
| #10 | APEx: Distillation of Agent Procedural Experience for Adaptive Deep Research Question Answering | Jie Ding, Rui Sun, Xinyuan Zhang +2 | cs.AI | 2026-09-02 |
| #11 | RideSkill: A Hierarchical Algorithm for Generalized Ride Sharing with LLM-Driven Automatic Evolution | Zijian Zhao, Sen Li, Xialiang Tong +1 | cs.MA | 2026-09-02 |
| #12 | Recursive Value Learning for Long-Horizon Offline Goal-Conditioned RL | Hyeonseong Jeon, Youngwoon Lee | cs.LG | 2026-09-02 |
| #13 | PGPO: Potential-Guided Policy Optimization for Multi-Turn Agentic Tasks | Yuyao Zheng, Haipeng Sun, Junwei Bao +4 | cs.AI | 2026-09-02 |
| #14 | PhoenixNest-Video: Evidence-Grounded Multimodal Agent Framework for Automated Video Interview Assessment | Fan Yuxuan, Huang Miaojun, Zhang Haimei +2 | cs.AI | 2026-09-02 |
| #15 | DMRL: Document-Mediated Reinforcement Learning for Skill Optimization in Advertising Recommendation | Wei Zhang, Hongji Li, Song Sun +4 | cs.LG | 2026-09-02 |
| #16 | IDEEA: training-free Input-Dependent stEEring via Activation cluster matching | Zheng Wang, Muchen Li, Renjie Liao +1 | cs.CL | 2026-09-02 |
| #17 | Act More, Decide Less: Skill-Guided Adaptive Action Chunking for Long-Horizon LLM Agents | Yanting Yang, Can Jin, Jinman Zhao +6 | cs.LG | 2026-09-02 |
| #18 | On-Policy Distillation Meets Off-Policy GRPO: Training Compact Instruction-Following Rerankers | Vignesh Prabhakar, Jialing Pan, Anil Babu Ankisettipalli | cs.LG | 2026-09-01 |
| #19 | OR-Transformer: Scaling Real-Time Decision-Making to 1,000 Items | Shuze Daniel Liu, David Simchi-Levi, Claire Chen +2 | cs.LG | 2026-09-01 |
| #20 | Thinking effort aligns between humans and reasoning models in abductive reasoning | Henry Arthur | cs.CL | 2026-09-01 |
| #21 | Import What You Need: Learning When and How to Augment EHR Graphs with External Knowledge | Chen Chen, Mohsen Nayebi Kerdabadi, Dongjie Wang +2 | cs.LG | 2026-09-01 |
| #22 | Reinforcement learning to choose optimizers | Martin van der Schelling, Deepesh Toshniwal, Miguel A. Bessa | cs.NE | 2026-09-01 |
| #23 | The Rise of Verbal Reinforcement Learning | Kshitij Tayal, Arun Sharma, Genta Indra Winata +2 | cs.CL | 2026-09-01 |
| #24 | Facet-0: A Robotic Foundation Model for Contact-Rich Precise Manipulation | Haoyuan Deng, Haichao Liu, Wenkai Guo +6 | cs.RO | 2026-09-01 |
| #25 | StudentSim: Training LLM-based Student Simulators | Ke Yang, Chenglong Wang, Michel Galley +4 | cs.CL | 2026-09-01 |
| #26 | Scaling Near-Optimal SFT-RL Annotation Budget Allocation from Small to Large LLMs | Jingtan Wang, Arun Verma, Xiaoqiang Lin +4 | cs.CL | 2026-09-01 |
| #27 | Selective Agent Guidance via Entropy: Learning Autonomous Policies from Imperfect VLM Teachers | Giovanni Bonetta, Matteo Merler, Davide Zago +2 | cs.AI | 2026-09-01 |
| #28 | NashDreamer: Model-Based Reinforcement Learning for Zero-Sum Imperfect-Information Games | Tomáš Holeček, Viliam Lisý | cs.LG | 2026-09-01 |
| #29 | Provably Safe Sim-to-Real Transfer | Tingting Ni, Maryam Kamgarpour | cs.LG | 2026-09-01 |
| #30 | EdiTikZ: Scientific Figure Editing from Revision Trajectories | Christian Greisinger, Zhixue Zhao, Steffen Eger | cs.AI | 2026-09-01 |
| #31 | Where the Verifier Fails: A Category-Level Audit of Reward Signals in RLVR | Esther Xin | cs.CL | 2026-09-01 |
| #32 | VerTox: Verifiable Reward-Guided Corpus Poisoning Against Neural Ranking Models | Zhiqi Huang, Vivek Datla, Zhichao Xu +3 | cs.CL | 2026-09-01 |
| #33 | From Base Rollouts to RL Reasoning: A Budgeted Search Perspective | Wenhe Sun, Cunxiang Wang, Zijun Yao +1 | cs.CL | 2026-09-01 |
| #34 | Explore More, Drift Less: Outcome-Only Reinforcement Learning Can Suffice for Long-Horizon Interactive Agents | Liming Pu, Xiaoxia Li, Yifu Liu +2 | cs.LG | 2026-09-01 |
| #35 | CaRL-EM: Cost-Aware Reinforcement Learning for Entity Matching with LLMs | Chaohui Guo, Michel Klein, Zhisheng Huang | cs.CL | 2026-09-01 |
| #36 | PersuaRL: Reinforcement Learning-Driven Multi-Expert Selection for Persuasive Dialogue Generation in Insurance | Rohan Kirti, Akash Ghosh, Aryan Vats +5 | cs.CL | 2026-09-01 |
| #37 | Reinforcement Learning and Rule-Based Peer-to-Peer Pricing in Residential PV-BES Communities | Pablo Benalcazar, Maciej Kalka, Wilian Guamán +1 | cs.LG | 2026-09-01 |
| #38 | Accelerating Reinforcement Learning via MPC Solver-Gradient Guidance for Weights-varying MPC | Baha Zarrouki, Arslan Thobani, Jasper Hoffmann +6 | cs.RO | 2026-09-01 |
| #39 | ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning | Fanrui Zhang, Ruixue Ding, Qiang Zhang +13 | cs.AI | 2026-09-01 |
| #40 | VerNav: Verifier-First Low-Latency Vision-and-Language Navigation | Zhixin Wang, Chengzheyi Yao, Leyuan Liu +2 | cs.RO | 2026-09-01 |
| #41 | CARE: Contrastive Anchor-based Rubric Evolution for Large Language Model Post-Training | Siyuan Li, Xinxin Song, Chen Ruinian +5 | cs.AI | 2026-09-01 |
| #42 | Sim2Signal: Sim-to-Real Benchmarks for Traffic Signal Control | Ferdous Al Rafi, Susrik Mukherjee, Latika Liladhar Dekate +6 | cs.LG | 2026-09-01 |
| #43 | Reinforcement Learning Enhanced LLM Agents for Complex Vehicle Routing Problems | Yi Chen, Zikang Yu, Jiahai Wang +3 | cs.AI | 2026-09-01 |
| #44 | Dense Process Supervision for Search Agents via Fact Utility Estimation | Rongzhi Zhu, Xiangyu Liu, Yi Liu +7 | cs.CL | 2026-09-01 |
| #45 | One Policy, Any Budget: Internalizing Budget-Aware Search via Reinforcement Learning | Xiaowei Sun, Jin Li, Yili Hong +2 | cs.AI | 2026-09-01 |
| #46 | SFAD: Speculative Factuality-Aware Decoding | Guanqiao Chen, Di Wang, Lijie Hu | cs.CL | 2026-09-01 |
| #47 | Instella-MoE Technical Report | Jiang Liu, Sudhanshu Ranjan, Prakamya Mishra +10 | cs.CL | 2026-09-01 |
| #48 | Joint Training Is Not Enough: Conditioned Cross-Granularity Training for Multimodal Document Understanding | Chengguang Gan, Yunhao Liang, Hanjun Wei +2 | cs.CL | 2026-09-01 |
| #49 | Online Self-Weighted Fine-Tuning | Haiquan Wen, Yiwei He, Bei Peng +1 | cs.LG | 2026-09-01 |
| #50 | It Takes Two to Match: Co-Evolving Generative Retriever with Reinforcement Learning | Runpeng Dai, Kaili Huang, Changsung Kang +1 | cs.IR | 2026-09-01 |