PaperScope
LIVE · 2026-09-03 05:40 UTC

reinforcement 39 papers this week · -26% WoW

papers mentioning "reinforcement" in title/abstract · 30d window

Latestcs.CLcs.LGcs.AIcs.CV

Mentions per Day (30d)

Latest Papers

#TitleAuthorsCatDate
1Post-Training Language Models for Gold-Medal Performance in Coding CompetitionsAleksander Ficek, Sean Narenthiran, Mehrzad Samadi +2cs.LG2026-09-02
2Cliff: Learning Process Rewards from the First MistakePeixuan Han, Runhui Wang, Ketan Ramaneti +3cs.LG2026-09-02
3GDB-Reward: From Evaluation Metrics to Training Rewards for Graphic DesignAdrienne Deganutti, Purvanshi Mehta, Simon Hadfield +1cs.CV2026-09-02
#4Eliciting ESG Preferences for Reinforcement Learning-Based Portfolio OptimizationGiovanni Dispoto, Marcello Restelli, Carmine Ventreq-fin.PM2026-09-02
#5Online Reinforcement Learning in the Met Office Unified Model through Distributed Model-Agent CouplingPritthijit Nath, Sebastian Schemm, Peter Haynes +2cs.LG2026-09-02
#6Learn from Whoever Is Right: Answer-Verified Multi-Teacher Distillation for Multi-Domain LLMsXixiang He, Xingming Li, Baiqi Wu +4cs.LG2026-09-02
#7A Comparative Study of Graph Representations for GNN-Based Power Grid Control in L2RPNAdrian Degenkolb, Qiong Huang, Benjamin Schäfercs.LG2026-09-02
#8NE-R1: Enhancing Named Entity Recognition Model via Reinforcement LearningMeixuan Chen, Hehan Li, Ruizhi Zhao +8cs.CL2026-09-02
#9TempoGround: State-Aware Streaming Visual Grounding with Vision-Language ModelsLeqian Ding, Junning Qiu, Manwen Yang +2cs.CV2026-09-02
#10APEx: Distillation of Agent Procedural Experience for Adaptive Deep Research Question AnsweringJie Ding, Rui Sun, Xinyuan Zhang +2cs.AI2026-09-02
#11RideSkill: A Hierarchical Algorithm for Generalized Ride Sharing with LLM-Driven Automatic EvolutionZijian Zhao, Sen Li, Xialiang Tong +1cs.MA2026-09-02
#12Recursive Value Learning for Long-Horizon Offline Goal-Conditioned RLHyeonseong Jeon, Youngwoon Leecs.LG2026-09-02
#13PGPO: Potential-Guided Policy Optimization for Multi-Turn Agentic TasksYuyao Zheng, Haipeng Sun, Junwei Bao +4cs.AI2026-09-02
#14PhoenixNest-Video: Evidence-Grounded Multimodal Agent Framework for Automated Video Interview AssessmentFan Yuxuan, Huang Miaojun, Zhang Haimei +2cs.AI2026-09-02
#15DMRL: Document-Mediated Reinforcement Learning for Skill Optimization in Advertising RecommendationWei Zhang, Hongji Li, Song Sun +4cs.LG2026-09-02
#16IDEEA: training-free Input-Dependent stEEring via Activation cluster matchingZheng Wang, Muchen Li, Renjie Liao +1cs.CL2026-09-02
#17Act More, Decide Less: Skill-Guided Adaptive Action Chunking for Long-Horizon LLM AgentsYanting Yang, Can Jin, Jinman Zhao +6cs.LG2026-09-02
#18On-Policy Distillation Meets Off-Policy GRPO: Training Compact Instruction-Following RerankersVignesh Prabhakar, Jialing Pan, Anil Babu Ankisettipallics.LG2026-09-01
#19OR-Transformer: Scaling Real-Time Decision-Making to 1,000 ItemsShuze Daniel Liu, David Simchi-Levi, Claire Chen +2cs.LG2026-09-01
#20Thinking effort aligns between humans and reasoning models in abductive reasoningHenry Arthurcs.CL2026-09-01
#21Import What You Need: Learning When and How to Augment EHR Graphs with External KnowledgeChen Chen, Mohsen Nayebi Kerdabadi, Dongjie Wang +2cs.LG2026-09-01
#22Reinforcement learning to choose optimizersMartin van der Schelling, Deepesh Toshniwal, Miguel A. Bessacs.NE2026-09-01
#23The Rise of Verbal Reinforcement LearningKshitij Tayal, Arun Sharma, Genta Indra Winata +2cs.CL2026-09-01
#24Facet-0: A Robotic Foundation Model for Contact-Rich Precise ManipulationHaoyuan Deng, Haichao Liu, Wenkai Guo +6cs.RO2026-09-01
#25StudentSim: Training LLM-based Student SimulatorsKe Yang, Chenglong Wang, Michel Galley +4cs.CL2026-09-01
#26Scaling Near-Optimal SFT-RL Annotation Budget Allocation from Small to Large LLMsJingtan Wang, Arun Verma, Xiaoqiang Lin +4cs.CL2026-09-01
#27Selective Agent Guidance via Entropy: Learning Autonomous Policies from Imperfect VLM TeachersGiovanni Bonetta, Matteo Merler, Davide Zago +2cs.AI2026-09-01
#28NashDreamer: Model-Based Reinforcement Learning for Zero-Sum Imperfect-Information GamesTomáš Holeček, Viliam Lisýcs.LG2026-09-01
#29Provably Safe Sim-to-Real TransferTingting Ni, Maryam Kamgarpourcs.LG2026-09-01
#30EdiTikZ: Scientific Figure Editing from Revision TrajectoriesChristian Greisinger, Zhixue Zhao, Steffen Egercs.AI2026-09-01
#31Where the Verifier Fails: A Category-Level Audit of Reward Signals in RLVREsther Xincs.CL2026-09-01
#32VerTox: Verifiable Reward-Guided Corpus Poisoning Against Neural Ranking ModelsZhiqi Huang, Vivek Datla, Zhichao Xu +3cs.CL2026-09-01
#33From Base Rollouts to RL Reasoning: A Budgeted Search PerspectiveWenhe Sun, Cunxiang Wang, Zijun Yao +1cs.CL2026-09-01
#34Explore More, Drift Less: Outcome-Only Reinforcement Learning Can Suffice for Long-Horizon Interactive AgentsLiming Pu, Xiaoxia Li, Yifu Liu +2cs.LG2026-09-01
#35CaRL-EM: Cost-Aware Reinforcement Learning for Entity Matching with LLMsChaohui Guo, Michel Klein, Zhisheng Huangcs.CL2026-09-01
#36PersuaRL: Reinforcement Learning-Driven Multi-Expert Selection for Persuasive Dialogue Generation in InsuranceRohan Kirti, Akash Ghosh, Aryan Vats +5cs.CL2026-09-01
#37Reinforcement Learning and Rule-Based Peer-to-Peer Pricing in Residential PV-BES CommunitiesPablo Benalcazar, Maciej Kalka, Wilian Guamán +1cs.LG2026-09-01
#38Accelerating Reinforcement Learning via MPC Solver-Gradient Guidance for Weights-varying MPCBaha Zarrouki, Arslan Thobani, Jasper Hoffmann +6cs.RO2026-09-01
#39ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement LearningFanrui Zhang, Ruixue Ding, Qiang Zhang +13cs.AI2026-09-01
#40VerNav: Verifier-First Low-Latency Vision-and-Language NavigationZhixin Wang, Chengzheyi Yao, Leyuan Liu +2cs.RO2026-09-01
#41CARE: Contrastive Anchor-based Rubric Evolution for Large Language Model Post-TrainingSiyuan Li, Xinxin Song, Chen Ruinian +5cs.AI2026-09-01
#42Sim2Signal: Sim-to-Real Benchmarks for Traffic Signal ControlFerdous Al Rafi, Susrik Mukherjee, Latika Liladhar Dekate +6cs.LG2026-09-01
#43Reinforcement Learning Enhanced LLM Agents for Complex Vehicle Routing ProblemsYi Chen, Zikang Yu, Jiahai Wang +3cs.AI2026-09-01
#44Dense Process Supervision for Search Agents via Fact Utility EstimationRongzhi Zhu, Xiangyu Liu, Yi Liu +7cs.CL2026-09-01
#45One Policy, Any Budget: Internalizing Budget-Aware Search via Reinforcement LearningXiaowei Sun, Jin Li, Yili Hong +2cs.AI2026-09-01
#46SFAD: Speculative Factuality-Aware DecodingGuanqiao Chen, Di Wang, Lijie Hucs.CL2026-09-01
#47Instella-MoE Technical ReportJiang Liu, Sudhanshu Ranjan, Prakamya Mishra +10cs.CL2026-09-01
#48Joint Training Is Not Enough: Conditioned Cross-Granularity Training for Multimodal Document UnderstandingChengguang Gan, Yunhao Liang, Hanjun Wei +2cs.CL2026-09-01
#49Online Self-Weighted Fine-TuningHaiquan Wen, Yiwei He, Bei Peng +1cs.LG2026-09-01
#50It Takes Two to Match: Co-Evolving Generative Retriever with Reinforcement LearningRunpeng Dai, Kaili Huang, Changsung Kang +1cs.IR2026-09-01

all trends · matching is case-insensitive substring after tokenization