PaperScope
LIVE · 2026-09-03 05:40 UTC

reward 13 papers this week · +8% WoW

papers mentioning "reward" in title/abstract · 30d window

Latestcs.CLcs.LGcs.AIcs.CV

Mentions per Day (30d)

Latest Papers

#TitleAuthorsCatDate
1Discriminative World Models for Web AgentsKelvin Li, Dhruv Pendharkar, Anish Pahilajani +6cs.AI2026-09-02
2Cliff: Learning Process Rewards from the First MistakePeixuan Han, Runhui Wang, Ketan Ramaneti +3cs.LG2026-09-02
3GDB-Reward: From Evaluation Metrics to Training Rewards for Graphic DesignAdrienne Deganutti, Purvanshi Mehta, Simon Hadfield +1cs.CV2026-09-02
#4SafeEvolve: Harness-Policy Co-Evolution from Agent Experience for Safety AlignmentQinghua Mao, Wanying Qu, Dadi Guo +8cs.AI2026-09-02
#5Coverage, Not Targeting: A Structural Regime in Multi-Turn Agent Credit AssignmentChenyu Zhou, Qiliang Jiang, Shuning Wu +1cs.LG2026-09-02
#6NE-R1: Enhancing Named Entity Recognition Model via Reinforcement LearningMeixuan Chen, Hehan Li, Ruizhi Zhao +8cs.CL2026-09-02
#7TempoGround: State-Aware Streaming Visual Grounding with Vision-Language ModelsLeqian Ding, Junning Qiu, Manwen Yang +2cs.CV2026-09-02
#8Codebook Agent: Amortized Topology Design for LLM Multi-Agent SystemsJinxi Yu, Yubei Li, Eric Hanchen Jiang +6cs.AI2026-09-02
#9APEx: Distillation of Agent Procedural Experience for Adaptive Deep Research Question AnsweringJie Ding, Rui Sun, Xinyuan Zhang +2cs.AI2026-09-02
#10DiffuSearch: How Hybrid Trajectory Planning Benefits from Aligned Objectives in Diffusion and Action SpaceSteffen Hagedorn, Aron Distelzweig, Alexandru P. Condurachecs.RO2026-09-02
#11LLM-as-a-Judge Is Not an Oracle: Why Self-Improving Agents Need Deterministic GuardrailsVansh Wahics.AI2026-09-02
#12PGPO: Potential-Guided Policy Optimization for Multi-Turn Agentic TasksYuyao Zheng, Haipeng Sun, Junwei Bao +4cs.AI2026-09-02
#13PhoenixNest-Video: Evidence-Grounded Multimodal Agent Framework for Automated Video Interview AssessmentFan Yuxuan, Huang Miaojun, Zhang Haimei +2cs.AI2026-09-02
#14DMRL: Document-Mediated Reinforcement Learning for Skill Optimization in Advertising RecommendationWei Zhang, Hongji Li, Song Sun +4cs.LG2026-09-02
#15Posterior Tempering Explains Variance Inflation in Linear and Generalized Linear Thompson SamplingPrateek Jaiswal, Debdeep Pati, Anirban Bhattacharya +1stat.ML2026-09-02
#16On-Policy Distillation Meets Off-Policy GRPO: Training Compact Instruction-Following RerankersVignesh Prabhakar, Jialing Pan, Anil Babu Ankisettipallics.LG2026-09-01
#17Does Playing it Safe Count as Faithfulness? Reassessing LVLM Hallucination Mitigation MethodsMehrdad Fazli, Sina Mansouri, Mohit Marvania +1cs.CV2026-09-01
#18Thinking effort aligns between humans and reasoning models in abductive reasoningHenry Arthurcs.CL2026-09-01
#19The Rise of Verbal Reinforcement LearningKshitij Tayal, Arun Sharma, Genta Indra Winata +2cs.CL2026-09-01
#20Facet-0: A Robotic Foundation Model for Contact-Rich Precise ManipulationHaoyuan Deng, Haichao Liu, Wenkai Guo +6cs.RO2026-09-01
#21Mechanism Design for Alignment and ControlDirk Bergemann, Andrew Koh, Stephen Morrisecon.TH2026-09-01
#22StudentSim: Training LLM-based Student SimulatorsKe Yang, Chenglong Wang, Michel Galley +4cs.CL2026-09-01
#23Scaling Near-Optimal SFT-RL Annotation Budget Allocation from Small to Large LLMsJingtan Wang, Arun Verma, Xiaoqiang Lin +4cs.CL2026-09-01
#24From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request MixOlga Tsymboi, Dmitrii Stoianov, Ramil Latypov +11cs.CL2026-09-01
#25Selective Agent Guidance via Entropy: Learning Autonomous Policies from Imperfect VLM TeachersGiovanni Bonetta, Matteo Merler, Davide Zago +2cs.AI2026-09-01
#26Provably Safe Sim-to-Real TransferTingting Ni, Maryam Kamgarpourcs.LG2026-09-01
#27EdiTikZ: Scientific Figure Editing from Revision TrajectoriesChristian Greisinger, Zhixue Zhao, Steffen Egercs.AI2026-09-01
#28Where the Verifier Fails: A Category-Level Audit of Reward Signals in RLVREsther Xincs.CL2026-09-01
#29Scalable Rao-Blackwellized Online Planning for High-Dimensional POMDPsJiho Lee, Nisar Ahmed, Kyle Hollins Wray +1cs.RO2026-09-01
#30Probing Factual Knowledge Transfer with Training Data InterventionsRomina Oji, Marc Braun, Marcel Bollmann +2cs.CL2026-09-01
#31VerTox: Verifiable Reward-Guided Corpus Poisoning Against Neural Ranking ModelsZhiqi Huang, Vivek Datla, Zhichao Xu +3cs.CL2026-09-01
#32From Base Rollouts to RL Reasoning: A Budgeted Search PerspectiveWenhe Sun, Cunxiang Wang, Zijun Yao +1cs.CL2026-09-01
#33Ready to Speak: Aligning LLMs for TTS-Friendly Text GenerationThibaut Thonet, Jos Rozen, Laurent Besaciercs.CL2026-09-01
#34Explore More, Drift Less: Outcome-Only Reinforcement Learning Can Suffice for Long-Horizon Interactive AgentsLiming Pu, Xiaoxia Li, Yifu Liu +2cs.LG2026-09-01
#35Jailbreaking Text-to-Image Models Through Cracks: Navigating Heterogeneous Safety Filters via Multi-Agent DebateKaiyan Wen, Shijie Zhang, Lu Yu +1cs.AI2026-09-01
#36ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement LearningFanrui Zhang, Ruixue Ding, Qiang Zhang +13cs.AI2026-09-01
#37CoBRA: Learning Tool-Use Boundaries via Counterfactual MarginsWenhao Zou, Xianglong Liu, Wendong Bi +3cs.AI2026-09-01
#38DualStake: Dual-Path Confidence Calibration in Deep Research AgentsYinuo Xu, Yuwei Liang, Jianjie Cheng +4cs.CL2026-09-01
#39Context-Grounding Gains Are Mediated by Pre-existing Machinery: Auditing GRPO, SFT, and DPOPrakhar Gupta, Vaibhav Guptacs.CL2026-09-01
#40VerNav: Verifier-First Low-Latency Vision-and-Language NavigationZhixin Wang, Chengzheyi Yao, Leyuan Liu +2cs.RO2026-09-01
#41CARE: Contrastive Anchor-based Rubric Evolution for Large Language Model Post-TrainingSiyuan Li, Xinxin Song, Chen Ruinian +5cs.AI2026-09-01
#42Sim2Signal: Sim-to-Real Benchmarks for Traffic Signal ControlFerdous Al Rafi, Susrik Mukherjee, Latika Liladhar Dekate +6cs.LG2026-09-01
#43MemoryWalker: Stop Training Agents on Contexts They Never SawZinco J, Xunjie Zhu, Shen Huang +3cs.LG2026-09-01
#44Dense Process Supervision for Search Agents via Fact Utility EstimationRongzhi Zhu, Xiangyu Liu, Yi Liu +7cs.CL2026-09-01
#45One Policy, Any Budget: Internalizing Budget-Aware Search via Reinforcement LearningXiaowei Sun, Jin Li, Yili Hong +2cs.AI2026-09-01
#46Ranked by the Matcher: A Reproducibility Audit of Knowledge Graph Extraction from Threat ReportsSafayat Bin Hakim, Houbing Herbert Songcs.CR2026-09-01
#47Controllable Image Captioning with Prompt-Conditioned Scene RewardsJongyeop Hyun, Taeyoung Kim, Hyounghun Kimcs.CV2026-09-01
#48Patterning in Practice: Debiasing Reward Models with SusceptibilitiesGeorge Wang, Elizabeth Donoway, Daniel Murfetcs.LG2026-09-01
#49Drift-Aware LLM Routing with Sparse Contexts and Shared BudgetsCheung Hao Lee, Patrick Wongcs.AI2026-09-01
#50It Takes Two to Match: Co-Evolving Generative Retriever with Reinforcement LearningRunpeng Dai, Kaili Huang, Changsung Kang +1cs.IR2026-09-01

all trends · matching is case-insensitive substring after tokenization