PaperScope
LIVE · 2026-09-23 05:40 UTC

on-policy 14 papers this week · +67% WoW

papers mentioning "on-policy" in title/abstract · 30d window

Latestcs.CLcs.LGcs.AIcs.CV

Mentions per Day (30d)

Latest Papers

#TitleAuthorsCatDate
1Train Where the Quantized Model Goes: On-Policy Distillation for Low-Bit ReasoningYuanteng Chen, Zhilei Liu, Peisong Wang +7cs.LG2026-09-22
2KwaiMind Technical ReportJunlong Wu, Zijun Li, Yuting Hu +14cs.CV2026-09-22
3PACT: From Credit Assignment to Critic AlignmentJiayan Fu, Hang Xu, Yong Zhang +4cs.LG2026-09-22
#4BAS-OPD: Budget-Aware Selective On-Policy Self-Distillation for Fine-Grained Multimodal PerceptionZihan Chen, Hengguang Zhou, Yuan Kang +5cs.CV2026-09-22
#5What Should a Self-Teacher See? Privileged Context Design for On-Policy Self-DistillationKanghui Tian, Siyuan Liu, Tianxiang Jiang +8cs.LG2026-09-22
#6onPanda: Efficient Annotation of On-Policy Alignment Data for LLMs and Agents via Token-Level CorrectionLei Yang, Mengyin Liu, Jia Wang +9cs.CL2026-09-21
#7iSDFT: Information-Proximal Self-Distillation for Continual Learning in LLMsAhmed Khaled Khamis, Xiaotong Ji, Hassan Jaber +4cs.LG2026-09-21
#8Qwen-Audio-3.1-Realtime: Towards Reliable Agentic Voice InteractionLujia Bao, Qian Chen, Luyao Cheng +14eess.AS2026-09-21
#9ME-VLM:A Unified VLM for Embodied Cognition and Agent CoordinationFoundation Model, Li Auto Inccs.CV2026-09-21
#101% of Tokens Can Be Enough: On Gradient Estimation in On-Policy DistillationHuanxin Sheng, Zhiling Ye, Haonan Wang +3cs.LG2026-09-21
#11MemCalib: Benchmarking and Optimizing Memory Use in LLM AgentsRuike Cao, Fanyu Zhao, Fugen Yao +6cs.LG2026-09-21
#12Look Where It Counts: A Free, Label-Free Visual Evidence Signal for Fine-Grained Vision-Language ReasoningSanti Ram Tiwari, Nihal Naik, Devbrat Pandey +1cs.CV2026-09-21
#13CLOOPD: Closing the Learner Loop in On-Policy DistillationKeye Zheng, Hanyu Li, Zhan Cheng +1cs.LG2026-09-21
#14ACLArena: Agent Continue Learning in Multi-stage Post-trainingHaixin Wang, Xiaoxuan Wang, Junkai Zhang +9cs.AI2026-09-21
#15Distill What You Trust: Reliability-Aware Multi-Teacher On-Policy DistillationJie Sun, Mao Zheng, Mingyang Song +8cs.CL2026-09-20
#16Tool-Augmented On-Policy Distillation for LLM Domain Adaptation in Sequence-Based Omics TasksJie Ying, Zhefan Wang, Zihong Chen +11cs.LG2026-09-20
#17One to More, More to One: Category-Aware Iterative Expert Training for Software Engineering AgentsJie Zhao, Ziyu Jiang, Suhang Zheng +3cs.SE2026-09-20
#18Spatial-Interactor: Learning Spatial Reasoning through Interaction with the Observable Physical WorldKaixiang Yao, Xu Wang, Miao Pan +7cs.AI2026-09-19
#19Calibrating Teacher--Student Discrepancy for On-Policy DistillationQiangqiang He, Jin Li, MingCai Chencs.AI2026-09-18
#20On Repulsive and Attractive Teachers: Separating Correctness from Behavior in Self-DistillationAnton Baumann, Akmal Ashirmatov, Leo Schmidt-Traub +4cs.LG2026-09-18
#21GVPO++: Group Variance Policy Optimization for LLM Post-Training and On-Policy DistillationKaichen Zhang, Yuzhong Hong, Junwei Bao +4cs.AI2026-09-18
#22RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement LearningYan Yu, Zhengxi Lu, Yizhou Liu +8cs.CL2026-09-17
#23OPTED: On-Policy Fine-Tuning for End-to-End Driving using a Render-Free TeacherDamiano Da Col, Maximilian Igl, Peter Karkus +5cs.RO2026-09-17
#24What Does Privileged Information Add to On-Policy Self-Distillation?XiuYu Zhang, Wei Chow, Junfeng Fang +2cs.CL2026-09-17
#25When EOS Tokens Disagree: Understanding Length Inflation in On-Policy DistillationYuxiao Yang, Tianrun Yu, Shangzhe Li +6cs.LG2026-09-17
#26MAGMA-GEN: Validated Recovery Supervision from Ambiguous Failures via Counterfactual Re-ExecutionLoan Bernat, Matthieu Grard, Ariane Herbulot +1cs.AI2026-09-17
#27Trajectory Learnability for Offline On-Policy Distillation with Imperfect TeachersYihao Ai, Weilong Yancs.LG2026-09-16
#28SEA-LION-v4.8: A Technical ReportAhmed Mohammad Dabeer, Ahn Jeongmi, Anocha Sutaveephamochanon +45cs.CL2026-09-16
#29Anchoring What Matters: A Dual-Level Learning Framework for Visually-Grounded Multimodal ReasoningXinxin Song, Siyuan Li, Tingxiong Xiao +1cs.AI2026-09-16
#30Beyond Token-Local Imitation: Reward-Compatible Temporal Credit Assignment for On-Policy DistillationShiqi Liu, Zeyu He, Letian Tao +9cs.LG2026-09-15
#31Weave: Learning Whole-Body Dexterous Loco-Manipulation from Human-Object InteractionsLiu Cao, Xingze Wu, Jingzhi Cui +4cs.RO2026-09-15
#32ReDraft, Don't Just Distill: Reference-Driven Revision for Continual VLLM Post-TrainingZhihao Zhang, Mingqi Wu, Qiaole Dong +15cs.AI2026-09-15
#33OPD-Aha: From Linguistic Momentum to Visual Reflection in Multimodal On-Policy DistillationChenhao Qiu, Dawei Li, Yechao Zhang +2cs.LG2026-09-15
#34Who Teaches Which Token? Verifier-Gated Multi-Expert On-Policy Distillation for Scientific ReasoningXun Xu, Zaixi Zhangcs.AI2026-09-14
#35Reducing the Output-Mode Gap in Speech Language Models via Joint-Output On-Policy DistillationDaxin Tan, Dehua Tao, Chengxi Deng +2eess.AS2026-09-14
#36Reason What Matters: Retrieval-Grounded Reasoning for Universal Multimodal EmbeddingsMingzhou Jiang, Peixi Wu, Hang Cheng +7cs.AI2026-09-14
#37Temporal Self-Distillation: Faster Inference in Discrete Diffusion Language ModelsShijian Xu, Andrea Miele, Metod Jazbec +3cs.LG2026-09-14
#38Not All Prompts Are Equal: Exploration-Guided Prompt Scaffolding for Multimodal Reinforcement Post-TrainingYuanhao Yue, Qianli Ma, Chengyu Wang +3cs.LG2026-09-14
#39Lightning Weave: Improving the Accuracy-Efficiency Frontier of Reasoning Models through Capability CompositionYecheng Wu, Song Han, Han Caics.AI2026-09-13
#40Optimizing Sparse Outcomes Through Dense Behavioral Signals via Value-Guided Preference DistillationZiyi Zhu, Daniel R. Cahn, Thomas D. Hull +4cs.CL2026-09-13
#41Know When to Stop, Where to Restart: Accelerating Multi-Turn Agentic On-Policy DistillationZhiyu Gui, Kexin Huang, Jia Guo +6cs.LG2026-09-13
#42Data-free On-policy DistillationGengsheng Li, Mao Zheng, Mingyang Song +7cs.LG2026-09-12
#43SenseNova-U1.5: Towards Native Unified Visual IntelligenceHaiwen Diao, Jiahao Wang, Chenjing Ding +62cs.CV2026-09-10
#44A Unified Per-Token Gating Family for On-Policy Distillation: FKL/RKL Mixing with Multi-Channel and Bias CoefficientsSuwan Wu, Yumeng Lin, Pengcheng Yuan +1cs.AI2026-09-10
#45Negative Self-Distillation: Learning to Reason by Avoiding FlawsRongcan Pei, Zhepei Wei, Shuyao Xu +3cs.CL2026-09-10
#46KuaiRP Series Role-playing Models Technical ReportYipeng Wang, Ziwei Zhang, Jiahui Zhang +2cs.AI2026-09-10
#47ObstaDiff: Generalizable Diffusion Policy Learning via Obstacle-aware RepresentationsJiawen Wang, Kevin Yao, Khalid Jawedcs.RO2026-09-10
#48On-Policy Distillation for Vision-Language Model Adaptation, an Effective Paradigm on Low-Quality Multimodal DataHongyuan Zhang, Xianda Guo, Yanlun Peng +6cs.CL2026-09-09
#49CompassOPD: Cross-Family On-Policy Distillation via Within-Family Likelihood ShiftsNaibin Gu, Qingyi Si, Chenxu Yang +5cs.LG2026-09-09
#50Beyond Verified Answers: Solver-Informed Self-Distillation for Bootstrapping Operations Research Language ModelsRui Zhu, Minglong Cao, Chenyu Zhou +2math.OC2026-09-09

all trends · matching is case-insensitive substring after tokenization