PaperScope
LIVE · 2026-09-04 05:40 UTC

on-policy distillation 5 papers this week · -33% WoW

papers mentioning "on-policy distillation" in title/abstract · 30d window

Latestcs.CLcs.LGcs.AIcs.CV

Mentions per Day (30d)

Latest Papers

#TitleAuthorsCatDate
1Rethinking On-Policy Distillation of Large Language Models II: One Training ExampleZixuan Fu, Bingxiang He, Yuxin Zuo +10cs.AI2026-09-03
2Sequential Beats Joint: On the Interplay between On-Policy Distillation and RLVRBoyan Li, Bingsen Chen, Chenghao Yang +3cs.CL2026-09-03
3Verify Before You Distill: Prompt-Level Teacher Gating for On-Policy DistillationZhiwei Zhang, Zechen Sun, Fei Zhao +6cs.LG2026-09-02
#4Cliff: Learning Process Rewards from the First MistakePeixuan Han, Runhui Wang, Ketan Ramaneti +3cs.LG2026-09-02
#5Learn from Whoever Is Right: Answer-Verified Multi-Teacher Distillation for Multi-Domain LLMsXixiang He, Xingming Li, Baiqi Wu +4cs.LG2026-09-02
#6CA-OPD: Confidence-Aware On-Policy Distillation for Structured Visual PredictionMenghao Li, Linjie Mu, Yin Wang +4cs.CV2026-09-02
#7On-Policy Distillation Meets Off-Policy GRPO: Training Compact Instruction-Following RerankersVignesh Prabhakar, Jialing Pan, Anil Babu Ankisettipallics.LG2026-09-01
#8Instella-MoE Technical ReportJiang Liu, Sudhanshu Ranjan, Prakamya Mishra +10cs.CL2026-09-01
#9Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-ImprovementYi Ding, Ruqi Zhangcs.LG2026-08-31
#10Influence-Directed Distillation: Solving the Diversity Bottleneck in Sampled-Token On-Policy DistillationRun Yang, Runpeng Dai, Jie Sun +5cs.CL2026-08-30
#11When Teacher Guidance Misleads: Reward-Aligned On-Policy DistillationSiyuan Gan, Yuhan Li, Xiran Wang +5cs.AI2026-08-28
#12SpikeOPD: Stable On-Policy Distillation for Autoregressive Spiking Language ModelsEnqiao Lu, Xingrui Yu, Yiwei Fu +7cs.AI2026-08-28
#13Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion ParadigmsSiye Wu, Kai Yang, Yuchen Cai +8cs.CL2026-08-27
#14Self-OPD: On-Policy Distillation for Flow Matching Models without TeacherShiyi Zhang, Mushui Liu, Yunze Tong +8cs.CV2026-08-27
#15Preserving General Capabilities during Domain Specialization with Uncertainty-Calibrated MOPDZiyuan Liu, Jiao Ou, Jian Liang +2cs.CL2026-08-27
#16PailitaoGR: Latent Think-with-Images for Generative Image RetrievalXiaomeng Fan, Yueran Liu, Shengyu Zhou +6cs.CV2026-08-27
#17SPEAR: Distilling Domain-Adaptive Reasoning Skeletons via Sequential Symbolic Alignment in Reinforcement LearningZhuochun Li, Yuelyu Ji, Yiming Zeng +1cs.CL2026-08-27
#18One Symptom, Three Levers: A Critical Review of On-Policy Self-DistillationJustin Robert, Raheel Qadercs.LG2026-08-26
#19A Token-Level Analysis of Sampled-Token Reverse-KL On-Policy DistillationBing Shao, Jiazheng Zhang, Long Ma +11cs.LG2026-08-26
#20D$^3$-MOPD: Adaptive Dynamic Domain ScheDuling for Efficient Multi-Teacher DistillationZechen Sun, Zhiwei Zhang, Fei Zhao +7cs.LG2026-08-25
#21On-policy Distillation with Verifiable RewardWenze Lin, Jiale Zhao, Xitai Jiang +5cs.LG2026-08-25
#22OPDSearch+: On-Policy Distillation with RL Refinement for Search-Augmented ReasoningQinglin Ye, Zhiyuan Gu, Jingjie Xia +6cs.AI2026-08-25
#23TailSieve: Partial-Rollout-Guided Tail Routing for LLM RolloutsTianqi Xu, Lu Lv, Haoyang Huang +15cs.AI2026-08-24
#24WAM-OPD: On-Policy Distillation for World Action ModelsLiuhaichen Yang, Zhuang Jiang, Chenchao Sheng +1cs.AI2026-08-23
#25Hints, Critics, and Teachers: Prior Injection for Sparse-Reward RL in Vision-Language Math ReasoningQiqian Fucs.AI2026-08-22
#26SecOPD: Mitigating Adaptive Prompt Injections by On-Policy DistillationYibo Peng, Long Lian, David Wagner +1cs.CR2026-08-21
#27Anchoring Instruction Outside Mask: Exact Reference Caching for Efficient In-Context Diffusion TransformersYangshuai Liu, Zheming Li, Jiaao Li +4cs.CV2026-08-21
#28STAR-OPD: Structured Aspect-Cascade-Aware On-Policy Reward Distillation for ABSA Quadruple ExtractionTong Sun, Mingyang Ma, Jiayang Yucs.CL2026-08-21
#29Exploring the Performance Frontier of Compact Unified Image Generation ModelsTaihang Hu, Zhao Wang, Zuan Gao +20cs.CV2026-08-20
#30Beyond Imitation: Filtering On-Policy Distillation by Reasoning ProgressChen Yang, Haiyuan Wan, Rengrong Xiong +2cs.AI2026-08-19
#31Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Context ReasoningZhu Zhang, Jixun Wang, Xiaoang Xu +6cs.LG2026-08-19
#32Open-MOPD: Diagnosing and Fixing Capability Imbalance in Multi-Teacher On-Policy DistillationHuan-ang Gao, Haohan Chi, Yong Yan +7cs.LG2026-08-19
#33Accelerating Visual On-Policy Distillation with Batched Speculative Jacobi RolloutsBingqi Shan, Zhehao Yu, Kenhong Lin +1cs.LG2026-08-18
#34Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language ModelsZhaoyi Li, Deyang Kong, Yuan Wei +13cs.CL2026-08-17
#35Mint-Agent: Introducing Finance-Native Agentic Foundation ModelsMint-Agent Team, Kun Wang, Gavin Zhang +7cs.CL2026-08-17
#36Step-Level On-Policy Distillation: Interpolating Between On-Policy Distillation and Supervised Fine-TuningChanghui Sun, Lanbo Liu, Hang Lei +11cs.CL2026-08-17
#37StreamOPD: A Post-Training Recipe with Spatio-Temporal Cue Gating for Streaming Video UnderstandingKeming Wu, Baoyi Wang, Kaichen Zhang +7cs.CV2026-08-17
#38Deep Thought Alignment: Trajectory-Level Latent Distillation for Video ReasoningAo Shen, Yongheng Zhang, Yinghui Li +3cs.CV2026-08-17
#39Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical ReportTaoLive AIGC LLM Team, Yuhan Sun, Wenhao Lin +7cs.CL2026-08-16
#40Self-Specialized Teachers for Domain Post-TrainingYifei Li, Rongman Xu, Lingling Zhang +5cs.AI2026-08-16
#41SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context ReasoningHaonan He, Haodi Lei, Yun Luo +13cs.CL2026-08-14
#42Self-Supervised Visual On-Policy DistillationYijiang Li, Yijun Liang, Yunjie Tian +6cs.CV2026-08-14
#43From Passive Delegates to Strategic Negotiators: Reinforcing Social Reasoning in Small Language Models with SocialRLWenyue Hua, Zachary Huang, Tyler Payne +3cs.AI2026-08-13
#44Intern-S2-Preview: Scientific Agentic Foundation ModelLei Bai, Jiaqi Cao, Chiyu Chen +122cs.LG2026-08-13
#45CROP: Task Relevance via Counterfactuals for Selective On-Policy DistillationEnhan Li, Junhao He, Hongyang Ducs.CL2026-08-13
#46HPSD: Hybrid-Policy Self-Distillation for Text-Image-to-Video Diffusion ModelsJiazi Bu, Pengyang Ling, Yujie Zhou +10cs.CV2026-08-13
#47Teach the Magnitude, Not the Direction: Verifier-Bounded Credit Assignment for Multi-Turn Multi-step LLM AgentsZechuan Wang, Siyuan Lu, Hongxuan Zhang +3cs.AI2026-08-13
#48Tail-Aware Top-$k$ On-Policy DistillationHuipeng Huang, Hongxin Weics.LG2026-08-12
#49AI4AI at Test-Time: Strong-to-Weak Capability Transfer via HarnessesCheng Qian, Wenting Zhao, Liangwei Yang +6cs.LG2026-08-12
#50Towards Understanding On-Policy Distillation through the Lens of Test-Time ScalingXinmu Ge, Zizhuo Zhang, Yu Huang +9cs.LG2026-08-12

all trends · matching is case-insensitive substring after tokenization